AI로 빨라졌다는 착각, 실제론 19% 느려졌다 — METR 연구 공유
한 참여자가 METR 무작위 대조시험 결과를 공유하며, AI 코딩이 실제로는 19% 느려졌는데도 사용자는 20% 빨라졌다고 착각한다는 연구를 화두로 올렸다.
더배러 방의 아침은 한 참여자가 공유한 뉴스레터 링크로 문을 열었다. AI 코딩 생산성을 다룬 METR 무작위 대조시험 결과를 소개한 글이었다. 실제로는 작업 속도가 19% 느려졌는데도, 정작 그 작업을 한 사람들은 스스로 20% 빨라졌다고 믿는다는 내용이었다. 글을 읽은 다른 참여자는 "이거 맞아요"라며 곧바로 공감을 표했고, 뉴스레터를 처음 공유한 참여자 역시 "요 며칠 같은 증상에 시달리고 있어서 감명 깊게 읽었습니다"라고 덧붙였다.
이어진 대화는 왜 이런 착시가 생기는지를 두고 실제 경험담으로 옮겨갔다. 한 참여자는 "코어와 논코어 모두 고치다보면 코어가 망가짐"이라고 짚었다. AI에게 핵심 로직과 부수 로직을 한꺼번에 맡기다 보면, 정작 손대지 않았어야 할 핵심 코드까지 흔들린다는 취지였다. 또 다른 참여자는 "코레이션은 적당히 해야 합니다..지멋대로 생성해버리는 경우도 있어요"라며 AI가 요청 범위를 벗어나 임의로 코드를 만들어내는 현상을 지적했다. 반복해서 고치고 또 고치는 과정 자체가, 겉보기엔 빠른 작업 진행처럼 보이지만 실제로는 되돌림 비용을 계속 쌓고 있다는 뜻으로 읽힌다.
공유된 글에 대한 반응도 뜨거웠다. 한 참여자는 "잘 보았습니다. 감사합니다. 뒷부분은 유료 DLC인가요? 어디가서 결제해서 볼 수 있을까요?"라며 농담 섞인 감사를 전했다. 이는 이 착시 현상이 단순한 개인 경험이 아니라, 방 안 여러 참여자가 동시에 공감할 만큼 널리 겪고 있는 문제였음을 보여준다.
METR 연구가 시사하는 바는, "AI 덕분에 빨라졌다"는 체감이 실제 작업 로그와는 다를 수 있다는 점이다. AI를 오래 쓸수록 반복 수정 과정에서 핵심 코드가 흔들리는 경험이 쌓이고, 이 누적된 되돌리기 비용은 실제 소요 시간에는 고스란히 반영되지만 정작 체감 속도에는 잘 반영되지 않는다는 해석이 가능하다. 코어와 논코어를 함께 손대다 코어가 망가진다는 경험담, 그리고 AI가 요청 범위를 벗어나 지멋대로 생성한다는 지적은, 이 착시가 왜 생기는지에 대한 방 나름의 답을 제시한 셈이다. 작업량이 늘어난 것 같은 인상과 실제 완료까지 걸리는 시간 사이의 간극은, AI 도구를 판단할 때 체감이 아니라 실측을 함께 봐야 한다는 쪽으로 무게를 싣는 것으로 보인다.
이날 대화는 결론을 내리기보다는 각자의 경험을 대조하는 방식으로 흘렀다. AI 도구가 빠르게 코드를 뽑아내는 순간의 만족감과, 그 뒤에 이어지는 반복 수정·재작업의 누적 시간이 서로 다른 시간축에서 체감된다는 점이 대화 전반에 깔려 있었다. METR 연구가 통계로 확인한 19%라는 수치는, 방 안에서 이미 개인적으로 느끼던 "뭔가 이상하게 오래 걸린다"는 감각에 근거를 붙여준 셈이다. 코어 코드 손상 경험이 반복될수록, AI 활용의 효율을 따질 때 작업 착수 시점의 체감 속도보다 작업 완료까지의 전체 소요 시간을 함께 봐야 한다는 공감대가 이 대화를 통해 넓어진 것으로 보인다.