METR 연구: AI 도구가 숙련된 프로그래머의 속도를 19% 늦췄다

AI 안전 연구 기관 METR이 수행한 실험은 많은 사람들에게 놀라운 결론을 제시했다. 경험이 풍부한 개발자가 AI 코딩 도구를 사용한 후 작업 완료 속도가 오히려 19% 감소했다는 것이다.

실험 설계

METR은 경험이 풍부한 소프트웨어 개발자들을 모집하여 동일한 프로그래밍 작업을 두 가지 조건에서 완료하도록 했다.

  • 실험 그룹: AI 코딩 도구 자유롭게 사용 가능
  • 대조 그룹: AI 도구 사용 불가

작업은 버그 수정, 기능 개발, 코드 리팩토링 등 일반적인 개발 시나리오를 포괄했다.

왜 더 느려졌나

연구는 주로 다음과 같은 몇 가지 요인을 확인했다.

1. 검토 비용
AI가 생성한 코드를 맹목적으로 수용할 수 없으며, 한 줄씩 검토가 필요하다. 경험이 풍부한 개발자는 코드 품질에 대한 요구가 높아 검토와 검증에 소요된 시간이 AI가 절약한 작성 시간을 초과했다.

2. 컨텍스트 스위칭
스스로 생각하는 것과 AI 출력을 검토하는 것 사이의 빈번한 전환이 개발자의 플로우 상태를 방해했다.

3. 과도한 의존 경향
일부 개발자는 AI가 제안을 한 후 직접 코드를 작성하는 대신 AI를 "조정"하는 데 시간을 소비하고 있음을 발견했다. 직접 작성하는 것이 종종 더 빠름에도 불구하고 말이다.

주요 제한 사항

이 연구에는 몇 가지 중요한 한계가 있다.

  • 표본 크기가 작음
  • 작업 유형이 제한적
  • 사용된 AI 도구가 최신 또는 최고 성능 버전이 아닐 수 있음
  • "경험이 풍부한" 개발자는 이미 작업 속도가 빨라 개선 여지가 적음

주니어 개발자의 경우 AI 도구의 효율성 영향은 완전히 다를 수 있다. METR의 연구는 "경험이 풍부한" 집단에 초점을 맞춘 것이며, 그 결과를 모든 개발자에게 일반화할 수 없다.

어떻게 이해해야 할까

이 연구는 AI 코딩 도구가 쓸모없다는 의미가 아니다. 오히려 효율성 향상이 자동으로 이루어지지 않는다는 것을 보여준다. 올바른 사용법을 배우고, 적절한 시나리오에서 도구를 적용하며, 효과적인 인간-AI 협업 워크플로우를 구축해야 한다.

최고의 개발자는 "AI를 가장 많이 사용하는 사람"이 아니라, 언제 사용해야 하고 언제 사용하지 말아야 하는지를 아는 사람이다.

출처: CocoLoop, METR 연구 보고서