AI 에이전트가 장시간 자율적으로 작업을 수행하고 있다고 생각하십니까? Anthropic이 실제 데이터를 제시했습니다. 대부분의 작업은 45초 만에 끝납니다.
하지만 더 주목할 만한 또 다른 수치가 있습니다. 가장 긴 세션은 두 배의 속도로 길어지고 있습니다.
연구 방법
Anthropic은 Claude Code와 API에서 수백만 건의 실제 상호작용을 분석하여 세 가지 사항을 파악하고자 했습니다. 사용자가 에이전트에 얼마나 많은 자율성을 부여하는지, 에이전트가 어떤 시나리오에 배포되는지, 잠재적인 위험은 무엇인지입니다.
이는 업계 최초로 벤치마크나 샌드박스 실험에 의존하지 않고 대규모 실제 사용 데이터를 사용하여 AI 에이전트의 자율성을 측정한 것입니다.
핵심 데이터
세션 시간 중앙값: 45초
대다수의 에이전트 작업은 짧고 빠릅니다. 몇 시간이 걸리는 복잡한 프로젝트가 아니라 구체적인 소규모 작업입니다.
하지만: 2025년 10월부터 2026년 1월까지 Claude Code에서 99.9 백분위수 세션 시간은 25분 미만에서 45분 이상으로 증가했습니다. 즉, 가장 긴 0.1%의 작업이 3개월 만에 두 배로 늘어난 것입니다.
이러한 추세는 최상위 헤비 유저들이 AI 에이전트를 점점 더 길고 복잡한 워크플로우로 밀어넣고 있음을 시사합니다.
사용 분야
소프트웨어 엔지니어링이 전체 도구 호출의 49.7%를 차지합니다. 이 비율은 직관적입니다. 프로그래머는 에이전트를 대규모로 채택한 최초의 그룹이며 Claude Code는 원래 이 시나리오를 위해 설계되었습니다.
하지만 아래의 수치가 더 흥미롭습니다.
| 시나리오 | 비율 |
|---|---|
| 소프트웨어 엔지니어링 | 49.7% |
| 백엔드 자동화 | 9.1% |
| 마케팅/카피라이팅 | 4.4% |
| 영업/CRM | 4.3% |
| 재무/회계 | 4.0% |
| 데이터 분석 | 3.5% |
백엔드 자동화, 재무, 영업 등의 분야가 조용히 침투하고 있습니다. 이는 실험실의 데모가 아니라 실제 기업이 AI 에이전트를 사용하여 실제 비즈니스 프로세스를 처리하고 있음을 보여줍니다.
인간의 감독은 여전히 존재하는가?
도구 호출의 80%에는 최소한 하나의 안전장치가 있습니다. 73%에는 인간이 개입하는 단계가 포함됩니다. 되돌릴 수 없는 작업은 0.8%에 불과합니다.
이 수치는 대체로 낙관적입니다. 대부분의 기업이 에이전트를 배포할 때 여전히 안전판을 유지하고 있음을 보여줍니다.
하지만 사용자 행동에는 흥미로운 변화 패턴이 있습니다.
- 신규 사용자: 약 20%의 작업에서 완전 자동 승인 선택
- 경험 많은 사용자(750회 이상 세션): 완전 자동 승인 비율 40% 초과
이는 신뢰도가 높아짐에 따라 인간이 권한을 위임하는 것으로 보입니다. 그러나 같은 기간 중단율도 상승하여 5%에서 9%로 증가했습니다.
이는 경험 많은 사용자가 무조건 통제를 포기하는 것이 아니라, 각 작업에 대한 단계별 승인에서 전반적인 모니터링과 문제 발생 시 개입 방식으로 감독 스타일을 전환하고 있음을 시사합니다.
AI 에이전트 스스로도 일시 중지
예상치 못한 발견으로, Claude Code는 복잡한 작업에서 단순 작업보다 두 배 이상 자주 명확성을 요청하며, 이 자체 시작 일시 중지 빈도는 인간의 수동 중단 빈도보다 높았습니다.
즉, 모델 자체가 '이것은 확실하지 않으니 물어봐야 한다'는 시점을 식별할 수 있습니다. 이는 단순한 인간의 감독보다 더 세분화되어 있습니다.
배포 오버행 (Deployment Overhang)
이 연구는 배포 오버행(deployment overhang)이라는 개념을 제시합니다.
이는 현재 모델에 부여된 자율성 수준이 실제로는 모델의 능력 상한선보다 낮다는 것을 의미합니다. 시간이 지남에 따라 사용자는 점차적으로 작업을 한계까지 밀어붙일 것입니다. 더 긴 세션, 더 적은 개입, 더 복잡한 작업 체인으로 말입니다.
안전에 대한 시사점은 출시 전 테스트만으로는 충분하지 않으며, 배포 후 지속적인 모니터링 인프라를 구축해야 한다는 것입니다. 이는 운전이 출고 검사뿐만 아니라 블랙박스와 교통 법규 집행에도 의존하는 것과 같습니다.
출처: CocoLoop, Measuring AI agent autonomy in practice (Anthropic Research); The Autonomy Gap: What Anthropic Learned Watching Millions of AI Agent Interactions (Shashi.co)