你以為AI Agent在幫你長時間自主工作?Anthropic拿出了真實數據——大多數任務45秒就結束了。
但另一個數字更值得關注:最長的那些工作階段,正以兩倍速度變長。
研究方法
Anthropic分析了Claude Code和API上的數百萬次真實互動,目標是搞清楚三件事:人們給Agent多少自主權、Agent在哪些場景被部署、可能存在哪些風險。
這是業界第一次用規模化真實使用數據來測量AI Agent自主程度,而不是依賴評測基準或沙盒實驗。
最重要的數據
中位數工作階段時長:45秒
絕大多數Agent任務是短平快的。不是什麼幾小時的複雜項目,就是一個具體的小任務。
但是: 2025年10月到2026年1月,Claude Code裡99.9百分位數的工作階段時長從不到25分鐘漲到了超過45分鐘。也就是說,最長的那0.1%任務,在三個月裡翻了一倍。
這個趨勢意味著:頂端的重度用戶正在把AI Agent推入越來越長、越來越複雜的工作流程。
用在哪裡
軟體工程佔了全部工具呼叫的49.7%。這個比例很符合直覺——程式設計師是最早大規模用Agent的群體,Claude Code本來就是為這個場景設計的。
但後面的數字更有意思:
| 場景 | 佔比 |
|---|---|
| 軟體工程 | 49.7% |
| 後端自動化 | 9.1% |
| 行銷/文案 | 4.4% |
| 銷售/CRM | 4.3% |
| 財務/會計 | 4.0% |
| 數據分析 | 3.5% |
後端自動化、財務、銷售這些場景正在悄悄滲透進來。這不是實驗室裡的demo,是真實企業在用AI Agent處理實際業務流程。
人類監督還在不在
80% 的工具呼叫有至少一道防護措施。73% 有人類介入的環節。只有 0.8% 的操作是不可逆的。
這些數字總體上是樂觀的——說明大多數企業在部署Agent時還是保留了安全閥。
但用戶行為有個有趣的變化規律:
- 新用戶:約20%的任務選擇全自動審批
- 有經驗的用戶(750次以上工作階段):全自動比例超過40%
這看起來像是隨著信任度提升,人類在放權。但同期中斷率也在漲——從5%漲到了9%。
這說明有經驗的用戶不是在無腦放手,而是在換一種監督方式:從逐步審批每個動作,轉向整體監控、有問題再介入。
AI Agent自己也在主動暫停
一個意外發現:Claude Code在複雜任務上請求澄清的頻率,是簡單任務的兩倍以上,而且這個主動暫停的頻率比人類手動中斷還要高。
也就是說,模型自己能識別出「這個我不確定,得問一下」的時機。這比單純的人類監督更細粒度。
部署懸掛 (Deployment Overhang)
研究提出了一個概念:部署懸掛(deployment overhang)。
意思是:現在的模型處理的自主程度,其實已經低於它的能力上限。隨著時間推移,用戶會逐漸把任務推到邊界——更長的工作階段、更少的干預、更複雜的任務鏈。
這對安全的含義是:光靠發布前的測試不夠用了,需要建立部署後的持續監控基礎設施。就像開車不只靠出廠檢測,還要靠行車記錄器和交通法規執法。
參考來源:CocoLoop、Measuring AI agent autonomy in practice(Anthropic Research);The Autonomy Gap: What Anthropic Learned Watching Millions of AI Agent Interactions(Shashi.co)