Anthropic:多數AI Agent任務在45秒內結束

你以為AI Agent在幫你長時間自主工作?Anthropic拿出了真實數據——大多數任務45秒就結束了。

但另一個數字更值得關注:最長的那些工作階段,正以兩倍速度變長。

研究方法

Anthropic分析了Claude Code和API上的數百萬次真實互動,目標是搞清楚三件事:人們給Agent多少自主權、Agent在哪些場景被部署、可能存在哪些風險。

這是業界第一次用規模化真實使用數據來測量AI Agent自主程度,而不是依賴評測基準或沙盒實驗。

最重要的數據

中位數工作階段時長:45秒

絕大多數Agent任務是短平快的。不是什麼幾小時的複雜項目,就是一個具體的小任務。

但是: 2025年10月到2026年1月,Claude Code裡99.9百分位數的工作階段時長從不到25分鐘漲到了超過45分鐘。也就是說,最長的那0.1%任務,在三個月裡翻了一倍。

這個趨勢意味著:頂端的重度用戶正在把AI Agent推入越來越長、越來越複雜的工作流程。

用在哪裡

軟體工程佔了全部工具呼叫的49.7%。這個比例很符合直覺——程式設計師是最早大規模用Agent的群體,Claude Code本來就是為這個場景設計的。

但後面的數字更有意思:

場景佔比
軟體工程49.7%
後端自動化9.1%
行銷/文案4.4%
銷售/CRM4.3%
財務/會計4.0%
數據分析3.5%

後端自動化、財務、銷售這些場景正在悄悄滲透進來。這不是實驗室裡的demo,是真實企業在用AI Agent處理實際業務流程。

人類監督還在不在

80% 的工具呼叫有至少一道防護措施。73% 有人類介入的環節。只有 0.8% 的操作是不可逆的。

這些數字總體上是樂觀的——說明大多數企業在部署Agent時還是保留了安全閥。

但用戶行為有個有趣的變化規律:

  • 新用戶:約20%的任務選擇全自動審批
  • 有經驗的用戶(750次以上工作階段):全自動比例超過40%

這看起來像是隨著信任度提升,人類在放權。但同期中斷率也在漲——從5%漲到了9%。

這說明有經驗的用戶不是在無腦放手,而是在換一種監督方式:從逐步審批每個動作,轉向整體監控、有問題再介入。

AI Agent自己也在主動暫停

一個意外發現:Claude Code在複雜任務上請求澄清的頻率,是簡單任務的兩倍以上,而且這個主動暫停的頻率比人類手動中斷還要高。

也就是說,模型自己能識別出「這個我不確定,得問一下」的時機。這比單純的人類監督更細粒度。

部署懸掛 (Deployment Overhang)

研究提出了一個概念:部署懸掛(deployment overhang)

意思是:現在的模型處理的自主程度,其實已經低於它的能力上限。隨著時間推移,用戶會逐漸把任務推到邊界——更長的工作階段、更少的干預、更複雜的任務鏈。

這對安全的含義是:光靠發布前的測試不夠用了,需要建立部署後的持續監控基礎設施。就像開車不只靠出廠檢測,還要靠行車記錄器和交通法規執法。

參考來源:CocoLoop、Measuring AI agent autonomy in practice(Anthropic Research);The Autonomy Gap: What Anthropic Learned Watching Millions of AI Agent Interactions(Shashi.co)