Opus 4.6 發布,模型自主決定是否深度思考

2 月 5 日 Anthropic 發布了 Opus 4.6,最核心的升級稱為自適應思考(Adaptive Thinking)

以前 vs 現在

以前使用 extended thinking,需要手動設定預算——讓模型想 10 秒還是 30 秒,全靠開發者自行決定。現在 Opus 4.6 自己看著辦

  • 簡單問題→秒回,不浪費算力
  • 複雜問題→自動進入深度推理模式
  • 計算資源按需分配

底層原理是模型在收到 prompt 的瞬間就完成了一次難度評估,然後動態調節推理深度。提供四檔手動調節(low/medium/high/max),預設為 high。

上下文視窗拉滿

  • 上下文:100 萬 token(beta)
  • 最大輸出:128K token
  • MRCR v2 檢索準確率:256K 上下文下 93%,拉到 100 萬仍有 76%

做個對比,Sonnet 4.5 在同樣測試下的檢索可靠性只有 Opus 4.6 的四分之一到九分之一。差距相當明顯。

Agent 場景提升顯著

基準測試分數
Terminal Bench59.8% → 65.4%
OSWorld66.3% → 72.7%

兩項都超過了 GPT-5.2 和 Gemini 3 Pro。

另一個亮點是 Compaction API——伺服器端自動壓縮對話歷史,理論上支援無限長對話。在需要數十輪互動來完成複雜程式設計任務的 agent 場景下,這項能力直接決定任務成功率。

參考來源:The New Stack Opus 4.6 報導、CocoLoop、Anthropic 官方文件