Opus 4.6リリース、モデルが自ら深く考えるか判断する「アダプティブシンキング」

2月5日、AnthropicはOpus 4.6をリリースし、最大のアップグレードはアダプティブシンキング(Adaptive Thinking)です。

従来 vs 現在

以前のextended thinkingでは、手動で予算を設定する必要がありました。開発者がモデルに10秒考えるか30秒考えるかを決めなければなりませんでした。現在のOpus 4.6は自ら判断します

  • 簡単な質問→即座に応答、計算リソースを無駄にしない
  • 複雑な質問→自動的に深い推論モードに入る
  • 計算リソースを必要に応じて割り当て

基本原理は、モデルがプロンプトを受け取った瞬間に難易度評価を実行し、推論の深さを動的に調整することです。4段階の手動調整(low/medium/high/max)が用意され、デフォルトはhighです。

コンテキストウィンドウを最大限に拡大

  • コンテキスト:100万トークン(ベータ版)
  • 最大出力:128Kトークン
  • MRCR v2検索精度:256Kコンテキストで93%、100万でも76%

比較として、Sonnet 4.5の同じテストにおける検索信頼性はOpus 4.6の4分の1から9分の1に過ぎません。その差は小さくありません。

エージェントシナリオで顕著な改善

ベンチマークスコア
Terminal Bench59.8% → 65.4%
OSWorld66.3% → 72.7%

両方ともGPT-5.2とGemini 3 Proを上回っています。

もう一つの注目すべき機能はCompaction APIです。サーバー側で会話履歴を自動圧縮し、理論上は無制限の長さの会話をサポートします。複雑なプログラミングタスクを完了するために数十回のインタラクションを必要とするエージェントシナリオでは、この機能がタスクの成功率を直接左右します。

参考元:The New Stack Opus 4.6報道、CocoLoop、Anthropic公式ドキュメント