大規模言語モデルのコンテキストウィンドウが100万トークンに到達

2年前、主流モデルのコンテキストウィンドウは4K~8K程度だった。現在では、100万トークンがフラッグシップモデルの標準になりつつある。

現在の状況

  • Gemini 2.5 Pro:100万トークン(200万トークンまで拡張可能)
  • Claude Opus 4.6:100万トークン(ベータ版)
  • GPT-5.4:100万トークン(実験的サポート)
  • Llama 4 Scout:1000万トークン
  • Kimi K2:128K → 256K

Llama 4 Scoutの1000万トークンは印象的に聞こえるが、その長いコンテキストで情報検索の精度をどの程度維持できるかは大きな疑問符がつく。

長ければ良いのか?

コンテキストの長さと実用的な使いやすさは別問題だ。重要な指標は長文脈検索精度、つまりモデルが非常に長いテキストの中から必要な情報を正確に見つけられるかどうかである。

Opus 4.6のデータ:256Kコンテキストでの8-needle検索精度は93%だが、100万トークンでは76%に低下する。76%は低く聞こえないかもしれないが、入力した情報の約4分の1が「忘れられる」可能性があることを意味する。

もう一つの現実的な問題はコストだ。100万トークンの入力は無料ではない。現在のAPI価格では、コンテキストウィンドウを満たすのに数ドルから数十ドルかかる可能性がある。制御なしにエージェントが数十回の対話を実行すれば、トークン請求額は驚くべきものになるだろう。

Compaction技術

AnthropicのCompaction APIとGPT-5.4のauto_compactメカニズムはこの問題に取り組んでいる。コンテキストがほぼ満杯になると、初期のコンテンツを自動的に圧縮し、重要な情報を保持する。理論的には「無限長の対話」をサポートするが、実際の効果は圧縮中に失われる情報量に依存する。

より長いコンテキストウィンドウ自体が目的ではない。長いコンテキストで情報を正確に呼び出せることこそが重要である。 この軍拡競争の終着点は「誰の数字が大きいか」ではなく、「誰が超長文脈でも信頼性を維持できるか」である。

参考元:Anthropic公式ドキュメント、CocoLoop、各モデル発表レポート