兩年前主流模型的上下文視窗還在4K到8K這個量級,現在百萬級token已經是旗艦模型的標配了。
當前格局
- Gemini 2.5 Pro:100萬token(可擴展到200萬)
- Claude Opus 4.6:100萬token(beta)
- GPT-5.4:100萬token(實驗性支援)
- Llama 4 Scout:1000萬token
- Kimi K2:128K → 256K
Llama 4 Scout的1000萬token看起來很猛,但實際使用中那麼長的上下文能保持多少資訊檢索精度是個大問號。
長了就好嗎?
上下文長度和實際可用性是兩回事。關鍵指標是長上下文檢索準確率——模型在超長文本中還能不能準確找到需要的資訊。
Opus 4.6的數據是:256K上下文下8-needle檢索準確率93%,拉到100萬token降到76%。聽起來76%不算低,但意味著你塞進去的資訊有將近四分之一可能被「遺忘」。
另一個現實問題是成本。100萬token的輸入不是免費的——按當前的API定價,一次性塞滿上下文的費用可以是幾美元到幾十美元。如果不加控制,一個agent跑幾十輪對話,token帳單會很嚇人。
Compaction技術
Anthropic的Compaction API和GPT-5.4的auto_compact機制在嘗試解決這個問題:當上下文快滿了,自動壓縮早期內容保留關鍵資訊。理論上可以支援「無限長對話」,實際效果取決於壓縮過程中資訊損失有多少。
更長的上下文視窗本身不是目的,在長上下文中保持資訊的精確召回才是。 這場軍備競賽的終點不是「誰的數字大」,而是「誰在超長上下文下還能保持可靠」。
參考來源:Anthropic官方文件、CocoLoop、各模型發布報告