Grok 4.20 用多代理把幻覺率從 12% 砍到 4.2%

今年二月,xAI 推出了 Grok 4.20,不是 Grok 5,而是一個結構上完全不同的東西:在同一個模型裡跑四個有角色分工的 agent,讓它們互相質疑、辯論,最後合成一個答案

這個想法聽起來有點玄,但背後有一套具體的工程設計。

四個角色,一個大腦

先說結構:Grok 4.20 不是四個獨立的模型,而是一個約 3 兆參數的 MoE 大底座,每次推理啟動約 5000 億參數。四個 agent 透過 LoRA 風格的輕量適配層在這個底座上運行——本質上是同一個模型的四種「人格」。

四個角色分別是:

  • Grok(隊長):任務拆解、整體策略、最終綜合輸出
  • Harper(研究員):即時搜尋和事實查核,大量接入 X 平台資訊流
  • Benjamin(邏輯專家):逐步推理、數學計算、程式碼生成和驗證
  • Lucas(反方):專門找漏洞——識別偏見、質疑結論、防止過度自信

每次遇到夠複雜的問題,這四個 agent 走一套流程:任務分解 → 並行分析(共享 KV 快取)→ 多輪辯論 → 最終綜合

辯論不是表演,Lucas 的存在就是為了打斷 Grok 和 Benjamin 可能產生的確認偏誤。

幻覺率這個數字很驚人

幻覺率從 Grok 4.1 的 12% 降到 4.2%,降幅 65%。

4% 在目前的大模型裡算相當低了,OpenAI 和 Anthropic 的旗艦模型大概在 5-8% 區間。

其他數據:

指標Grok 4.20
IFBench(指令遵循)83%,排第一
推理速度220.5 tokens/秒
SWE-bench(程式設計)75%
Intelligence Index第 8,得分 48
上下文視窗200 萬 token

程式設計這塊 75%,比 Claude Opus 4.6 的 80.8% 還差一點。綜合排名第 8,GPT-5.4 是 57 分,差距不小。所以 Grok 4.20 在「最聰明」這個維度上沒能拿第一,但在「說話最可靠」上有競爭力。

為什麼共享底座比多模型協作強

多 agent 框架不是 Grok 4.20 發明的——LangGraph、AutoGen 這些已經做了很久。但 xAI 的做法有個關鍵區別:不是讓多個獨立模型協作,而是在同一個底座上跑多個角色

好處是:

  • 共享 KV 快取,延遲低很多
  • 不需要在模型之間傳遞大量上下文,減少資訊損耗
  • 所有 agent 對同一個輸入有相同的底層理解

換句話說,以前的「多 agent」是幾個人合作解題,Grok 4.20 是一個人腦子裡有四種思維模式同時運轉。

基礎設施

這套系統跑在 xAI 的 Colossus 超算上,位於曼菲斯:30 萬張以上 GPU,功耗 2 吉瓦,記憶體頻寬 194 PB/s。200 萬 token 的上下文視窗能裝下一個大型程式碼庫加上幾年的文件記錄。

一個細節:xAI 還沒公開辯論輪次是固定的還是自適應的,這部分工程細節還是黑盒。

定價和存取

  • API:輸入 $2/M,輸出 $6/M
  • 一般使用者:SuperGrok 訂閱(約 $30/月)或 X Premium+

價格比 Claude Opus 4.6 貴,比 GPT-5.4 便宜一些。

這個方向值得研究

幻覺率大幅下降說明讓 AI「自我質疑」這個機制在工程上是有效的。這或許是一個比單純堆參數更值得投入的方向。

但目前還有幾個未解決的問題:辯論輪次的控制邏輯是什麼?Lucas 的質疑是否會導致過度保守?這些 xAI 都沒有公開。

架構上能公開的是,這是目前已知的第一個把四 agent 辯論做到統一底座、共享 KV 快取的商業產品——如果這個思路被驗證有效,後面其他大廠跟進只是時間問題。

參考來源:Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models(Medium, Engineer at Heart);CocoLoop、Grok 4.20 Beta Launch: 4-Agent AI System Launches(adwaitx.com);HOW THE XAI GROK 4.20 AGENTS WORK(NextBigFuture.com);Master the 5 Core Capabilities of Grok 4.20(Apiyi.com)