Grok 4.20、マルチエージェント方式で幻覚率を12%から4.2%に低減

今年2月、xAIはGrok 4.20をリリースした。Grok 5ではなく、構造的にまったく異なる製品である。1つのモデル内で役割分担された4つのエージェントが互いに疑問を投げかけ、議論し、最終的に1つの回答を合成するという方式だ。

このアイデアは一見すると奇抜に聞こえるが、背後には具体的なエンジニアリング設計がある。

4つの役割、1つの頭脳

まず構造について。Grok 4.20は4つの独立したモデルではなく、約3兆パラメータのMoEベースモデルであり、推論ごとに約5000億パラメータを活性化する。4つのエージェントは、LoRAスタイルの軽量アダプタ層を介してこのベースモデル上で動作する。本質的には、同じモデルの4つの「人格」である。

4つの役割は以下の通り。

  • Grok(キャプテン):タスク分解、全体戦略、最終的な統合出力
  • Harper(リサーチャー):リアルタイム検索とファクトチェック。Xプラットフォームの情報ストリームに広くアクセス
  • Benjamin(ロジック専門家):段階的推論、数学計算、コード生成と検証
  • Lucas(反対意見役):バイアスの特定、結論への疑問提起、過信の防止——専ら欠陥を探す

十分に複雑な問題が発生するたびに、4つのエージェントは次のプロセスを実行する。タスク分解 → 並列分析(共有KVキャッシュ)→ 複数回の議論 → 最終合成

議論はパフォーマンスではない。Lucasの存在意義は、GrokとBenjaminが生む可能性のある確証バイアスを打ち破ることにある。

幻覚率の数字は印象的

幻覚率はGrok 4.1の12%から4.2%へと低下し、65%の削減となった。

4%という数値は、現在の大規模モデルの中ではかなり低い。OpenAIとAnthropicの旗艦モデルはおおむね5〜8%の範囲にある。

その他の指標:

指標Grok 4.20
IFBench(指示追従)83%、1位
推論速度220.5トークン/秒
SWE-bench(コーディング)75%
Intelligence Index8位、スコア48
コンテキストウィンドウ200万トークン

コーディングの75%は、Claude Opus 4.6の80.8%には及ばない。総合順位は8位で、GPT-5.4は57点と差がある。つまりGrok 4.20は「最も賢い」という次元ではトップを取れなかったが、「最も信頼できる発言」という点では競争力を持つ。

共有ベースモデルがマルチモデル連携に勝る理由

マルチエージェントフレームワーク自体は新しいものではない。LangGraphやAutoGenなどは以前から存在する。しかしxAIのアプローチには決定的な違いがある。複数の独立したモデルを連携させるのではなく、同じベースモデル上で複数の役割を実行する点だ。

利点は以下の通り。

  • KVキャッシュを共有するため、レイテンシが大幅に低い
  • モデル間で大量のコンテキストをやり取りする必要がなく、情報損失が減少する
  • すべてのエージェントが同じ入力に対して同じ基礎的理解を持つ

言い換えれば、従来の「マルチエージェント」は複数の人間が協力して問題を解くようなものだったが、Grok 4.20は1人の人間の頭の中で4つの思考モードが同時に回っているようなものだ。

インフラストラクチャ

このシステムは、メンフィスにあるxAIのColossusスーパーコンピュータ上で動作する。30万基以上のGPU、消費電力2ギガワット、メモリ帯域幅194 PB/秒。200万トークンのコンテキストウィンドウは、大規模なコードベースと数年分のドキュメントを収容できる。

細かい点として、xAIは議論のラウンド数が固定か適応的かをまだ公開していない。この部分のエンジニアリング詳細はブラックボックスのままである。

料金とアクセス

  • API:入力$2/M、出力$6/M
  • 一般ユーザー:SuperGrokサブスクリプション(約$30/月)またはX Premium+

価格はClaude Opus 4.6より高く、GPT-5.4よりやや安い。

この方向性は研究に値する

幻覚率の大幅な低下は、AIに「自己懐疑」をさせるメカニズムが工学的に有効であることを示している。これは単にパラメータを積み上げるよりも価値のある方向性かもしれない。

しかし、未解決の疑問もいくつか残っている。議論ラウンドの制御ロジックは何か?Lucasの疑問提起が過度な保守性につながる可能性はないか?xAIはこれらを公開していない。

アーキテクチャについて公開されている範囲では、4エージェントの議論を統一ベースモデルと共有KVキャッシュで実現した初の商用製品である。このアプローチが有効と証明されれば、他の大手企業が追随するのは時間の問題だろう。

出典:Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models(Medium, Engineer at Heart);CocoLoop、Grok 4.20 Beta Launch: 4-Agent AI System Launches(adwaitx.com);HOW THE XAI GROK 4.20 AGENTS WORK(NextBigFuture.com);Master the 5 Core Capabilities of Grok 4.20(Apiyi.com)