グーグル、AIエージェント群が未解決問題5件を解明

Google Researchの研究者7人が9月30日にarXivへ論文を投稿し、研究レベルの数学的証明を探索するためのマルチエージェントシステム「Cogentic」を発表した。論文によれば、Geminiを基盤モデルとするこのシステムは、オンライン学習、オークション理論、メカニズムデザインの3分野で5つの未解決問題を前進させた。すべての証明は事後に専門家が独立に検証し、専門家を共著者に迎えた完全な論文へと書き上げられている。

著者リストにはイェール大学も兼任するYang Cai、Google DeepMindも兼任するVineet Guptaのほか、Aranyak Mehta、Christopher Liaw、Di Wangらが名を連ねる。論文はcs.AIとcs.GT(ゲーム理論)の2分野に分類されている。

一度の生成では足りず、パイプラインに分割

論文の出発点はシンプルだ。言語モデルはすでに悪くない数学的アイデアを出せるが、複数の仮説を同時に試し、何日もかけて粘り強く進める必要がある難問では、一度の生成では太刀打ちできない。

Cogenticは証明探索を異なる役割に分担させる。

  • オーケストレーターが全体の状態を把握し、どの方向に何体の証明者を割り当てるかを決める
  • 証明者が候補となる証明を並行して書く
  • 検証者が互いに補完し合う視点から、敵対的にミスを探す
  • 文献検索者が背景資料を補う
  • 台帳は検証を通った中間結論だけを記録し、ラウンドをまたいで保持することで、以降の証明が直接引用できるようにする
  • さらに「アドバイザー」役がプロセス全体のパターンを見張り、随時パラメータを調整する

証明、検証、また証明——このサイクルを繰り返す。台帳という仕組みが解決するのは、長時間タスクにありがちな問題だ。前のラウンドでモデルが導いた補題は、次のラウンドで忘れられたり言い換えられたりしがちだが、今は検証を通過しさえすれば固定される。

5つの問題はそれぞれどこまで進んだか

論文が示す結果によると:

  1. オンライン逆線形最適化:時間幅Tに依存しない、初めての効率的なO(d)リグレット限界を達成。1ラウンドあたりの計算量はO(d²)。
  2. 双方向市場の競争複雑性:小さい側にちょうど2人の売り手を追加するだけで、取引収益が最適配分に並ぶことを証明。
  3. n人の専門家によるエニータイム・リグレット:固定期間版と同じ定数項を持つエニータイムアルゴリズムを提示。
  4. 単純なメカニズムと最適収益:単一の加法的買い手の収益近似比を5.2から3.52に改善。
  5. 自動入札の無政府状態の代償:入札者2人では最適値である1.5、n人では2−1/(4n+1)を達成。

コストについて論文は、多くの問題でGeminiの呼び出し回数が百回規模、最も難しい問題では千回規模だったとしている。どのバージョンのGeminiを使ったかは明記されていない。

OpenAIの一連の証明と並べてみると

今年後半、AIが数学を解いたというニュースが相次いでいるが、並べてみると違いは検証の進め方にある。

OpenAIは8月、Astraで数学・理論計算機科学の10件の成果を発表し、249ページの論文とLean形式化証明書を添えた。9月に発表したナビエ–ストークス方程式の証明では、約1万体のエージェントを88時間稼働させ、こちらもLeanファイルを付した。機械的に検証可能な形式化証明書は、OpenAIがこの路線で繰り返し強調してきた売りだ。

Cogenticの論文が重きを置くのは別の部分だ。システム内部では敵対的な検証者が一通りふるいにかけ、システムの外に出た後は分野に明るい人間が一件ずつ読み、専門家と共同で正式な論文に仕上げる。題材の規模もより絞られており、5つの問題はすべて著者自身の研究分野から出ており、同業者が見ていて成果を判断できる類の問題だ。

この選び方は結果への信頼を得やすくする一方、外挿性という代償を伴う。論文自体も、問題は「著者が精通する分野から選んだ」と認めており、著者が不慣れな方向でどこまで通用するかには答えていない。

読む速度が書く速度に追いつかない

論文中の一文は、陶哲軒(テレンス・タオ)が8月の文章で懸念していたことと、ほぼ同じ内容だ。

"A system like this can produce candidate results faster than they can be read."

こうしたシステムは、人が読み終えるより速く候補となる結果を生み出しうる。

Cogenticの5つの問題にはそれぞれ専門家のチェックが入っているため、「検証済み」と言い切れる。しかしこの仕組みがより多くの人、より広い題材に開放されれば、ボトルネックは査読者の側に移るだろう。論文は専門家が1件の証明を検証するのにどれだけ時間をかけたかを示していないが、それこそがこの手法がどこまで拡張できるかを測る数字のはずだ。

参考資料:arXiv論文2609.40324、CocoLoop、Google Research;5つの成果の限界値・近似比・呼び出し回数の規模はいずれも論文本文の記述に基づく。