Metaは10月2日、研究ブログで数学論文6本を公開した。いずれも数学者とMuse Spark 1.1および1.2の思考モードが協働して完成させたもので、このうち5本は既に公開されていながら未解決だった問題に答えている。
ブログはモデルの役割について抑えた書き方をしている。原文は次の通り。
Proof strategies were developed and revised with help from Muse Spark
6本がそれぞれ解いたこと
6本の論文は確率論、微分方程式、群論、最適化、数論物理、非結合代数という6つの異なる分野にまたがっている。
| 分野 | 論文 | 内容 |
|---|---|---|
| 確率論 | ガウス楕円体フィッティングの鋭い閾値 | 高次元ガウス点が楕円体でフィッティングできる鋭い閾値を示した |
| 微分方程式 | 径方向負エネルギー解の有限時間爆発 | 質量臨界の双調和非線形シュレーディンガー方程式の解が有限時間で爆発することを証明した |
| 群論 | 半アーベル群は必ずしも単項群ではない | 384次の群を用いて、M. Kidaが2024年に提示した予想を反証した |
| 最適化 | 環に基づく緩和はタイトである | Del PiaとKhajaviradが今年提示した問題に答えた |
| 数論物理 | 弦の2点関数は曲線上の高さ関数に等しい | p進弦理論と数論を結び付け、Maninが1980年代に示した構想を発展させた |
| 非結合代数 | 可解進化代数 | 3次元の例を用いて、García-MartínezとPérez-Rodríguezの分類予想を反証した |
署名した数学者にはAykut Arslan(2本)、Leonard Dinh、Joseph Phillip BrennanとMilana Golich、Andres Bareiが含まれる。数論物理の論文はAnindya Deyを含む5人のチームによって完成した。
プロセスはどう決められたか
Metaは4つの方針を挙げている。数学者チームが研究の方向性を主導する、別の数学者グループが独立して査読する、論文では各段落が研究者とAIどちらによって執筆されたかを明記する、先行研究はすべて明記する、というものだ。
最後の方針は確率論の論文で実際に働いた。ガウス楕円体フィッティングの閾値問題は今年8月、3つのチームがほぼ同時に独立して解いており、Metaの論文もこの同時期の研究を認めている。つまりこの問題は当時すでに人間の数学者の射程内にあり、モデルの貢献は新たな道を切り開いたというより「加速」に近かったことになる。
ブログはまた、こうした取り組みの狙いについても明記している。「Our goal here wasn't to mass-produce papers, but to empower researchers」(論文を量産することではなく、研究者を後押しすることが目的だ)。
同じ週に発表されたGoogleの論文と並べて見ると
同じ週に、Google Researchは複数のエージェントが協力して数学的証明を探索する「Cogentic」を公開した。両者を並べると、アプローチの違いがはっきり見えてくる。
Google側の問題はオンライン学習、オークション理論、メカニズムデザインに集中している。5つの問題のうち大半でGeminiを約100回呼び出し、最も難しい1問では約1000回に達した。単一の加法的買い手収益の近似比は5.2から3.52まで改善され、各証明は分野の専門家によって検証された。Google側が強調するのはシステムであり、複数のエージェントがどのように分業し、互いに検証し合うかという点だ。
一方Meta側の問題は互いに関連のない6つの分野に分散している。呼び出し回数は開示されておらず、エージェントのアーキテクチャについても説明がない。Meta側が強調するのは人であり、誰が主導し、誰が査読し、どの段落を誰が執筆したかという点だ。この2つの語り方は検証方法の違いにも対応している。Googleの場合は呼び出し量からコストを推定できるが、Metaの場合は署名から責任の所在をたどることができる。
両者の資料にはもう一つ共通して欠けているものがある。失敗例だ。モデルが取り組んだものの最終的に解けなかった問題がどれだけあったのか、両社とも言及していない。この分母が欠けている以上、5本の成功論文が示せる範囲は限られており、Muse Sparkが数学で実際にどれほどの命中率を持つのかを外部から判断するのは難しい。
参考資料: Meta AI研究ブログ、Google Researchブログ、CocoLoop。6本の論文のタイトル、著者、反例の規模、モデルバージョンはMetaのブログ記事で確認した。