Meta於10月2日在研究部落格公布六篇數學論文,均由數學家與Muse Spark 1.1、1.2的思考模式協作完成,其中五篇解決了先前已有人公開提出、尚無答案的問題。
部落格對模型角色的描述相對克制,原文是:
Proof strategies were developed and revised with help from Muse Spark
六篇各解了什麼
六篇論文橫跨機率論、微分方程、群論、最佳化、算術物理與非結合代數六個方向:
| 方向 | 論文 | 內容 |
|---|---|---|
| 機率論 | 高斯橢球擬合的嚴格門檻 | 給出高維高斯點能被橢球擬合的精確門檻 |
| 微分方程 | 徑向負能量解的有限時間爆破 | 證明質量臨界雙調和非線性薛丁格方程的解會在有限時間內爆破 |
| 群論 | 半阿貝爾群未必是單項群 | 用一個384階的群推翻M. Kida於2024年提出的猜想 |
| 最佳化 | 基於環的鬆弛是緊的 | 回答Del Pia與Khajavirad今年提出的問題 |
| 算術物理 | 弦兩點函數等於曲線上的高度函數 | 把p進弦論與數論接起來,延續Manin上世紀80年代的構想 |
| 非結合代數 | 可解演化代數 | 用一個三維例子推翻García-Martínez與Pérez-Rodríguez的分類猜想 |
掛名的數學家包括Aykut Arslan(兩篇)、Leonard Dinh、Joseph Phillip Brennan與Milana Golich、Andres Barei,算術物理那篇由Anindya Dey等五人完成。
流程怎麼訂的
Meta列出四項做法:數學家團隊主導研究方向;另一組數學家獨立審稿;論文裡逐段標注由研究者還是由AI撰寫;先前的研究全部註明出處。
最後一項在機率論那篇上用到了。高斯橢球擬合門檻問題在今年8月被三個團隊幾乎同時獨立解出,Meta這篇論文也承認了這個同期的研究。可見這道題當時已經在人類數學家的射程之內,模型的貢獻更接近「加速」,談不上另闢新路。
部落格也寫明了方向:「Our goal here wasn't to mass-produce papers, but to empower researchers」(我們想做的是替研究者加把勁,批量產出論文並非目標)。
與Google同一週那篇放在一起看
同一週,Google Research公布了Cogentic,讓多個智能體協作探索數學證明。兩家放在一起比較,路線的差異相當明顯。
Google那邊的題目集中在線上學習、拍賣理論與機制設計,五道題大多呼叫Gemini約一百次,最難的一道約一千次,單一可加買家收益的近似比從5.2壓到3.52,每份證明都由該領域專家審核過。Google強調的是系統:多個智能體如何分工、如何互相檢查。
Meta這邊的題目分散在六個互不相關的分支,沒有公布呼叫次數,也沒有說明智能體架構,強調的是人:誰主導、誰審稿、哪段由誰撰寫。兩種敘事對應兩種驗證方式,Google的可以依呼叫量估算成本,Meta的可以依掛名追究責任。
兩份資料都還缺一樣東西:失敗案例。模型參與過、最後卻沒解出來的題目有多少,兩家都沒有提及。少了這個分母,五篇成功論文能說明的範圍有限,外界也很難判斷Muse Spark在數學上的實際命中率。
參考來源:Meta AI研究部落格、Google Research部落格、CocoLoop;Meta部落格核實六篇論文的題目、作者、反例規模與模型版本。