Google多智慧體解出五道數學難題

Google Research的七名研究者9月30日在arXiv提交論文,介紹了一套叫Cogentic的多智慧體系統,專門用來尋找研究級的數學證明。論文指出,系統以Gemini為基礎模型,在線上學習、拍賣理論與機制設計三個方向上推進了5個公開問題,所有證明事後都經過領域專家獨立核驗,並已擴寫成帶專家共同作者的完整論文。

作者名單裡有同時任職耶魯大學的Yang Cai,以及同時掛名Google DeepMind的Vineet Gupta,另有Aranyak Mehta、Christopher Liaw、Di Wang等人,論文歸在cs.AI和cs.GT(賽局理論)兩個分類下。

一次生成不夠,就拆成一條流水線

論文的出發點很單純:語言模型已經能提出不錯的數學想法,但碰上需要同時嘗試好幾條猜想、花上好幾天持續推進的難題,單次生成就撐不住了。

Cogentic的做法是把尋找證明拆給不同角色:

  • 協調器掌握全局狀態,決定把多少個證明器派到哪個方向上;
  • 證明器並行寫出候選證明;
  • 驗證器從互補的角度挑錯,帶有對抗性質;
  • 文獻檢索器補充背景資料;
  • 帳本只收錄核驗通過的中間結論,跨輪次保留,後面的證明可以直接引用;
  • 另有一個「顧問」角色盯著整個過程的模式,隨時調整參數。

證明、核驗、再證明,循環往下走。帳本這個設計解決的是長程任務的老毛病:模型上一輪推出來的引理,下一輪常常被忘記或改了說法,現在只要通過核驗就固定下來。

五道題分別推進到哪

按論文給出的結果:

  1. 線上逆線性最佳化:首次得到有效率的O(d)遺憾界限,且與時間跨度T無關,每輪計算量O(d²);
  2. 雙邊市場競爭複雜度:證明只要在較小的一側恰好再加2個賣家,交易收益就能追平最優配置;
  3. n個專家的隨時(anytime)遺憾:給出一個隨時演算法,常數項與固定時長版本一致;
  4. 簡單機制與最優收益:單一可加買家的收益近似比從5.2改進到3.52;
  5. 自動出價的無政府代價:2個出價者時拿到最優的1.5,n個出價者時為2−1/(4n+1)。

成本方面,論文寫的是多數問題呼叫Gemini在百次量級,最難的問題在千次量級,具體用的是哪一版Gemini並未寫明。

和OpenAI那幾組證明擺在一起

今年下半年AI做數學的消息密集,放在一起看差別在驗證路線。

OpenAI 8月拿Astra交出10個數學與理論電腦科學成果,配了249頁論文和Lean形式化證書;9月公布的納維-史托克斯方程證明,動用約一萬個智慧體跑了88小時,同樣附上Lean檔案。機器可檢驗的形式化證書,是OpenAI這條線反覆強調的賣點。

Cogentic的論文把重心放在另一頭:系統內部靠對抗式驗證器篩過一輪,出系統之後由懂行的人逐份閱讀,再和專家合寫成正式論文。題目規模也收得更窄,五道題都出自作者本人的研究領域,屬於領域內有人盯著、做出來能被同行判斷的問題。

這種選法讓結果更容易被認可,代價是外推性。論文自己也承認,題目是「從作者熟悉的領域裡挑的」,換到作者不熟的方向效果如何,這篇論文沒有回答。

讀的人跟不上寫的速度

論文裡有一句話,跟陶哲軒8月那篇講稿擔心的事幾乎是同一件:

"A system like this can produce candidate results faster than they can be read."

這類系統產出候選結果的速度,可以快過人讀完它們的速度。

Cogentic的五道題都有專家把關,所以能說「已核驗」。一旦這套編排開放給更多人、題目鋪得更廣,瓶頸會落在審稿人身上。論文沒有給出專家核驗每份證明花了多少時間,而這正是判斷它能擴展到多大規模的關鍵數字。

參考來源:arXiv論文2609.40324、CocoLoop、Google Research;五項結果的界限與近似比、呼叫次數量級均按論文正文口徑。