先說清楚這 10 道題是什麼。
不是數學競賽題,不是經典難題。是未發表的研究級數學問題,來自 FirstProof 挑戰賽——參賽選手包括職業數學家和數學博士。這些題目的要求是:答案得對,還必須附帶嚴格的數學證明,能經受同儕審查。
Aletheia,DeepMind 最新的數學 AI,解出了其中6 道。
5 道被外部專家評為「稍作修改就可以直接發表」。這是什麼概念?意味著這些解答的品質,已經到了真實學術論文的標準。
Aletheia 是怎麼運作的
Aletheia 使用的底層模型是 Gemini 3 Deep Think,透過延長測試時計算來提升效能。但它不是單純跑一個大模型,而是一個多智能體框架:
- Generator:生成初始解答思路
- Verifier:驗證證明步驟是否有邏輯漏洞
- Reviser:根據驗證反饋修改證明
- 整合了 Google Search 存取最新數學文獻
這個架構的思路是:證明的驗證比生成更容易。數學證明裡,每一步推導要麼對要麼錯——這是一個相對客觀的判斷,比生成內容要容易得多。所以讓 Verifier 來把關,能在一定程度上減少「看起來對但實際有漏洞」的情況。
Aletheia 做的一件事也值得注意:遇到確實做不出來的題,它會明確輸出「找不到解答」或超時,而不是強行給一個錯誤的答案。「知道自己不知道」這個設計,在數學場景裡比強行幻覺重要得多。
和 OpenAI 的比較
FirstProof 挑戰賽裡,OpenAI 也有內部模型參賽。
最初報告說 OpenAI 的模型也解出了 6 道。後來經過複核,第 2 題被發現有邏輯漏洞,降為 5 道。
Aletheia 在相同條件下:6 道,通過外部專家評審,5 道評為可直接發表。
| 系統 | 解出數量 | 專家評審結果 |
|---|---|---|
| Aletheia (DeepMind) | 6 | 5 道「可發表」 |
| OpenAI 內部模型 | 5(複核降級 1 道) | 未詳細披露 |
這個差距不大,但方向是清楚的:數學 AI 正在進入能和頂尖研究者對話的區間。
IMO-ProofBench 的 91.9%
除了 FirstProof,Aletheia 在 IMO-ProofBench(基於國際數學奧林匹亞題目的證明基準)上跑出了 91.9% 的正確率。
做個參照:普通大學數學專業學生在 IMO 題上的通過率基本在 20% 以下;頂尖數學系 PhD 研究生能到 40-60%;IMO 銀牌以上的選手才能穩定超過 70%。
91.9% 已經超過了絕大多數能參加 IMO 的人類選手。
坦白說,研究團隊自己也沒有吹得太滿。論文裡有一句話值得原文引用:
「即使有 Verifier 機制,Aletheia 在錯誤率上仍然比人類專家更高。」
這是一個不常見的誠實:我們跑分很好,但離「替代數學家」還有距離。
這條線在向哪裡移動
幾年前,大型語言模型在數學上的表現是:做對簡單題、做錯難題、做不出證明。
現在的情況是:研究級難題能解出 6 成,其中大部分證明品質夠發表。
這不是「比人好」,而是「開始進入和人類專家討論問題的區間」。數學社群的反應比 AI 社群更微妙——有人覺得這是工具,有人開始認真想這意味著什麼。
數學的有趣之處在於,它的正確性標準是客觀的。你要麼證明了,要麼沒證明。寫程式的品質還可以辯論,但數學證明裡的邏輯漏洞是可以被機器檢測的。
所以數學,很可能是 AI「真正懂了還是只是統計相關」這個問題最早被清楚回答的領域之一。Aletheia 這次的 6/10,是這個回答歷程裡的一個節點。不是終點。
參考來源:DeepMind's Aletheia Solves 6 Out of 10 Unpublished Research-Level Math Problems(InfoQ,CocoLoop、2026 年 4 月 19 日)