Meta 10 月 2 日在研究博客上公布了六篇数学论文,均由数学家与 Muse Spark 1.1 和 1.2 的思考模式协作完成,其中五篇解决了此前已有人公开提出、尚无答案的问题。
博客对模型角色的描述比较克制,原话是:
“Proof strategies were developed and revised with help from Muse Spark” (证明思路在 Muse Spark 的协助下提出并修改。)
六篇各解了什么
六篇跨了概率论、微分方程、群论、优化、算术物理和非结合代数六个方向:
| 方向 | 论文 | 做了什么 |
|---|---|---|
| 概率论 | 高斯椭球拟合的严格阈值 | 给出高维高斯点能被椭球拟合的锐阈值 |
| 微分方程 | 径向负能量解的有限时间爆破 | 证明质量临界双调和非线性薛定谔方程的解会在有限时间内爆破 |
| 群论 | 半阿贝尔群未必是单项群 | 用一个 384 阶的群推翻 M. Kida 2024 年提出的猜想 |
| 优化 | 基于环的松弛是紧的 | 回答 Del Pia 与 Khajavirad 今年提出的问题 |
| 算术物理 | 弦两点函数等于曲线上的高度函数 | 把 p 进弦论和数论接起来,延续 Manin 上世纪 80 年代的设想 |
| 非结合代数 | 可解演化代数 | 用一个三维例子推翻 García-Martínez 与 Pérez-Rodríguez 的分类猜想 |
署名的数学家包括 Aykut Arslan(两篇)、Leonard Dinh、Joseph Phillip Brennan 与 Milana Golich、Andres Barei,算术物理那篇由 Anindya Dey 等五人完成。
流程怎么定的
Meta 列了四条做法:数学家团队主导研究方向;另一组数学家独立审稿;论文里逐段标注由研究者还是由 AI 起草;先前工作全部注明。
最后一条在概率论那篇上用到了。高斯椭球拟合阈值问题在今年 8 月被三个团队几乎同时独立做出,Meta 这篇在论文里承认了同期工作。可见这道题当时已经在人类数学家的射程之内,模型的贡献更接近”加速”,谈不上单独开辟。
博客也写明了取向:“Our goal here wasn’t to mass-produce papers, but to empower researchers”(我们想做的是给研究者添力,批量产出论文不在目标之内)。
和 Google 同一周那篇放在一起看
同一周,Google Research 公布了 Cogentic,用多个智能体协作探索数学证明。两家放在一起,路子差别很清楚。
Google 那边题目集中在在线学习、拍卖理论和机制设计,五道题大多调用 Gemini 约百次,最难的一道约千次,单一可加买家收益近似比从 5.2 压到 3.52,每份证明由领域专家核过。它强调的是系统:多个智能体怎样分工、怎样互相检查。
Meta 这边题目分散在六个互不相干的分支,没有给调用次数,也没有描述智能体架构,强调的是人:谁主导、谁审稿、哪段谁写。两种叙事对应两种验证方式,Google 的可以按调用量估成本,Meta 的可以按署名追责任。
两份材料都还缺一样东西:失败样本。模型参与过、最后没做出来的题有多少,两家都没提。缺了这个分母,五篇成功论文能说明的范围有限,外界也很难判断 Muse Spark 在数学上的实际命中率。
参考来源:Meta AI 研究博客、Google Research 博客、CocoLoop;Meta 博客核验六篇论文题目、作者、反例规模与模型版本。