谷歌多智能体系统解出五道理论计算机开放题

Google Research 的七名研究者 9 月 30 日在 arXiv 提交论文,介绍了一套叫 Cogentic 的多智能体系统,专门用来找研究级的数学证明。论文称,系统以 Gemini 为底座模型,在在线学习、拍卖理论和机制设计三个方向上推进了 5 个开放问题,所有证明事后都经过领域专家独立核验,并已扩写成带专家合著者的完整论文。

作者名单里有同时任职耶鲁大学的 Yang Cai,以及同时挂名 Google DeepMind 的 Vineet Gupta,另有 Aranyak Mehta、Christopher Liaw、Di Wang 等人,论文归在 cs.AI 和 cs.GT(博弈论)两个分类下。

一次生成不够,就拆成一条流水线

论文的出发点很朴素:语言模型已经能冒出不错的数学想法,但碰上需要同时试好几条猜想、几天里持续推进的难题,单次生成就撑不住了。

Cogentic 的做法是把找证明拆给不同角色:

  • 编排器掌握全局状态,决定把多少个证明者派到哪条方向上;
  • 证明者并行写候选证明;
  • 验证者从互补的角度挑错,带对抗性质;
  • 文献检索者补背景资料;
  • 账本只收录核验通过的中间结论,跨轮次保留,后面的证明可以直接引用;
  • 另有一个”顾问”角色盯着整个过程的模式,随时调整参数。

证明、核验、再证明,循环往下走。账本这个设计解决的是长程任务的老毛病:模型上一轮推出来的引理,下一轮常常忘了或者改了说法,现在只要过了核验就落盘固定。

五道题分别推进到哪

按论文给出的结果:

  1. 在线逆线性优化:首次得到高效的 O(d) 遗憾界,且与时间跨度 T 无关,每轮计算量 O(d²);
  2. 双边市场竞争复杂度:证明只要在较小的一侧恰好再加 2 个卖家,交易收益就能追平最优配置;
  3. n 个专家的随时(anytime)遗憾:给出一个随时算法,常数项与固定时长版本一致;
  4. 简单机制与最优收益:单一可加买家的收益近似比从 5.2 改进到 3.52;
  5. 自动出价的无政府代价:2 个出价者时拿到最优的 1.5,n 个出价者时为 2−1/(4n+1)。

成本方面,论文写的是多数问题调用 Gemini 在百次量级,最难的问题在千次量级,具体用的是哪一版 Gemini 没有写明。

和 OpenAI 那几组证明摆在一起

今年下半年 AI 做数学的消息密集,放在一起看差别在验证路线。

OpenAI 8 月拿 Astra 交出 10 个数学与理论计算机结果,配了 249 页论文和 Lean 形式化证书;9 月公布的纳维–斯托克斯证明,动用约一万个智能体跑了 88 小时,同样附 Lean 文件。机器可检的形式化证书,是 OpenAI 这条线反复强调的卖点。

Cogentic 的论文把重心放在另一头:系统内部靠对抗式验证者筛一遍,出系统之后由懂行的人逐份读,再和专家合写成正式论文。题目规模也收得更窄,五道题都出自作者本人的研究领域,属于领域内有人盯着、做出来能被同行判断的问题。

这种选法让结果更容易被认可,代价是外推性。论文自己承认,题目是”从作者熟悉的领域里挑的”,换到作者不熟的方向效果如何,这篇论文没有回答。

读的人跟不上写的速度

论文里有一句话,跟陶哲轩 8 月那篇讲稿担心的事几乎是同一件:

“A system like this can produce candidate results faster than they can be read.” 这类系统产出候选结果的速度,可以快过人读完它们的速度。

Cogentic 的五道题都有专家把关,所以能说”已核验”。一旦这套编排开放给更多人、题目铺得更广,瓶颈会落在审稿人身上。论文没有给出专家核验每份证明花了多少时间,而这正是判断它能扩到多大规模的那个数。

参考来源:arXiv 论文 2609.40324、CocoLoop、Google Research;五项结果的界与近似比、调用次数量级均按论文正文口径。