OpenAI 10 月 6 日在 GitHub 上公开了一批由内部前沿模型产出的数学研究成果,仓库名 openai/math,采用 Apache 2.0 许可。仓库里有 722 篇手稿,归为 372 个研究“家族”,同一个问题的不同证明、推广和修订版放在一起。
据 OpenAI 披露,研究过程中模型一共被派了约 4000 道题。每个被接受的结果,平均消耗的算力约相当于 ChatGPT Pro 思考 3 个小时。
覆盖了哪些方向
手稿横跨数论、计算复杂性、数学物理、几何以及理论计算机科学。媒体报道里点到的例子包括:圆周率 π 的无理性测度相关问题、若干 NP 难问题、Mahler 猜想、等差数列、自由群因子,以及量子 Heisenberg 铁磁体和相对论性 Vlasov-Maxwell 方程。
其中不少证明配了 Lean 形式化版本。Lean 是一种可以让计算机逐步检查证明逻辑的编程语言,形式化通过就说明推理链条没有漏洞。不过并非每篇手稿都有对应的 Lean 文件,OpenAI 在说明里写得很直接:
“some of the unformalized results could have issues”
意思是,没有形式化的结果里可能有问题。公司承诺后续会修正发现的错误,并逐步补上更多形式化证明。仓库同时附了论文修订流程和引用规范,方便研究者追踪某个结果被改过几次、引用时该写哪个版本。
把几次节点串起来
这次发布离 OpenAI 上一次在数学上的大动静有四个多月。今年 5 月,OpenAI 的模型解决了一个悬而未决约 80 年的 Erdős 问题,当时是单点突破,一题一题地报。到了 10 月,变成几百篇手稿批量入库,发布方式本身成了新闻的一部分。
形式也有变化。这次发布前,OpenAI 咨询了普林斯顿高等研究院(IAS)的独立“数学与人工智能顾问组”。该顾问组 9 月 29 日刚发布一份建议,收到过数学界 600 多份反馈,要求 AI 生成的数学成果公开模型名称、提示词、推理摘要、算力成本,以及模型在同类问题上的失败率。
对照这份清单,OpenAI 这次交出了算力口径(平均 3 小时 Pro 思考)、题目总量(约 4000 道)和大量 Lean 证明;模型本身仍未公开,公告只称“内部模型”,并说正在推进负责任地开放。约 4000 道题里有多少没做出来、哪些被中途放弃,目前从公开材料里看不出来。
数学界对这种产量早有担心。陶哲轩今年 8 月和 9 月两次公开谈过这个话题,大意是 AI 会让证明的产量远远超过人类审读的能力,好的难题也会被快速“开采”掉。722 篇手稿一次性放出,审读压力具体会落到谁头上,目前没有人给出办法。
后续安排
OpenAI 表示会资助相关研讨会和专项项目,帮助数学界理解和消化 AI 生成的结果。仓库里的手稿能否进入正式期刊、署名如何处理,公司没有给出具体方案,外部数学家的逐篇核查结果也还没有公布。
参考来源:OpenAI 官方博客、Interesting Engineering、Unite.AI、CocoLoop;手稿数量、题目总量与算力口径以 OpenAI 公开说明为准,顾问组建议内容以 IAS 顾问组公开文件为准。