18个模型自主做实验,最好补上82%的人类差距

Prime Intellect 公开了一份规模不小的测评:让 18 个前沿模型各自去做一遍 AI 研究,一共跑了 153 次全自主实验,每次占用 8 张 H200,最长的一次跑了八天多。

任务是 nanoGPT 的优化器 speedrun,一个由 Keller Jordan 发起的社区比赛:把一个 1.24 亿参数的 GPT 训到验证损失低于 3.28,比谁用的训练步数少。规则卡得死,只能动优化器相关的部分,不能联网,剩下的交给模型自己安排。模型拿到的工具是一个常驻的 IPython 内核,从搭实验流程、写代码、跑验证到推翻自己的假设,全部自理。

成绩单

起跑线是 3290 步。人类社区几十号人磨了几个月,把记录压到 2600 步,中间这 690 步就是本次要量的东西。

Fable 5 跑出 2726 步,吃掉其中约 82%。Opus 5 停在 2920 步,Kimi K3 2930 步,两家各补上一半左右。GPT-5.6 Sol 是 3042 步,GLM 5.3 没有跑出有效成绩。

Opus 5 和 Kimi K3 只差 10 步。粗算一下,这 10 步占总差距的 1.4%,考虑到 nanoGPT 训练本身的噪声和采样随机性,这个先后顺序基本没有解释力。换个说法,在需要连续多天自主推进的任务上,开源模型已经跟第一梯队的闭源模型贴到了一起——Kimi K3 也是唯一挤进前三的开源选手。

拉开差距的是手上功夫

报告把模型之间的分野归到了执行环节:选哪些实验做、做得有多仔细、怎么解读带噪声的结果,每一步都在扩大差距。

具体行为上,表现好的模型在拿到一个边缘结果时,会先在三个随机种子上复测,确认稳定了才上全量验证;也会回过头重做消融,把之前判为负面的方向再翻出来试。几个模型甚至自己搭了实验管理流程和小型模拟器。跑得差的那些,往往是在噪声里看到了并不存在的提升,然后顺着错误结论一路走下去。

这个结论对做工程的人不算陌生。调参这件事的门槛从来不在读懂论文,在于有没有耐心把一个可疑的正向结果重复三遍。

冷水在没有新东西

报告里有一句自嘲式的表述:作者说自己再一次对缺乏新意感到意外。153 次实验,赢下来的方案用的全是现成技巧——预条件、学习率调度、权重平均,没有哪个模型提出过去没人试过的方法。

这盆水浇在最近关于 AI 自我改进的讨论上,温度刚好。会做实验和会提新方法是两件事,前者已经能自动化到八天不用人管,后者在这份数据里看不到踪迹。

这份数据能推广多远

限制条件不少。nanoGPT speedrun 本身方差就大,算力预算又不允许对每个模型做足够多次的重复取平均,作者自己也承认,分不清结果里有多少是这个特定任务的设置造成的、多少反映了模型的真实上限。

单一任务、单一领域、固定 harness,换一个研究方向排名会不会翻盘,目前谁也说不好。但把 18 个模型放进同一套沙箱跑上八天,这种量级的公开对照实验此前没有过,光是把方差摊在明面上,就比一堆互相不可比的自评有用。

参考来源:Prime Intellect 研究博客与实验仓库、CocoLoop、量子位;nanoGPT speedrun 排行榜核验各模型步数与基线口径。