ARC Prize 10 月 9 日公布 2026 赛季 ARC-AGI-2 高分榜,TUFA Labs 以 88.06% 排名第一。第二到第五名依次是 Rabbithole(80.56%)、Yi-Chia Chen(77.22%)、Nubanana(77.08%)和 _hans(67.64%)。ARC Prize 联合创始人 François Chollet 当天也公开提到,Kaggle 上的 ARC-AGI-2 分数到了 88.06%。
榜首领先第二名约 7.5 个百分点,前五名里只有 TUFA Labs 越过了 85%。
85% 这条线
ARC-AGI-2 是 Chollet 等人设计的抽象推理测试。每道题给几组彩色网格的输入输出示例,参赛系统要从里面归纳出规则,再对新的输入画出正确网格。每个测试输入可以交 2 个答案,任一个完全对上记 1 分。题目刻意避开靠背诵能解的知识。
比赛跑在 Kaggle 上,评测环境断网,算力有上限。按 2026 赛季规则页,总奖金 70 万美元:
- 进步奖 27.5 万美元,分给前八名,第一名 7.5 万美元;
- 大奖 27.5 万美元,颁给评分最高的方案说明;
- 另设 15 万美元奖金,门槛是在私有评测集上达到 85%。
所有获奖方案都必须开源,不开源的会被移出比赛。
有一处口径要分开看。ARC Prize 这次发帖说 15 万美元由所有超过 85% 的团队分享,规则页写的却是颁给”首个”在私有集上达标的合格方案,两种说法以哪个为准,官方暂时没有进一步解释。
另外,Kaggle 公开榜只用大约一半测试题打分,最终名次由另一半决定。88.06% 是阶段成绩,TUFA Labs 能不能在私有集上守住 85%,要等赛季结算。
把两个赛季连起来看
ARC Prize 2025 赛季考的也是 ARC-AGI-2。那一年 1455 支队伍提交了 15154 次,冠军 NVARC 在私有集上拿到 24.03%,单题成本约 0.20 美元;第二名 the ARChitects 是 16.53%,大奖无人领走。NVARC 由英伟达的两位 Kaggle 特级大师组成,路线是合成数据、测试时训练加小模型,没有拿大模型硬跑。
再往前,2024 赛季用的还是第一代 ARC-AGI,冠军成绩在 50% 出头。ARC-AGI-2 在 2025 年推出时专门拉高了难度,当时主流前沿模型在上面普遍只有个位数得分。
所以 Kaggle 赛道的最好成绩,一年里从 24% 走到了 88%。两个数口径不同,前者是私有集终榜,后者是公开榜阶段成绩,直接相减会高估进步幅度,粗看量级的变化依然很大。
TUFA Labs 用了什么方法,目前没有公开说明,成绩背后的算力消耗和单题成本也没有披露。按规则,获奖方案要开源并提交说明,细节最早要等赛季结束后才能看到。
题目本身还剩多少空间
组织方 2025 年发布 ARC-AGI-2 时给出的人类基线是:测试者平均正确率约 60%,每道题都至少有两名测试者做对。按这个口径,88% 的公开榜成绩已经高过人类测试者的平均水平。
ARC Prize 这两年也在往交互式的 ARC-AGI-3 挪重心,那一代题目改成了需要边试边学的小游戏。ARC-AGI-2 如果在本赛季被私有集确认越过 85%,这套静态网格题作为奖金赛题的使命大概率会告一段落,组织方下一步怎么安排,目前还没有公告。
参考来源:ARC Prize 官方账号、ARC Prize 2026 竞赛规则页、CocoLoop、ARC Prize 2025 赛季结果分析;核验前五名分数、奖金构成与 2025 赛季冠军成绩口径。