OpenAI 7 月 29 日把一件容易被写成跑分捷报的事,变成了一个更麻烦的工程问题:同一个模型,放在不同 harness 里,读出来的能力差了近三倍。
ARC-AGI-3 原本就是为难 Agent 的。它把模型扔进没有说明书的 2D 回合制小游戏,让模型自己探索、建模、猜目标、规划动作。OpenAI 这次没有发布新模型,选择重跑 GPT-5.6 Sol:官方 harness 下公开集 13.3%,打开 retained reasoning 和 compaction 后,公开集到 38.3%,输出 token 约降到 1/6。
看点在这里:如果评测框架每走一步就丢掉模型的私有推理,再用滚动截断删掉早期动作记录,它测到的可能并非“模型不会玩”,更像“模型一直被迫失忆”。
分数涨在记忆层
OpenAI 文章里有一句话很直白:
“Benchmarks rarely measure AI models in isolation.”
自然译过来,是基准测试很少只测模型本身,它也在测 API 设置、上下文管理、harness 设计和提示词。
这次两项设置都和记忆有关。第一项 retained reasoning,会把模型在工具调用和多轮动作之间形成的私有推理保留下来。OpenAI 称,GPT-5.6 可以通过传入 previous response ID 在 Responses API 里延续这些推理消息。
第二项 compaction,处理长上下文。ARC-AGI-3 官方 harness 在上下文超过 175,000 characters 后滚动截断旧消息;OpenAI 的实现改用压缩,把早期观察和动作总结进后续上下文。文章还说明,他们用的是 175,000 tokens 上限,因动作网格的 tokenizer 近似一字符一 token,和官方字符窗口接近。
这解释了为什么分数涨得大,token 还少。模型不必每走一步重新理解整局游戏,也不会在后半程忘掉前面试过的路线。对代码 Agent、浏览器 Agent 和长任务助手来说,这比单次问答分数更贴近真实工作流。
ARC 想测的恰好是这一点
ARC-AGI-3 论文把任务定义得很窄:不靠语言知识,不给显式说明,让系统在新环境里用动作效率解决问题。它测的是探索、建模、目标推断和计划,而非背答案。
论文给出的背景数字很硬:2026 年 3 月发布时,人类测试者能解出 100% 的环境,前沿 AI 系统低于 1%;ARC Prize 2026 奖金池为 200 万美元;公开 demo 有 25 个游戏。OpenAI 文章则估算,公开任务平均人类测试者的 RHAE 约 48%。
因此,38.3% 不能直接写成“接近 AGI”。ARC 论文自己提醒,公开集演示不等于私有集进展,专门为 ARC-AGI-3 设计的 harness 也可能把测量对象从通用能力推向工程适配。
但这也让争议更有价值。ARC 想测系统第一次接触新环境时能不能高效学会规则;OpenAI 的结果提醒,真实系统里的“第一次接触”通常会带着产品级记忆管理、压缩和工具接口。两边并非谁错谁对,分歧在于要测裸模型,还是测一个可部署的 Agent 系统。
开发者先别照抄结论
这篇文章对 API 开发者的实用含义很具体。OpenAI 建议使用 Responses API、保留推理、开启 compaction。放进自己的 Agent 评测里,等于先问三件事:
- 每次工具调用后,模型还能不能看到上一轮形成的计划;
- 长任务到中后段,早期观察是被丢掉,还是被压缩保留;
- token 变少时,成功率是在涨,还是只把中间思考藏到了别处。
这些问题直接影响企业内部评测。一个采购团队拿 Chat Completions 跑 20 个长任务,可能得到“模型不稳定”的结论;同一批任务迁到保留推理的 Responses API,又可能得到完全不同的通过率。反过来,如果厂商用高度定制 harness 包装跑分,也可能把产品工程优势写成模型能力跃迁。
中文读者尤其要盯数字口径。这里的 13.3%、38.3% 和 48% 都属于 ARC-AGI-3 公开任务集的 RHAE,口径不同于准确率和私有榜;6 倍 token 降幅是 OpenAI 自家 harness 与官方 harness 的输出 token 对比;175k 是上下文管理窗口,并非模型总能力边界。
评测会越来越像系统工程
过去两年的模型榜单常常把模型当作一个单点:同一组题、同一套提示词、同一张表格。Agent 时代的麻烦在于,能力在系统边界上长出来。记忆如何保留、工具如何回传、失败如何复盘、上下文如何压缩,都会改变最终表现。
这也是 OpenAI 这次结果的行业价值。它没有证明 GPT-5.6 Sol 已经解决 ARC-AGI-3,也没有推翻 ARC 的 benchmark。它把一个常被忽略的变量搬上台面:测 Agent 时,harness 本身就是被测对象的一部分。
后续更该看的节点有三个。第一,ARC 官方是否把 retained reasoning 或 compaction 类设置纳入新的可比规则;第二,其他模型厂商用同等接口复测后,提升幅度是否相近;第三,私有集上是否也出现类似增益。只有这三步都清楚,38.3% 才能从一篇工程复盘,走向更稳的能力判断。
参考来源:OpenAI 官方研究、ARC Prize Foundation 论文、ARC 官方文档、CocoLoop、Hugging Face gameplay logs;核验 ARC-AGI-3 RHAE 口径、GPT-5.6 Sol official harness 13.3% 和 Responses API harness 38.3%、公开任务 human tester 48% 估算、输出 token 约 1/6 与 175k 上下文窗口设置。