OpenAI把ARC跑分提到38.3%

OpenAI 7 月 29 日公開 ARC-AGI-3 復測結果。同一個 GPT-5.6 Sol,在官方 harness 下公開集得分為 13.3%;改用保留推理與 compaction 的 Responses API harness 後,升至 38.3%,輸出 token 約降到 1/6。

分數漲在記憶層

ARC-AGI-3 讓 Agent 進入沒有說明書的 2D 回合制遊戲,自己探索、推斷目標並規劃動作。OpenAI 的解釋是,官方 harness 每次動作後會丟掉私有推理,並在上下文超過 175,000 characters 後用 rolling truncation 刪除舊記錄。

OpenAI 寫道:“Benchmarks rarely measure AI models in isolation.” 自然翻成中文,就是基準測試很少只測模型本身,也會測 API 設定、上下文管理和 harness 設計。retained reasoning 保留前序計畫,compaction 則把長任務裡的早期觀察壓縮保留。

數字要標清口徑

13.3%、38.3% 和人類平均估算 48%,都屬於 ARC-AGI-3 公開任務 RHAE。它不是私有榜結果,也不是一般準確率。ARC 論文稱,發布時人類可解出 100% 環境,前沿 AI 系統低於 1%。

對開發者來說,長任務 Agent 的評測必須貼近生產環境。若測試時移除記憶保持和上下文壓縮,測到的可能是強制失憶,而非模型能力。

評測正在變成系統工程

這個結果沒有證明 GPT-5.6 Sol 已解決 ARC-AGI-3,也沒有推翻 ARC。它揭示的是,Agent benchmark 裡周邊系統也是測量對象。後續要看 ARC 是否調整可比規則、其他模型廠商能否復現、私有集是否同向變化。

參考來源:OpenAI 官方研究、ARC Prize Foundation 論文、ARC 官方文件、CocoLoop、Hugging Face gameplay logs;核驗 ARC-AGI-3 RHAE 口徑、GPT-5.6 Sol official harness 13.3% 與 Responses API harness 38.3%、公開任務 human tester 48% 估算、輸出 token 約 1/6 與 175k 上下文窗口設定。