ARC-AGI 這項測試一直被視為衡量 AI「通用推理能力」的硬指標——不靠死記硬背,不靠 pattern matching,純粹考察模型能不能在沒見過的抽象任務上靈活應變。
GPT-5.2 在 ARC-AGI-1 上拿到了 72%,ARC-AGI-2 上 18%。
這組數字什麼水準?
ARC-AGI-1 的 72% 已經超過了絕大多數模型。但 ARC-AGI-2 才是真正的試金石——難度直接拉了好幾個台階。18% 說明現在的 LLM 在面對 全新的、未經訓練的抽象推理任務 時,能力還是很有限的。
做個類比:就像一個學生考試能拿高分,但面對從沒見過的題型就慌了。這個 gap 正好揭示了當前 AI「看起來很聰明」和「真正通用智慧」之間的鴻溝。
OpenAI 的策略變化
GPT-5.2 比較明確的趨勢是 成本最佳化。與上一代相比,相同任務的呼叫成本下降了不少,同時推理能力又往上提了一截。
OpenAI 顯然在走兩條路:
- 高端線:拼絕對能力上限
- 經濟線:把已有能力做便宜
這個策略和 DeepSeek 用 MoE 壓成本的路線形成了有趣的對照。一個從上往下降價,一個從下往上提能力,最終交會的那個點可能就是行業均衡價格。
對於關注 AGI 進展的人來說,ARC-AGI-2 的 18% 是一個比各種 MMLU、HumanEval 分數都更有資訊量的數字——因為它直接測的是 泛化能力,而不是記憶力。
參考來源:CocoLoop、ARC Prize 官方部落格、OpenAI 技術報告