OpenAI veröffentlichte am 29. Juli eine technische Notiz zu ARC-AGI-3. Dasselbe GPT-5.6 Sol erreichte mit dem offiziellen Harness 13,3% auf dem öffentlichen Set. Mit erhaltenem Reasoning und Compaction im Responses API Harness stieg der Wert auf 38,3%, während die ausgegebenen Tokens ungefähr auf ein Sechstel sanken.
Der Sprung liegt im Speicher
ARC-AGI-3 lässt Agenten unbekannte 2D-Spiele ohne Anleitung erkunden, Ziele ableiten und effizient handeln. OpenAI verweist darauf, dass der offizielle Harness nach jeder Aktion private Reasoning verwirft und bei mehr als 175.000 Zeichen ältere Nachrichten per rolling truncation entfernt.
OpenAI schreibt: “Benchmarks rarely measure AI models in isolation.” Der Test misst also auch API-Einstellungen, Kontextverwaltung und Harness-Design. Retained reasoning erhält frühere Pläne, Compaction bewahrt ältere Beobachtungen in verdichteter Form.
Die Zahlen brauchen Kontext
13,3%, 38,3% und die geschätzten 48% für Menschen sind RHAE-Werte auf öffentlichen ARC-AGI-3-Aufgaben. Sie sind keine privaten Leaderboard-Ergebnisse und keine normale Accuracy. Das ARC-Paper schrieb, Menschen könnten beim Start 100% der Umgebungen lösen, während Frontier-AI-Systeme unter 1% lagen.
Für Entwickler ist die Folgerung klar: Lang laufende Agenten sollten mit denselben Speicher- und Kontextbedingungen getestet werden, die sie später in Produktion nutzen. Sonst misst der Test erzwungenes Vergessen statt Modellfähigkeit.
Agenten-Evals werden Systemarbeit
Das Ergebnis beweist nicht, dass GPT-5.6 Sol ARC-AGI-3 gelöst hat. Es entwertet ARC auch nicht. Es zeigt, dass Agenten-Benchmarks das umliegende System einschließen: Speicher, Tool-Rückgaben, Fehlererholung und Kontextkompression. Wichtig sind nun ARC-Regeln, Replikationen durch andere Labore und Werte auf privaten Sets.
Quellen: OpenAI Research, ARC Prize Foundation Paper, ARC-Dokumentation, CocoLoop, Hugging Face gameplay logs; geprüft wurden ARC-AGI-3 RHAE-Scope, GPT-5.6 Sol mit offiziellem Harness 13,3% und Responses API Harness 38,3%, öffentliche Mensch-Schätzung 48%, etwa 1/6 Output-Token sowie das 175k-Kontextfenster.