OpenAI porte ARC à 38,3%

OpenAI a publié le 29 juillet une note technique sur ARC-AGI-3. Le même GPT-5.6 Sol obtient 13,3% sur le jeu public avec le harness officiel. En conservant le raisonnement et en activant compaction via Responses API, il atteint 38,3%, avec environ six fois moins de tokens de sortie.

Le gain vient de la mémoire

ARC-AGI-3 place les agents dans des jeux 2D inconnus, sans consignes explicites, afin de tester exploration, inférence d’objectif et planification efficace. OpenAI souligne que le harness officiel supprimait le private reasoning après chaque action et utilisait rolling truncation au-delà de 175 000 caractères.

OpenAI écrit : “Benchmarks rarely measure AI models in isolation.” Autrement dit, un benchmark mesure aussi les réglages API, la gestion du contexte et le design du harness. Retained reasoning garde les plans antérieurs, tandis que compaction préserve les anciennes observations sous forme condensée.

Les chiffres doivent être cadrés

13,3%, 38,3% et l’estimation humaine de 48% sont des valeurs RHAE sur les tâches publiques ARC-AGI-3. Ce ne sont ni des résultats privés ni une accuracy classique. L’article ARC indiquait qu’au lancement les humains résolvaient 100% des environnements, tandis que les systèmes frontier étaient sous 1%.

Pour les développeurs, la leçon est nette : un agent de longue durée doit être évalué avec les mêmes règles de mémoire et de contexte qu’en production. Sinon, le test peut mesurer un oubli forcé plutôt que la capacité du modèle.

L’évaluation devient un sujet système

Ce résultat ne prouve pas que GPT-5.6 Sol a résolu ARC-AGI-3. Il n’annule pas non plus l’intérêt d’ARC. Il montre que les benchmarks d’agents incluent le système qui entoure le modèle : mémoire, retours d’outils, reprise après échec et compression du contexte. Les prochains points seront les règles d’ARC, les reproductions par d’autres laboratoires et les scores privés.

Sources : recherche OpenAI, article ARC Prize Foundation, documentation ARC, CocoLoop, Hugging Face gameplay logs ; vérification du périmètre RHAE ARC-AGI-3, GPT-5.6 Sol avec harness officiel à 13,3% et Responses API harness à 38,3%, estimation humaine publique de 48%, environ 1/6 de tokens de sortie et fenêtre de contexte 175k.