OpenAI publicó el 29 de julio una nota técnica sobre ARC-AGI-3. El mismo GPT-5.6 Sol obtuvo 13,3% en el conjunto público con el harness oficial. Al conservar reasoning y activar compaction en Responses API, subió a 38,3%, con cerca de 6 veces menos tokens de salida.
La subida está en la memoria
ARC-AGI-3 pone a los agentes en juegos 2D desconocidos, sin instrucciones explícitas, para medir exploración, inferencia de objetivos y planificación eficiente. OpenAI señala que el harness oficial descartaba el private reasoning tras cada acción y aplicaba rolling truncation al superar 175.000 caracteres.
OpenAI escribió: “Benchmarks rarely measure AI models in isolation.” Es decir, un benchmark también mide ajustes de API, gestión de contexto y diseño del harness. Retained reasoning conserva planes previos; compaction mantiene observaciones antiguas comprimidas.
Las cifras tienen alcance
13,3%, 38,3% y la estimación humana de 48% son valores RHAE en tareas públicas de ARC-AGI-3. No son resultados de un leaderboard privado ni precisión convencional. El paper de ARC indicó que los humanos resolvían el 100% de los entornos al lanzamiento, mientras los sistemas frontier estaban por debajo del 1%.
Para desarrolladores, la conclusión es concreta: un agente de larga duración debe evaluarse con la misma memoria y compresión de contexto que usará en producción. Si no, el test puede medir olvido forzado en lugar de capacidad del modelo.
Evaluar agentes ya es ingeniería de sistemas
El resultado no prueba que GPT-5.6 Sol haya resuelto ARC-AGI-3. Tampoco invalida ARC. Muestra que los benchmarks de agentes incluyen el sistema que rodea al modelo: memoria, respuestas de herramientas, recuperación de errores y compresión de contexto. Lo siguiente será observar reglas de ARC, replicación por otros laboratorios y resultados en conjuntos privados.
Fuentes: investigación de OpenAI, paper de ARC Prize Foundation, documentación de ARC, CocoLoop, Hugging Face gameplay logs; se verificaron el alcance RHAE de ARC-AGI-3, GPT-5.6 Sol con harness oficial en 13,3% y Responses API harness en 38,3%, estimación humana pública de 48%, cerca de 1/6 de tokens de salida y ventana de contexto de 175k.