OpenAI eleva pontuação ARC a 38,3%

A OpenAI publicou em 29 de julho uma nota técnica sobre o ARC-AGI-3. O mesmo GPT-5.6 Sol marcou 13,3% no conjunto público com o harness oficial. Com raciocínio retido e compaction no Responses API, chegou a 38,3%, enquanto os tokens de saída caíram cerca de 6 vezes.

O ganho está na memória

O ARC-AGI-3 coloca agentes em jogos 2D desconhecidos, sem instruções explícitas, para que explorem, infiram objetivos e ajam com eficiência. A OpenAI aponta que o harness oficial descartava o private reasoning após cada ação e usava rolling truncation quando o contexto passava de 175.000 caracteres.

A OpenAI escreveu: “Benchmarks rarely measure AI models in isolation.” Ou seja, o benchmark também mede configurações de API, gestão de contexto e desenho do harness. Retained reasoning preserva planos anteriores; compaction mantém observações antigas em forma comprimida.

Os números têm escopo

13,3%, 38,3% e a estimativa humana de 48% são RHAE em tarefas públicas do ARC-AGI-3. Não são resultados privados nem acurácia comum. O paper do ARC afirmou que humanos resolviam 100% dos ambientes no lançamento, enquanto sistemas de IA frontier ficavam abaixo de 1%.

Para desenvolvedores, a lição é prática: agentes de longa duração devem ser avaliados com o mesmo comportamento de memória e contexto usado em produção. Caso contrário, o teste pode medir esquecimento forçado, não capacidade do modelo.

Avaliar agentes virou trabalho de sistema

O resultado não prova que o GPT-5.6 Sol resolveu o ARC-AGI-3. Também não invalida o ARC. Ele mostra que benchmarks de agentes incluem o sistema ao redor: memória, retorno de ferramentas, recuperação de falhas e compressão de contexto. Os próximos pontos são regras do ARC, replicação por outros laboratórios e resultados em conjuntos privados.

Fontes: pesquisa da OpenAI, paper da ARC Prize Foundation, documentação do ARC, CocoLoop, Hugging Face gameplay logs; verificados o escopo RHAE do ARC-AGI-3, GPT-5.6 Sol com harness oficial em 13,3% e Responses API harness em 38,3%, estimativa humana pública de 48%, cerca de 1/6 dos tokens de saída e janela de contexto de 175k.