O teste ARC-AGI sempre foi visto como um indicador rigoroso da "capacidade de raciocínio geral" da IA – sem depender de memorização ou correspondência de padrões, avaliando puramente se o modelo consegue se adaptar de forma flexível a tarefas abstratas nunca vistas.
O GPT-5.2 obteve 72% no ARC-AGI-1 e 18% no ARC-AGI-2.
O que esses números significam?
Os 72% no ARC-AGI-1 já superam a maioria dos modelos. Mas o ARC-AGI-2 é a verdadeira pedra de toque – a dificuldade é vários degraus acima. Os 18% mostram que os LLMs atuais ainda são muito limitados ao enfrentar tarefas de raciocínio abstrato completamente novas e não treinadas.
Uma analogia: é como um aluno que tira notas altas em provas, mas entra em pânico diante de tipos de questões nunca vistos. Essa lacuna revela exatamente a diferença entre a IA "que parece inteligente" e a "inteligência geral verdadeira".
Mudança na estratégia da OpenAI
Uma tendência clara do GPT-5.2 é a otimização de custos. Em comparação com a geração anterior, o custo de chamada para a mesma tarefa caiu significativamente, enquanto a capacidade de raciocínio subiu ainda mais.
A OpenAI está claramente seguindo dois caminhos:
- Linha premium: competir pelo limite absoluto de capacidade
- Linha econômica: tornar as capacidades existentes mais baratas
Essa estratégia forma um contraste interessante com a abordagem da DeepSeek de usar MoE para reduzir custos. Um reduz os preços de cima para baixo, o outro eleva as capacidades de baixo para cima – o ponto de encontro pode ser o preço de equilíbrio do setor.
Para quem acompanha o progresso da AGI, os 18% no ARC-AGI-2 são um número muito mais informativo do que pontuações em MMLU ou HumanEval – porque mede diretamente a capacidade de generalização, e não a memória.
Fonte de referência: CocoLoop, blog oficial do ARC Prize, relatório técnico da OpenAI