Líder do ARC-AGI-2 salta para 88,06%

O ARC Prize divulgou em 9 de outubro o ranking do ARC-AGI-2 da temporada 2026, com a TUFA Labs na primeira posição, com 88,06%. Do segundo ao quinto lugar aparecem Rabbithole (80,56%), Yi-Chia Chen (77,22%), Nubanana (77,08%) e _hans (67,64%). François Chollet, cofundador do ARC Prize, também mencionou publicamente no mesmo dia que a pontuação do ARC-AGI-2 no Kaggle chegou a 88,06%.

O líder está cerca de 7,5 pontos percentuais à frente do segundo, e, entre os cinco primeiros, só a TUFA Labs ultrapassou a marca de 85%.

A linha dos 85%

O ARC-AGI-2 é um teste de raciocínio abstrato desenhado por Chollet e colegas. Cada questão traz alguns exemplos de entrada e saída em grades coloridas; o sistema participante precisa induzir a regra a partir deles e desenhar a grade correta para uma nova entrada. Cada entrada de teste admite 2 respostas, e basta que uma delas esteja totalmente correta para valer 1 ponto. As questões evitam de propósito conhecimentos que se resolvem por memorização.

A competição roda no Kaggle, com ambiente de avaliação sem acesso à internet e poder de computação limitado. Segundo a página de regras da temporada 2026, o total de prêmios é de 700 mil dólares:

  • Prêmio de progresso de 275 mil dólares, dividido entre os oito primeiros, com 75 mil dólares para o primeiro colocado;
  • Grande prêmio de 275 mil dólares, para a descrição de solução com a maior pontuação;
  • Outros 150 mil dólares, condicionados a atingir 85% no conjunto de avaliação privado.

Todas as soluções premiadas precisam ser de código aberto; as que não forem serão removidas da competição.

Há uma diferença de critério que convém separar. No post de agora, o ARC Prize diz que os 150 mil dólares serão divididos entre todas as equipes que superarem 85%, mas a página de regras diz que o valor vai para a primeira solução qualificada a atingir esse nível no conjunto privado. Qual das duas versões vale, a organização ainda não esclareceu.

Além disso, o ranking público do Kaggle pontua com cerca de metade das questões de teste; a classificação final é decidida pela outra metade. Os 88,06% são um resultado parcial, e se a TUFA Labs conseguirá manter os 85% no conjunto privado só se saberá no fechamento da temporada.

Colocando as duas temporadas lado a lado

A temporada ARC Prize 2025 também usou o ARC-AGI-2. Naquele ano, 1.455 equipes enviaram 15.154 submissões; a campeã NVARC obteve 24,03% no conjunto privado, a um custo de cerca de 0,20 dólar por questão; a segunda colocada, the ARChitects, ficou com 16,53%, e o grande prêmio não foi entregue. A NVARC é formada por dois Kaggle Grandmasters da Nvidia, que seguiram o caminho de dados sintéticos, treinamento em tempo de teste e modelos pequenos, sem recorrer à força bruta de grandes modelos.

Um ano antes, em 2024, ainda se usava a primeira geração do ARC-AGI, e a marca da campeã ficou um pouco acima de 50%. Quando o ARC-AGI-2 foi lançado, em 2025, a dificuldade foi elevada de propósito, e os principais modelos de fronteira da época tinham, em geral, pontuações de um só dígito nele.

Assim, o melhor resultado da trilha do Kaggle foi de 24% a 88% em um ano. Os dois números não têm o mesmo critério: o primeiro é o ranking final no conjunto privado, o segundo é um resultado parcial do ranking público. Subtraí-los diretamente superestimaria o avanço, mas a mudança de ordem de grandeza continua grande.

O método usado pela TUFA Labs não foi divulgado até agora, e tampouco o consumo de computação e o custo por questão por trás do resultado. Pelas regras, as soluções premiadas devem ser abertas e acompanhadas de uma descrição; os detalhes só devem aparecer, no mínimo, depois do fim da temporada.

Quanto espaço ainda resta nas questões

Ao lançar o ARC-AGI-2 em 2025, os organizadores apresentaram a referência humana: os testadores acertavam em média cerca de 60%, e cada questão foi resolvida corretamente por pelo menos dois testadores. Por esse critério, os 88% do ranking público já estão acima da média dos testadores humanos.

Nos últimos dois anos, o ARC Prize também tem deslocado o foco para o ARC-AGI-3, interativo, cujas questões viraram pequenos jogos em que é preciso aprender enquanto se tenta. Se o conjunto privado confirmar nesta temporada que o ARC-AGI-2 passou de 85%, é provável que a missão dessas questões estáticas em grade como prova com premiação chegue ao fim; o que a organização fará a seguir ainda não foi anunciado.

Fontes: conta oficial do ARC Prize, página de regras do ARC Prize 2026, CocoLoop, análise dos resultados da temporada ARC Prize 2025; foram verificados as pontuações dos cinco primeiros, a composição dos prêmios e o critério do resultado da campeã de 2025.