El líder de ARC-AGI-2 se dispara hasta el 88,06 %

ARC Prize publicó el 9 de octubre la clasificación de ARC-AGI-2 de la temporada 2026, en la que TUFA Labs ocupa el primer puesto con un 88,06 %. Del segundo al quinto lugar figuran Rabbithole (80,56 %), Yi-Chia Chen (77,22 %), Nubanana (77,08 %) y _hans (67,64 %). François Chollet, cofundador de ARC Prize, mencionó también ese mismo día en público que la puntuación de ARC-AGI-2 en Kaggle había llegado al 88,06 %.

El líder aventaja al segundo en unos 7,5 puntos porcentuales y, entre los cinco primeros, solo TUFA Labs ha superado el 85 %.

La barrera del 85 %

ARC-AGI-2 es una prueba de razonamiento abstracto diseñada por Chollet y sus colegas. Cada problema ofrece varios ejemplos de entrada y salida en cuadrículas de colores; el sistema participante debe inducir la regla a partir de ellos y dibujar la cuadrícula correcta para una entrada nueva. Cada entrada de prueba admite 2 respuestas, y basta con que una coincida por completo para sumar 1 punto. Los problemas evitan a propósito los conocimientos que se resuelven de memoria.

La competición se celebra en Kaggle, con un entorno de evaluación sin conexión a internet y con límite de potencia de cálculo. Según la página de reglas de la temporada 2026, los premios suman 700.000 dólares:

  • Premio al progreso de 275.000 dólares, repartido entre los ocho primeros, con 75.000 dólares para el primero;
  • Gran premio de 275.000 dólares, para la descripción de solución con mayor puntuación;
  • Otros 150.000 dólares, condicionados a alcanzar el 85 % en el conjunto de evaluación privado.

Todas las soluciones premiadas deben ser de código abierto; las que no lo sean quedan fuera de la competición.

Conviene distinguir un matiz. En su publicación de ahora, ARC Prize dice que los 150.000 dólares se repartirán entre todos los equipos que superen el 85 %, pero la página de reglas indica que se concederán a la primera solución válida que alcance ese nivel en el conjunto privado. Cuál de las dos versiones prevalece es algo que la organización no ha aclarado por ahora.

Además, la clasificación pública de Kaggle puntúa con aproximadamente la mitad de las preguntas de prueba; el puesto final lo decide la otra mitad. El 88,06 % es una cifra provisional, y si TUFA Labs logra mantener el 85 % en el conjunto privado no se sabrá hasta el cierre de la temporada.

Poniendo las dos temporadas una junto a otra

La temporada ARC Prize 2025 también se disputó sobre ARC-AGI-2. Aquel año, 1.455 equipos enviaron 15.154 propuestas; el campeón NVARC obtuvo un 24,03 % en el conjunto privado, con un coste de unos 0,20 dólares por problema; el segundo, the ARChitects, logró un 16,53 %, y el gran premio quedó sin dueño. NVARC está formado por dos Kaggle Grandmasters de Nvidia, que optaron por datos sintéticos, entrenamiento en tiempo de prueba y modelos pequeños, en lugar de usar modelos grandes a base de fuerza bruta.

Un año antes, en 2024, todavía se usaba la primera generación de ARC-AGI, y la marca del campeón fue de algo más del 50 %. Cuando ARC-AGI-2 se presentó en 2025, se elevó deliberadamente la dificultad, y los principales modelos de frontera de entonces solían quedarse en puntuaciones de un solo dígito.

Así, el mejor resultado de la vía de Kaggle ha pasado del 24 % al 88 % en un año. Las dos cifras no se miden igual: la primera es la clasificación final sobre el conjunto privado y la segunda un resultado provisional de la clasificación pública. Restarlas directamente sobrestimaría el avance, aunque el cambio de orden de magnitud sigue siendo grande.

El método de TUFA Labs no se ha hecho público hasta ahora, y tampoco el consumo de cómputo ni el coste por problema detrás del resultado. Según las reglas, las soluciones premiadas deben abrirse y entregar una descripción, así que los detalles no se conocerán, como pronto, hasta después de terminar la temporada.

Cuánto margen queda en los problemas

Al presentar ARC-AGI-2 en 2025, los organizadores dieron como referencia humana que los evaluadores acertaban de media cerca del 60 % y que cada problema fue resuelto correctamente por al menos dos de ellos. Con ese criterio, el 88 % de la clasificación pública ya supera la media de los evaluadores humanos.

En estos dos años, ARC Prize también ha ido desplazando su atención hacia el interactivo ARC-AGI-3, cuyos problemas son pequeños juegos en los que hay que aprender sobre la marcha. Si el conjunto privado confirma esta temporada que ARC-AGI-2 supera el 85 %, es probable que la misión de estos problemas estáticos de cuadrícula como prueba con premio llegue a su fin; los siguientes pasos de la organización todavía no se han anunciado.

Fuentes: cuenta oficial de ARC Prize, página de reglas de ARC Prize 2026, CocoLoop, análisis de resultados de la temporada ARC Prize 2025; se verificaron las puntuaciones de los cinco primeros, la composición de los premios y el criterio del resultado del campeón de 2025.