ARC Prize a publié le 9 octobre le classement ARC-AGI-2 de la saison 2026, où TUFA Labs prend la première place avec 88,06 %. Les places deux à cinq reviennent dans l'ordre à Rabbithole (80,56 %), Yi-Chia Chen (77,22 %), Nubanana (77,08 %) et _hans (67,64 %). François Chollet, cofondateur d'ARC Prize, a lui aussi indiqué publiquement le même jour que le score ARC-AGI-2 sur Kaggle avait atteint 88,06 %.
Le leader devance le deuxième d'environ 7,5 points de pourcentage, et parmi les cinq premiers, seul TUFA Labs a franchi la barre des 85 %.
La barre des 85 %
ARC-AGI-2 est un test de raisonnement abstrait conçu par Chollet et ses collègues. Chaque énoncé fournit quelques exemples d'entrée et de sortie sous forme de grilles colorées ; le système participant doit en induire la règle, puis dessiner la bonne grille pour une nouvelle entrée. Chaque entrée de test admet 2 réponses, et il suffit que l'une soit entièrement exacte pour marquer 1 point. Les énoncés évitent délibérément les connaissances que l'on résout par cœur.
La compétition se déroule sur Kaggle, dans un environnement d'évaluation sans accès à Internet et à puissance de calcul plafonnée. Selon la page de règlement de la saison 2026, la dotation totale est de 700 000 dollars :
- Prix du progrès de 275 000 dollars, réparti entre les huit premiers, dont 75 000 dollars pour le premier ;
- Grand prix de 275 000 dollars, décerné à la description de solution la mieux notée ;
- Une enveloppe supplémentaire de 150 000 dollars, conditionnée à l'obtention de 85 % sur le jeu d'évaluation privé.
Toutes les solutions primées doivent être en open source ; celles qui ne le sont pas sont exclues de la compétition.
Un point de formulation mérite d'être distingué. Dans son message actuel, ARC Prize affirme que les 150 000 dollars seront partagés entre toutes les équipes qui dépassent 85 %, alors que la page de règlement indique qu'ils reviennent à la première solution éligible atteignant ce niveau sur le jeu privé. Laquelle des deux versions fait foi, l'organisation ne l'a pas précisé pour l'instant.
Par ailleurs, le classement public de Kaggle ne note qu'environ la moitié des questions de test ; le classement final est décidé par l'autre moitié. Les 88,06 % sont un résultat intermédiaire, et la capacité de TUFA Labs à conserver 85 % sur le jeu privé ne sera connue qu'au règlement de la saison.
Mettre les deux saisons côte à côte
La saison ARC Prize 2025 reposait elle aussi sur ARC-AGI-2. Cette année-là, 1 455 équipes ont déposé 15 154 soumissions ; le vainqueur NVARC a obtenu 24,03 % sur le jeu privé, pour un coût d'environ 0,20 dollar par énoncé ; le deuxième, the ARChitects, a atteint 16,53 %, et le grand prix n'a pas été décerné. NVARC réunit deux Kaggle Grandmasters de Nvidia, qui ont misé sur des données synthétiques, l'entraînement au moment du test et de petits modèles, sans recourir à la force brute de grands modèles.
Un an plus tôt, en 2024, c'était encore la première génération d'ARC-AGI qui servait de support, et le score du vainqueur dépassait à peine 50 %. Lors du lancement d'ARC-AGI-2 en 2025, la difficulté avait été volontairement relevée, et les principaux modèles de pointe de l'époque n'y obtenaient généralement qu'un score à un chiffre.
Le meilleur résultat de la piste Kaggle est donc passé de 24 % à 88 % en un an. Les deux chiffres ne reposent pas sur la même base : le premier est le classement final sur le jeu privé, le second un résultat intermédiaire du classement public. Les soustraire directement surestimerait les progrès, mais le changement d'ordre de grandeur reste important.
La méthode employée par TUFA Labs n'a pas été rendue publique à ce jour, pas plus que la consommation de calcul et le coût par énoncé derrière ce résultat. D'après le règlement, les solutions primées doivent être ouvertes et accompagnées d'une description ; les détails ne seront connus au plus tôt qu'à la fin de la saison.
Quelle marge reste-t-il aux énoncés
Lors du lancement d'ARC-AGI-2 en 2025, les organisateurs avaient donné la référence humaine suivante : les testeurs obtenaient en moyenne environ 60 % de bonnes réponses, et chaque énoncé avait été résolu correctement par au moins deux testeurs. Selon ce critère, les 88 % du classement public dépassent déjà la moyenne des testeurs humains.
Depuis deux ans, ARC Prize déplace aussi son centre de gravité vers ARC-AGI-3, interactif, dont les énoncés sont devenus de petits jeux où il faut apprendre en essayant. Si le jeu privé confirme cette saison qu'ARC-AGI-2 a dépassé 85 %, la mission de ces grilles statiques comme épreuve dotée d'un prix touchera probablement à sa fin ; la suite prévue par les organisateurs n'a pas encore été annoncée.
Sources : compte officiel d'ARC Prize, page de règlement d'ARC Prize 2026, CocoLoop, analyse des résultats de la saison ARC Prize 2025 ; ont été vérifiés les scores des cinq premiers, la composition des prix et la base de mesure du résultat du vainqueur 2025.