ARC Prize hat am 9. Oktober die Rangliste für ARC-AGI-2 in der Saison 2026 veröffentlicht: TUFA Labs führt mit 88,06 Prozent. Auf den Plätzen zwei bis fünf folgen Rabbithole (80,56 Prozent), Yi-Chia Chen (77,22 Prozent), Nubanana (77,08 Prozent) und _hans (67,64 Prozent). ARC-Prize-Mitgründer François Chollet erwähnte am selben Tag öffentlich, dass der ARC-AGI-2-Wert auf Kaggle bei 88,06 Prozent angekommen sei.
Der Spitzenreiter liegt rund 7,5 Prozentpunkte vor dem Zweiten, und unter den ersten fünf hat nur TUFA Labs die Marke von 85 Prozent überschritten.
Die 85-Prozent-Marke
ARC-AGI-2 ist ein Test für abstraktes Schlussfolgern, entworfen von Chollet und Kollegen. Jede Aufgabe zeigt einige Ein- und Ausgabebeispiele in Form bunter Raster; das teilnehmende System muss daraus eine Regel ableiten und für eine neue Eingabe das richtige Raster zeichnen. Pro Testeingabe dürfen zwei Antworten abgegeben werden, und es gibt einen Punkt, wenn eine davon exakt stimmt. Die Aufgaben meiden bewusst Wissen, das sich durch Auswendiglernen lösen ließe.
Der Wettbewerb läuft auf Kaggle, die Auswertungsumgebung hat keinen Internetzugang und ein begrenztes Rechenbudget. Laut Regelseite für die Saison 2026 beträgt das Preisgeld insgesamt 700.000 US-Dollar:
- Fortschrittspreis: 275.000 US-Dollar, aufgeteilt auf die ersten acht Plätze, davon 75.000 US-Dollar für Platz eins;
- Hauptpreis: 275.000 US-Dollar für die am höchsten bewertete Lösungsbeschreibung;
- Weitere 150.000 US-Dollar, die an das Erreichen von 85 Prozent auf dem privaten Testsatz geknüpft sind.
Alle ausgezeichneten Lösungen müssen als Open Source veröffentlicht werden; wer das nicht tut, wird aus dem Wettbewerb ausgeschlossen.
Bei der Auslegung ist Vorsicht geboten. In ihrem aktuellen Beitrag schreibt ARC Prize, die 150.000 US-Dollar würden unter allen Teams aufgeteilt, die 85 Prozent übertreffen; auf der Regelseite heißt es dagegen, sie gingen an die erste qualifizierte Lösung, die diesen Wert auf dem privaten Satz erreicht. Welche Darstellung gilt, hat die Organisation bislang nicht weiter erläutert.
Hinzu kommt: Die öffentliche Kaggle-Rangliste wertet nur etwa die Hälfte der Testaufgaben aus, über die endgültige Platzierung entscheidet die andere Hälfte. Die 88,06 Prozent sind ein Zwischenstand, ob TUFA Labs die 85 Prozent auf dem privaten Satz halten kann, zeigt sich erst bei der Abrechnung am Saisonende.
Zwei Saisons im Vergleich
Auch die Saison ARC Prize 2025 drehte sich um ARC-AGI-2. Damals reichten 1.455 Teams insgesamt 15.154 Einreichungen ein; Sieger NVARC erzielte auf dem privaten Satz 24,03 Prozent bei Kosten von rund 0,20 US-Dollar pro Aufgabe, der Zweitplatzierte the ARChitects kam auf 16,53 Prozent, und der Hauptpreis wurde nicht vergeben. NVARC besteht aus zwei Kaggle-Grandmastern von Nvidia, die auf synthetische Daten, Training zur Testzeit und kleine Modelle setzten statt auf rohe Gewalt mit großen Modellen.
Ein Jahr davor, 2024, galt noch die erste Generation von ARC-AGI, und die Siegerleistung lag knapp über 50 Prozent. Bei der Einführung 2025 wurde ARC-AGI-2 gezielt schwerer gemacht; die gängigen Frontier-Modelle erreichten darauf damals meist nur einstellige Werte.
Das beste Ergebnis auf der Kaggle-Strecke ist also binnen eines Jahres von 24 auf 88 Prozent gestiegen. Beide Zahlen sind nicht gleich gemessen: die erste ist das Endergebnis auf dem privaten Satz, die zweite ein Zwischenstand der öffentlichen Rangliste. Eine direkte Subtraktion überzeichnet den Fortschritt, doch die Größenordnung der Veränderung bleibt beträchtlich.
Welche Methode TUFA Labs einsetzt, ist bislang nicht bekannt, ebenso wenig der Rechenaufwand und die Kosten pro Aufgabe hinter dem Ergebnis. Laut Regeln müssen ausgezeichnete Lösungen als Open Source veröffentlicht und beschrieben werden; Details gibt es frühestens nach Saisonende.
Wie viel Spielraum die Aufgaben noch lassen
Bei der Vorstellung von ARC-AGI-2 im Jahr 2025 nannten die Organisatoren als menschliche Referenz: Testpersonen lösten im Schnitt rund 60 Prozent richtig, und jede Aufgabe wurde von mindestens zwei Testpersonen korrekt gelöst. Nach diesem Maßstab liegen die 88 Prozent der öffentlichen Rangliste bereits über dem Durchschnitt der menschlichen Testpersonen.
ARC Prize verlagert seinen Schwerpunkt zudem seit zwei Jahren auf das interaktive ARC-AGI-3, dessen Aufgaben als kleine Spiele gestaltet sind, bei denen man durch Ausprobieren lernen muss. Sollte der private Satz in dieser Saison bestätigen, dass ARC-AGI-2 die 85 Prozent übersteigt, dürfte die Rolle dieser statischen Rasteraufgaben als Preisgeld-Aufgabe wohl zu Ende gehen; wie die Organisatoren danach weiter verfahren, ist bislang nicht angekündigt.
Quellen: offizielles ARC-Prize-Konto, Regelseite ARC Prize 2026, CocoLoop, Ergebnisanalyse der Saison ARC Prize 2025; geprüft wurden die Werte der ersten fünf Plätze, die Preisgeldstruktur und die Messgrundlage des Siegerergebnisses 2025.