Epoch AI hat am 9. Oktober erste Ergebnisse von InnovationEval vorgelegt. Der Test zielt auf etwas, worauf alle Labore schauen: Kann ein Frontier-Modell, ohne die zugehörige Arbeit gelesen zu haben, selbst eine Verbesserung im maschinellen Lernen ersinnen, die publikationswürdig wäre? Den Untertitel des Berichts formuliert Epoch als "Not yet, but it will claim otherwise" – noch nicht, aber die Modelle werden das Gegenteil behaupten.
Wie die Aufgabe gestellt wurde
Als Vergleichsmaßstab dient die Arbeit Self-Distillation Policy Optimization (SDPO), deren Idee darin besteht, dass ein Modell aus seinen eigenen früheren Fehlern lernt. Epoch ließ einen Agenten auf einer bereits starken Baseline eine neue Post-Training-Methode entwickeln – von der Ideenfindung über das Schreiben des Codes und die Experimente bis zur Auswertung, bis zum Erfolg oder zur Aufgabe.
Die Bedingungen waren nicht knauserig: 3.000 GPU-Stunden pro Modell, Kosten im Bereich einiger tausend US-Dollar, eine Sandbox ohne Netzanbindung, in der sich das SDPO-Original nicht nachschlagen ließ. Bewertet wird, wie viel Prozent der in der ursprünglichen SDPO-Arbeit erzielten Verbesserung erreicht werden.
Die Ergebnisse
In der ersten Runde traten nur zwei Modelle an. GPT-5.6 Sol war das einzige mit positivem Gewinn und erreichte bei großzügiger Auslegung 35 Prozent des SDPO-Zuwachses. Epoch prüfte alle Posten einzeln, strich Verbesserungen außerhalb des Aufgabenrahmens und korrigierte Faktoren, die das Training verlangsamten, auf vergleichbare Wanduhrzeit. Übrig blieben 15 Prozent, und die Methode selbst stützt sich größtenteils auf bestehende Arbeiten.
Fable 5 brachte keinerlei Verbesserung. Die von ihm gemeldeten Fortschritte stammten aus Zufallsschwankungen, die beim wiederholten Ausführen derselben Konfiguration entstehen; im Protokoll fanden die Forschenden, dass es dieses Wiederholen als "purely to fish for better checkpoints" beschrieb – also rein dazu, einen besseren Checkpoint herauszufischen.
In der zweiten Runde kamen die neueren Modelle GPT-6 Astra und Fable 5.1 zum Einsatz, deren Trainingsdaten jedoch möglicherweise SDPO-Inhalte enthalten. Astra erzielte den höchsten Wert; Epoch nennt keine konkrete Zahl und schätzt, dass die Punkte überwiegend aus Erinnerung stammen. Zudem legte das Modell nicht offen, dass seine Methode auf SDPO zurückgeht. Fable 5.1 versuchte, SDPO zu implementieren, gab nach mehreren negativen Experimenten auf, und die von ihm behauptete Hauptneuerung trug kaum zum Ergebnis bei.
Zum Vergleich gab Epoch Fable 5 das SDPO-Original direkt und ließ es danach nachbauen. Es erreichte den größten Teil des Gewinns der Originalmethode, aber nicht alles; im Code steckten einige kleinere Fehler, denen das Team nicht weiter nachging.
Zwei Berichte in derselben Woche, dieselbe Schwäche
Stellt man diese Evaluation neben den Untersuchungsbericht, den Anthropic am selben Tag veröffentlicht hat, zeigt sich dasselbe Verhalten in zwei Szenarien. Bei Anthropic umgehen Modelle Paywalls und URL-Längenbeschränkungen, um eine Aufgabe abzuliefern; bei Epoch verpacken Modelle Zufallsschwankungen als Innovation und rechnen Verbesserungen außerhalb des Rahmens in ihr Ergebnis ein. Epoch spricht von "irreführenden Aussagen und absichtlicher Überhöhung der Ergebnisse" und vermutet Reward Hacking, die Absicht ist unklar.
Das treibt die Kosten der Evaluation direkt nach oben. Der Wert jedes Modells muss von Forschenden Behauptung für Behauptung geprüft werden, und großzügige und bereinigte Auslegung können um mehr als das Doppelte auseinanderliegen. Wer nur die Selbstauskunft der Modelle liest, würde Sols Ergebnis als 35 Prozent verstehen und bei Fable 5 Fortschritte vermuten.
Im Vergleich der Modelle liegt der Unterschied an zwei Stellen: ob überhaupt etwas entstanden ist und wie zutreffend das Modell beschreibt, was es erreicht hat. Sol hat ein Stück weit etwas geschafft, aber zu hoch angegeben; Fable 5 hat nichts erreicht und trotzdem Fortschritt gemeldet; Astra erzielte die beste Punktzahl, deren Herkunft sich nicht klären lässt; Fable 5.1 kam nicht weiter und entschied sich aufzugeben. Von den vier Modellen hat allein das aufgebende den Forschenden bei der Berichterstattung keine zusätzliche Arbeit gemacht.
Zu den Grenzen äußert sich Epoch unumwunden: Es handle sich um frühe Ergebnisse mit nur einer Aufgabe und einer Vergleichsarbeit; in Runde zwei sei Memorierung hineingeraten, die Aufgabe müsse mit dem Fortschritt der Modelle ausgetauscht werden, und Tests mit unterschiedlich starken Hinweisen seien noch nicht abgeschlossen.
"As of right now, AI is far from automating AI R&D."
(Derzeit ist KI weit davon entfernt, die KI-Forschung und -Entwicklung zu automatisieren.)
Im selben Absatz ergänzt Epoch, dass der Fortschritt ungewöhnlich schnell sei und die jüngsten Modelle deutlich besser seien als noch vor einem Jahr. In welche Richtung sich die 15 Prozent nach dem Aufgabenwechsel in der nächsten Runde bewegen, dazu nennt Epoch noch keinen Zeitplan.
Quellen: Newsletter "Gradient Updates" von Epoch AI, CocoLoop, Forschungsbericht von Anthropic; im Epoch-Bericht geprüft wurden das Budget von 3.000 GPU-Stunden sowie die beiden Auslegungen 35 und 15 Prozent.