Google lässt KI eigene Antworten prüfen, plus 6 Punkte bei Langzeitaufgaben

Ein Google-Forschungsteam hat am 1. Oktober ein Paper auf arXiv eingereicht und ein Agenten-Verifikationsframework namens VeriHarness vorgestellt, dessen Code zugleich unter Apache-2.0-Lizenz auf GitHub veröffentlicht wurde. Das zu lösende Problem ist konkret: Wenn ein KI-Agent eine Aufgabe mit mehreren Dutzend Schritten ausführt und am Ende eine Tabelle, einen Bericht oder eine bearbeitete Datei abliefert, wer entscheidet dann, ob das Ergebnis korrekt ist.

VeriHarness lässt genau das Modell, das die Antwort erzeugt hat, selbst als Prüfer auftreten. Dieselbe Aufgabe wird vom Modell mehrfach unabhängig durchlaufen, wodurch mehrere Ergebnisse entstehen, die anschließend gegenübergestellt und verglichen werden – getrennt behandelt nach "Widerspruch" und "Konsens".

Zwei Prüfwege

Der erste Weg behandelt Widersprüche. Wenn mehrere Ergebnisse bei einer Schlussfolgerung uneinig sind, kehrt der Prüfer in die Aufgabenumgebung zurück, um Belege zu suchen – etwa die Originaldatei erneut zu öffnen oder eine bestimmte Zelle in einer Tabelle zu prüfen – und schließt mit dem, was sich in der Umgebung finden lässt, die falsche Darstellung aus.

Der zweite Weg behandelt Konsens. Stimmen mehrere Ergebnisse überein, lässt das Framework sie nicht einfach durchgehen, sondern sucht aktiv nach Gegenbeweisen, die diese Schlussfolgerung widerlegen könnten, und prüft gleichzeitig, ob alle Ergebnisse eine bestimmte Anforderung der Aufgabe übersehen haben. Ausgangspunkt des Papers ist: Dass mehrere Durchläufe zur gleichen Antwort kommen, garantiert nicht, dass sie richtig ist – das Modell kann durchaus jedes Mal denselben Fehler machen.

Nach Abschluss beider Prüfwege beginnt die Entscheidungsphase: Es wird das Ergebnis mit der besten Grundlage als Basis ausgewählt, auf Basis der gefundenen Belege werden Korrekturen vorgenommen, bei Bedarf wird alles komplett neu gemacht, und ungeklärte Fragen werden separat vermerkt. Das Framework stattet den Prüfer mit einem Arbeitsbereich, Werkzeugen zur Beweissuche und einem Satz wiederverwendbarer "Verifikationsfähigkeiten" aus; laut Paper können sich diese Fähigkeiten anhand von Fehlschlägen auch selbst verbessern.

Was wurde getestet, wie viel bringt es

Die Bewertung umfasst fünf Benchmarks für langwierige Arbeitsbereichsaufgaben: APEX-Agents, Workspace-Bench Lite, WorkBuddy Bench, SpreadsheetBench 2 und JobBench, überwiegend Aufgaben mit abzuliefernden Dateien wie Bürodokumenten, Tabellen oder Bewerbungsunterlagen. Generierung und Prüfung laufen über dasselbe Modell, getestet wurden zwei: Gemini 3.5 Flash und Claude Opus 4.8, beide über Vertex AI angesprochen.

Laut Paper und README belegt VeriHarness bei der "Auswahlpunktzahl" in allen fünf Benchmarks den ersten Platz, verglichen mit einmaligen Durchläufen und früheren LLM-as-a-Verifier-Methoden. Zusammen mit der belegbasierten Korrektur steigt Gemini 3.5 Flash gegenüber der einmaligen Generierung im Schnitt um 6,2 Punkte, Claude Opus 4.8 um 6,4 Punkte.

Das Team hat zudem rund 26.000 Lauftrajektorien auf Hugging Face veröffentlicht – beide Modelle wurden bei jeder Aufgabe in den fünf Benchmarks je 10 Mal durchlaufen, samt gerenderten Ausführungsprozessen, abgelieferten Dateien und Bewertungen. Eingaben und Musterlösungen der Benchmarks wurden nicht veröffentlicht. Laut Paper kostete die Erstellung dieses Datensatzes über 100.000 US-Dollar.

Der Unterschied zu "mehrfach laufen lassen und abstimmen"

Ein Modell mehrfach laufen zu lassen und dann abzustimmen, ist in der Branche eine gängige Methode zur Punktsteigerung – günstig, leicht umzusetzen, bei kurzen Fragen deutlich wirksam. Bei Langzeitaufgaben gibt es dagegen zwei Probleme: Das Ergebnis ist eine Datei, über die sich nicht einfach abstimmen lässt; und wenn die Ergebnisse übereinstimmen, bewahrt die Abstimmung gemeinsame Fehler unverändert. Die beiden Wege von VeriHarness zielen genau auf diese beiden Probleme.

Ein weiterer verbreiteter Ansatz ist, ein Modell als Schiedsrichter einzusetzen, das mehrere Ergebnisse liest und direkt bewertet. Dieser Ansatz hängt vom Leseverständnis des Schiedsrichters ab und kehrt nicht zur Umgebung zurück, um zu verifizieren. VeriHarness stellt ins Zentrum, ob sich in der Umgebung Belege finden lassen – der Preis dafür ist, dass die Prüfung selbst zu einer Agentenaufgabe wird, die Werkzeuge aufruft und Tokens verbraucht. Das Paper nennt kein Verhältnis der Zusatzkosten der Prüfung zur Generierung; Unternehmen, die diese Kosten berechnen wollen, müssen derzeit selbst testen.

Die Seite hat zuvor über Microsofts ThinkingBox-Benchmark berichtet, der verlangt, dieselbe Aufgabe 20 Mal zu wiederholen, um zu sehen, wie stabil die Ergebnisse eines Agenten sind. Betrachtet man beide Arbeiten zusammen, zeigt sich die gleiche Richtung: Bei Langzeitaufgaben hat die Punktzahl eines einzelnen Durchlaufs nur begrenzten Aussagewert, die Abweichung zwischen mehreren Durchläufen ist selbst ein Signal – einmal zur Messung der Stabilität genutzt, einmal zur Fehlerkorrektur.

Ist es direkt nutzbar

Laut README läuft die Umgebung unter Linux und benötigt Python 3.10 oder höher, Node.js 22.19 oder höher, Docker sowie unprivilegierte User-Namespaces; im Unterbau läuft es auf der Open-Source-Runtime pi, sodass alle von pi unterstützten Modellanbieter angebunden werden können. Auf der Projektseite steht außerdem ein Satz:

"This is not an officially supported Google product." (Dies ist kein offiziell von Google unterstütztes Produkt.)

Das heißt, derzeit handelt es sich um Forschungscode, für dessen Pflege Google keine Zusage macht. Die beiden im Paper getesteten Modelle sind jeweils nicht die neueste Generation ihrer Anbieter; wie viel von der Verbesserung mit Gemini 4 oder Opus 5.5 übrig bliebe, haben die Autoren nicht getestet – das bleibt einer Nachbildung durch Dritte vorbehalten.

Quellen: arXiv-Paper "VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks", GitHub-Projektseite von Google Research, CocoLoop, Hugging-Face-Datensatzseite; Paper und README belegen die Namen der fünf Benchmarks, die durchschnittlichen Punktzuwächse beider Modelle, die rund 26.000 Trajektorien sowie die Umgebungsanforderungen.