Microsofts neuer Benchmark lässt KI-Agenten 20-mal laufen – kaum die Hälfte besteht zuverlässig

Microsoft und Hugging Face haben gemeinsam das Agenten-Bewertungsframework ThinkingBox und den zugehörigen Benchmark ThinkingBox-Bench vorgestellt. Bewertet wird nicht, was der Agent selbst als „erledigt“ meldet, sondern der tatsächliche Zustand der Backend-Datenbank, nachdem der Agent seine Arbeit beendet hat.

Der Benchmark umfasst 507 zustandsbehaftete Geschäftsprozess-Aufgaben aus fünf Branchen: Einzelhandel (98), Kfz-Versicherung (100), Reisen (104), digitales Banking (104) und Beratung (101). Jede Aufgabe läuft unabhängig 20-mal auf einem sauberen Backend, geprüft durch ausführbare Checkskripte, die den finalen Datenbankzustand und Nebenwirkungen abgleichen – etwa ob das richtige Feld korrekt geändert wurde oder ob nebenbei ein Datensatz verändert wurde, der unangetastet bleiben sollte.

“The Agent Said It Was Done. The Database Disagreed.”

(Der Agent sagte, er sei fertig. Die Datenbank sah das anders.)

Die Ergebnisse der 18 Modelle

Getestet wurden 18 Modelle, sowohl Closed-Source als auch Open-Weight. Gemessen am Kriterium „alle 20 von 20 Durchläufen bestanden“ liegen Claude Opus 5.5 und Claude Opus 5 gleichauf an der Spitze und lösen jeweils stabil 241 Aufgaben, also 47,53 Prozent; GPT-6 Astra folgt mit 231 Aufgaben beziehungsweise 45,56 Prozent auf Platz drei. Anders gesagt: Selbst das beste Modell schafft es bei mehr als der Hälfte der Aufgaben nicht, jedes Mal fehlerfrei zu arbeiten.

Die breiteste Abdeckung erreicht Kimi-K3: Von 507 Aufgaben wurden 476 mindestens einmal korrekt gelöst, eine Quote von 93,89 Prozent. Bei allen 20 Durchläufen fehlerfrei war es jedoch nur bei 68 Aufgaben. Dasselbe Modell wirkt nach pass@20 fast allmächtig, fällt bei der Stabilität aber weit zurück – die beiden Zahlen unterscheiden sich um das Siebenfache.

Die Fehlerstatistik ist noch konkreter. Von 79.853 Versuchen, die normal durchliefen, aber ein falsches Ergebnis lieferten, wiesen 77,61 Prozent falsch geschriebene Feldwerte auf, 43,30 Prozent verursachten unerwartete Nebenwirkungen (beide Kategorien können gleichzeitig auftreten). Das Team schätzt, dass rund 80 Prozent der Fehler beim Werkzeugaufruf entstehen, etwa durch falsch übergebene Parameter oder eine falsche Aufrufreihenfolge, während Fehler in der eigentlichen Schlussfolgerung seltener sind.

Das Team beziffert zudem die „Kosten pro zuverlässiger Aufgabe“ – also wie viel Geld im Schnitt nötig ist, um eine Aufgabe über 20 Durchläufe hinweg stabil zu lösen: GPT-5.4 liegt bei 6,80 US-Dollar, GPT-6 Astra bei 7,45 US-Dollar, Claude Opus 5.5 bei 7,80 US-Dollar. Die ältere Generation GPT-5.4 schneidet in dieser Kennzahl besser ab als die neueren Modelle.

Im Vergleich zu bestehenden Agenten-Benchmarks

Stabilität über mehrere Durchläufe zu messen, ist keine Erfindung von ThinkingBox. Der 2024 von Sierra veröffentlichte τ-bench führte bereits die pass^k-Kennzahl ein, die verlangt, dass ein Modell dieselbe Aufgabe k-mal hintereinander erfolgreich löst – damals beschränkt auf Einzelhandel und Luftfahrt. Der Unterschied von ThinkingBox liegt im Umfang und in der Bewertungsmethode: Die Aufgabenzahl wächst auf 507, die Branchenzahl auf fünf, und Nebenwirkungen gelten eigenständig als Fehlerkriterium. Nach der Logik von τ-bench wird ein Agent, der nebenbei einen weiteren, unbeteiligten Datensatz verändert, nicht unbedingt abgewertet.

Diese Seite hat zuvor über den Vero-Benchmark aus Berkeley berichtet, bei dem Agenten 43 Softwareprojekte fertigstellen sollten – das beste Ergebnis waren 27 abgeschlossene Projekte, gemessen wurde also, „wie groß die Aufgabe ist, die in einem Durchgang bewältigt werden kann“. ThinkingBox geht in die entgegengesetzte Richtung: Die einzelne Aufgabe ist nicht schwer, entscheidend ist, ob bei zwanzigfacher Wiederholung derselben Sache ein Durchlauf schiefgeht. In Unternehmensprozessen ist Letzteres oft die gefährlichere Fehlerart – ein einmal falsch geänderter Versicherungsbetrag oder ein falsches Überweisungsfeld kostet in der Korrektur meist deutlich mehr als eine unvollendete Aufgabe.

So lässt sich der Benchmark nutzen

Der Code ist unter MIT-Lizenz offen, die Benchmark-Daten stehen unter CDLA-Permissive-2.0, die OpenEnv-Umgebung unter BSD-3-Clause – nutzbar direkt über die OpenEnv-Schnittstelle auf Hugging Face. Für eine lokale Bereitstellung sind Docker und Typesense zur Zustandsverwaltung nötig, Werkzeuge werden über einen MCP-Server bereitgestellt, und es müssen drei Modell-Endpunkte konfiguriert werden: das getestete Agentenmodell, ein simulierter Nutzer und ein Bewertungsmodell.

Sowohl der simulierte Nutzer als auch die Bewertung werden von Modellen übernommen, was selbst eine Fehlerquelle sein kann. Im Blogbeitrag wird keine separate Übereinstimmungsrate zwischen dem Bewertungsmodell und menschlicher Einschätzung genannt – solange diese Zahl fehlt, sollten Unterschiede von ein bis zwei Prozentpunkten zwischen den Modellen nicht überbewertet werden. Am Projekt beteiligt waren außerdem Praktikanten der University of Pittsburgh, der UC Irvine, der Northwestern University und der Columbia University.

Quellen: Hugging-Face-Blog, Microsoft Research, CocoLoop, τ-bench-Paper von Sierra; die Lösungszahlen der einzelnen Modelle, die Fehleranteile und die Kosten pro Aufgabe folgen den vom ThinkingBox-Team veröffentlichten Angaben.