Die Bewertungsplattform Arena hat am 2. Oktober Claude Sonnet 5.5 (Max-Stufe) und GPT-6.1 Sol (Max-Stufe) in die Rangliste der Agent Arena aufgenommen. Die beiden Modelle belegen Platz 3 und Platz 5, mit Netto-Verbesserungsraten von 12,52 % und 11,23 %. Die ersten beiden Plätze gehören weiterhin Anthropics eigenen Modellen Claude Fable 5.1 (14,31 %) und Opus 5.5 (13,82 %); Platz 4 belegt GPT-6 Astra (12,27 %).
Die Agent Arena bewertet anders als die bekannten Text-Arenen. Sie erfasst reale Sitzungen, in denen Nutzer das Modell als Agenten einsetzen: Das Modell muss Werkzeuge aufrufen, mehrstufige Aufgaben ausführen, und am Ende zählt, ob der Nutzer zufrieden war. Laut Ranglisten-Seite sind bislang rund 2,158 Millionen Sitzungen zusammengekommen, verteilt auf 51 Modelle. Die Netto-Verbesserungsrate fasst die Zuverlässigkeit von Werkzeugaufrufen, den Aufgabenabschluss und die Steuerbarkeit (Steerability) zusammen; am 30. September hat Arena den Steuerbarkeits-Algorithmus überarbeitet: Bisher prüfte er nur, „ob nach einer Korrektur tatsächlich etwas geändert wurde", jetzt bewertet er jede bewertbare Antwort im gesamten Dialog, sodass Modelle, die gleich beim ersten Versuch richtig liegen, zusätzliche Punkte erhalten.
Platz 3 und 5 – der Unterschied liegt in der Fehlertoleranz
Rein nach Rang liegt Sonnet 5.5 vor GPT-6 Astra und GPT-6.1 Sol. Bezieht man die Fehlerspannen ein, ergibt sich ein anderes Bild: Sonnet 5.5 kommt auf 12,52 % ± 3,09 %, GPT-6.1 Sol auf 11,23 % ± 2,76 % – die Bereiche überlappen sich großteils und liegen nur 0,25 Prozentpunkte von Platz 4 (Astra) entfernt. Weil die neuen Modelle gerade erst gelistet wurden, ist die Stichprobe an Sitzungen noch klein, die Fehlerspanne entsprechend breiter als bei Opus 5.5 (± 2,17 %). Nach dem aktuellen Datenstand lässt sich kaum sagen, wer zwischen Platz 3 und 5 wirklich stärker ist.
Bei den Einzelkategorien hat jedes Modell seine Stärken. Sonnet 5.5 liegt bei der Erholung nach fehlgeschlagenen Bash-Befehlen mit 15,05 % auf Platz 1; GPT-6.1 Sol führt bei Tool-Halluzinationen – der Anteil erfundener, nicht existierender Werkzeuge liegt bei nur 0,49 % – und steht bei „vom Nutzer bestätigter Aufgabenabschluss" mit 15,47 % auf Platz 2.
Bei der Rechnung trennen sich die Wege
Die API-Preise beider Modelle sind identisch: 2 US-Dollar pro Million Input-Token, 10 US-Dollar pro Million Output-Token. Bei Agenten-Aufgaben klafft die Kostenlücke pro Aufgabe dann aber um ein Mehrfaches auseinander. Die Kostenseite von Arena zeigt:
| Modell | Netto-Verbesserungsrate | Kosten pro Aufgabe |
|---|---|---|
| Claude Fable 5.1 | 14,31 % | ca. 4,91 US-Dollar |
| Claude Opus 5.5 | 13,82 % | ca. 1,56 US-Dollar |
| Claude Sonnet 5.5 | 12,52 % | ca. 2,99 US-Dollar |
| GPT-6 Astra | 12,27 % | ca. 3,10 US-Dollar |
| GPT-6.1 Sol | 11,23 % | ca. 0,58 US-Dollar |
| DeepSeek V4.1 Flash | 4,02 % | ca. 0,11 US-Dollar |
Gleicher Token-Preis, aber rund das Fünffache an Kosten pro Aufgabe – der Unterschied liegt im Token-Verbrauch. Sonnet 5.5 schreibt in der Max-Stufe tendenziell länger und „denkt" länger; auch frühere Tests Dritter hatten festgestellt, dass es pro Aufgabe deutlich mehr Token verbraucht als die Vorgängergeneration. Im Ergebnis schneidet es schlechter ab und kostet mehr als das eigene, größere Modell Opus 5.5 und schafft es nicht auf die von Arena markierte Kosten-Effizienzgrenze (Pareto-Grenze). Diese Grenze wird derzeit von vier Punkten gebildet: Fable 5.1, Opus 5.5, GPT-6.1 Sol und DeepSeek V4.1 Flash.
GPT-6.1 Sol ist dasjenige Modell, das diese Grenze diesmal neu gezeichnet hat. Laut dem von Arena zur Veröffentlichung genannten Vergleich: Die medianen Kosten pro Aufgabe liegen 39 % unter der Vorgängerversion GPT-6 Sol, der Score ist dabei um 1,52 Prozentpunkte höher; gegenüber GPT-6 Astra ist es 81 % günstiger, bei einem Score-Abstand von höchstens 1,04 Prozentpunkten. GPT-6.1 Sol hat GPT-6 Sol erst gut eine Woche nach dessen Veröffentlichung abgelöst – diese Rangliste liefert OpenAI eine unabhängige Bestätigung für „billiger, ohne an Punkten zu verlieren".
Auch diese Kostenzahlen haben ihre methodischen Grenzen. Arena erfasst Sitzungen, die Nutzer auf der eigenen Plattform gestartet haben; die Aufgabentypen bestehen vor allem aus Programmieren, Recherche und Befehlsausführung – die Verteilung muss nicht mit echten unternehmensinternen Workflows übereinstimmen. Die Kosten werden anhand der tatsächlichen API-Aufrufe von Arena berechnet; Unternehmensrechnungen mit Cache- oder Mengenrabatten fallen womöglich niedriger aus. Wer diese Tabelle für Beschaffungsentscheidungen nutzt, sollte vorher am besten mit eigenen Stichproben an eigenen Aufgaben nachtesten.
Im Vergleich zur Vorgängergeneration
Blickt man zeitlich zurück, rückt die Sonnet-Reihe in der Agent Arena stetig weiter vor. Die Vorgängerversion Sonnet 5 lag beim ersten Auftritt auf Platz 6, diesmal schafft 5.5 es in die Top 3. Bei OpenAI läuft es in einem anderen Tempo: GPT-6 Sol kam am 25. September mit einer Netto-Verbesserungsrate von 9,71 % in die Liste, eine Woche später legte 6.1 Sol nach, der Score stieg um rund anderthalb Prozentpunkte, die Kosten sanken um etwa 40 %.
Für Entwickler hängt die Modellwahl für Agenten-Aufgaben von der Auslastung ab. Wer nur gelegentlich komplexe Aufgaben ausführt, ist mit einem Modell wie Opus 5.5 – hoher Score, Preis nicht übertrieben – auf der sichereren Seite; wer in großer Zahl und nach Verbrauch abrechnet, für den passen günstige Modelle wie GPT-6.1 Sol oder DeepSeek V4.1 Flash besser. Wo Sonnet 5.5 bei einer niedrigeren Reasoning-Stufe bei Kosten und Score landen würde, ist offen – Arena hat bislang nur die Max-Stufe getestet, dazu gibt es noch keine Daten.
Quellen: Agent-Arena-Rangliste von Arena, Kosten-Grenzseite von Arena, CocoLoop, offizieller Arena-Account, Artificial Analysis; Netto-Verbesserungsraten, Fehlerspannen und Kosten pro Aufgabe der einzelnen Modelle entsprechen den auf der Arena-Seite angezeigten Werten.