Opus 5.5 erklimmt mit 1509 Punkten die Spitze der Text Arena

Die Modell-Bewertungsplattform Arena verkündete in der Nacht zum 27. September (Pekinger Zeit), dass Claude Opus 5.5 (High) bei seinem ersten Auftritt in der Text Arena direkt auf Platz 1 gelandet ist, mit einer Punktzahl von 1509. Das sind 18 Punkte mehr als die Vorgängergeneration Opus 5 (High), die derzeit auf Platz 11 liegt.

Die Text Arena ist das älteste Ranking von Arena: Nutzer sehen gleichzeitig die Antworten zweier anonymer Modelle und stimmen für die bessere ab, die Plattform rechnet das anschließend nach einer Elo-ähnlichen Methode in Punkte um. Das Ranking hat inzwischen über 8,5 Millionen Stimmen gesammelt, verteilt über Schreiben, Programmieren, Mathematik und alltägliche Fragen.

Die ersten sechs Plätze gehören alle Anthropic

Nach dem jüngsten Update stammen die ersten sechs Plätze der Text Arena allesamt von Anthropic. Laut Reihenfolge auf der Arena-Seite:

PlatzModellPunkteStimmen
1Claude Opus 5.5 (High)1509 ±122.307
2Claude Opus 4.6 (High)1505 ±376.518
3Claude Fable 5 (High)1504 ±436.462
4Claude Opus 4.7 (High)1502 ±464.007
5Claude Fable 5.1 (Max)1501 ±79.942
6Claude Opus 4.61498 ±380.836

Auf Platz sieben folgt Metas Muse Spark 1.2 (xHigh) mit 1496 Punkten; Googles bestplatziertes Modell ist Gemini 3.8 Flash (High) auf Platz zehn mit 1492 Punkten. Unter den Top 15 tauchen nur die drei Namen Anthropic, Meta und Google auf; die GPT-6-Reihe, die OpenAI erst am 22. September vorgestellt hat, erscheint in diesem Bereich nicht.

Arena markiert Opus 5.5 zudem auf der Preis-Leistungs-Grenze der Text Arena. Umgerechnet auf Input- und Output-Preise liegt sein Mischpreis bei 16 US-Dollar pro Million Token. Anthropic hat für Opus 5.5 einen API-Preis von 4 US-Dollar für Input und 20 US-Dollar für Output festgelegt, beides ein Fünftel weniger als bei Opus 5.

Noch zu wenige Stimmen

Zwischen Platz eins und Platz sechs liegen nur 11 Punkte, während das eigene Konfidenzintervall von Opus 5.5 bereits ±12 beträgt. Anders gesagt: Zwischen dem ersten und dem sechsten Platz lassen sich diese Modelle statistisch derzeit nicht voneinander unterscheiden.

Der Grund liegt in der Stimmenzahl. Opus 5.5 ist noch keine Woche online und hat erst 2.307 Stimmen gesammelt; das dahinter platzierte Opus 4.6 (High) kommt bereits auf über 76.000, mit einer Spanne von nur ±3. Dass neue Modelle kurz nach ihrem Einstieg ins Ranking eine breite Fehlerspanne und stark schwankende Punktzahlen haben, ist bei Arena normal - in den kommenden Wochen kann die Punktzahl ebenso gut steigen wie fallen.

Auch in seinem Beitrag sprach Arena lediglich davon, das Modell sei „gleich beim Debüt an die Spitze“ gegangen, ohne Rankings nach einzelnen Kategorien zu nennen. Wie Opus 5.5 in den Teilranglisten für Programmieren, Mathematik oder kreatives Schreiben abschneidet, ist bislang nicht veröffentlicht.

Warum Opus 5 hinter älteren Modellen liegt

Bemerkenswerter an diesem Ranking ist Opus 5. Nach Veröffentlichungsreihenfolge ist es neuer als Opus 4.6 und 4.7, landet in der Text Arena aber nur auf Platz 11 - 14 Punkte hinter Opus 4.6 (High) und 13 Punkte hinter dem hauseigenen Fable 5 (High).

Die Text Arena misst, welche Antwort Nutzer im anonymen Vergleich bevorzugen, was nicht mit der Trefferquote bei korrekten Lösungen gleichzusetzen ist. Länge, Tonfall und Format der Antworten beeinflussen die Abstimmung; ein Modell, das bei Denkaufgaben eigentlich stärker ist, kann eine Präferenzabstimmung durchaus verlieren, wenn es zu weitschweifig schreibt oder zu sehr wie eine Bedienungsanleitung klingt.

Anthropic hat in dieser Generation Arbeit ins Schreiben gesteckt. Ingenieure des Unternehmens hatten zuvor öffentlich erklärt, warum sich Claudes Schreibstil verschlechtert hatte: Die Belohnungsgewichtung beim Reinforcement Learning habe dazu geführt, dass das Modell zunehmend so schrieb, als richte es sich an eine KI als Leser. Opus 5.5 ist die erste Version mit gezielten Verbesserungen an der Satzklarheit. Wie viele der 18 Punkte, um die Opus 5.5 Opus 5 übertrifft, aus dieser Schreib-Anpassung stammen und wie viele aus tatsächlich gestiegenen Fähigkeiten, lässt sich aus den Arena-Daten nicht trennen; auch Anthropic hat dazu keine entsprechenden Auswertungen vorgelegt.

Reiht man die Generationen aneinander, ergibt sich folgendes Bild: Opus 4.6 und 4.7 halten sich bis heute in den Top 4, Opus 5 konnte nach seinem Erscheinen die Nachfolge nicht antreten, und erst Opus 5.5 hat den ersten Platz mit einem neuen Gesicht besetzt. Anthropics wichtigster Konkurrent auf diesem Präferenz-Ranking ist derzeit die eigene alte Version.

Quellen: offizieller Arena-Account, Arena-Text-Ranking, CocoLoop, Anthropics Preisseite für Modelle; Punktzahlen, Konfidenzintervalle und Stimmenzahlen entsprechen dem aktuellen Stand der Arena-Seite.