Anthropic hat Claude Sonnet 5.5 am 28. September veröffentlicht, das zweite Modell der Claude-5.5-Familie nach Opus 5.5. Das Unternehmen nennt zwei zentrale Zahlen: mindestens 30 Prozent schneller als Sonnet 5, und bei den meisten Aufgaben bis zu 30 Prozent geringere Kosten pro Aufgabe. Die API-Preise bleiben unverändert: 2 US-Dollar pro Million Input-Token, 10 US-Dollar für Output-Token und 0,2 US-Dollar für Cache-Lesevorgänge.
Das Modell ist ab dem Starttag auf der eigenen Claude-Plattform, bei AWS, Google Cloud und Microsoft Azure verfügbar, unter dem API-Namen claude-sonnet-5-5; die Zero-Data-Retention-Option steht wie gewohnt auf allen Plattformen zur Verfügung. Der unabhängige Entwickler Simon Willison stellte fest, dass die kostenlose Stufe von claude.ai bereits auf Sonnet 5.5 umgestellt wurde.
Die offizielle Bilanz
Das sind die wichtigsten Ergebnisse, die Anthropic auf seiner Launch-Seite aufführt:
| Benchmark | Sonnet 5.5 |
|---|---|
| Terminal-Bench 4.0 | 70,6 % |
| OSWorld 2.1 (Teilmenge) | 80,1 % |
| Humanity's Last Exam (mit Tools) | 64,5 % |
| CursorBench 4.0 | 55,5 % |
| FrontierCode 1.1 (Max) | 46,2 % |
| GDPval-AA v2.1 | 1844 |
Das Feedback mehrerer früher Kunden konzentriert sich auf die Geschwindigkeit. Box gibt an, das neue Modell sei 2,4-mal schneller als die Vorversion, und Slack berichtet, ohne Änderung der Prompts bessere und schnellere Ergebnisse erhalten zu haben.
"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."
Sonnet 5.5 codet schnell, und in iterativen Workflows reicht laut Tyler Nishida von Every ein einziger Hinweis, um es wieder auf Kurs zu bringen.
Die andere Seite aus unabhängigen Tests
Artificial Analysis vergibt an Sonnet 5.5 einen Intelligenz-Index von 56 Punkten – Platz zwei, nur 2 Punkte hinter den 58 Punkten von Opus 5.5. Im eigenen Terminal-Bench-4.0-Test erreicht Sonnet 5.5 64 Prozent, Opus 5.5 und GPT-6 Astra liegen jeweils bei 60 Prozent. Die Schwachstelle liegt bei Faktenfragen: 54 Prozent Faktengenauigkeit gegenüber 66 Prozent bei Opus 5.5, zudem liegt es bei wissenschaftlichen Reasoning-Tests 6 Punkte hinter Opus 5.5.
Bei den Kosten passt es nicht zur offiziellen Darstellung. Beim Durchlauf des gesamten Testsatzes auf der höchsten Reasoning-Stufe (max) misst Artificial Analysis, dass Sonnet 5.5 im Schnitt rund 193.000 Output-Token pro Aufgabe erzeugt – etwa 60 Prozent mehr als Opus 5.5 und Sonnet 5 auf derselben Max-Stufe und siebenmal so viel wie GPT-6 Astra. Da der Preis pro Token gleich bleibt, aber mehr Token anfallen, liegen die Kosten pro Aufgabe bei rund 7,6 US-Dollar – etwa 50 Prozent mehr als bei Sonnet 5.
Die beiden Maßstäbe unterscheiden sich. Anthropic spricht von "den meisten Aufgaben", also alltäglichem Programmieren und Schreiben auf der Standardstufe; Artificial Analysis testet den Extremfall mit voll ausgeschöpftem Reasoning-Budget. Willison stieß auf dasselbe Phänomen: Er ließ das Modell auf der Max-Stufe eine kleine WebGL-Anwendung schreiben, was 128.000 Token und 1,28 US-Dollar kostete; auf der Stufe xhigh lag das Ergebnis nach 41 Sekunden vor und kostete nur rund 0,06 US-Dollar. Er weist zudem darauf hin, dass Sonnet 5.5 denselben Schwachpunkt wie Opus 5.5 hat: Auf der Max-Stufe wird das Token-Limit leicht ausgeschöpft.
Im Vergleich zu Modellen derselben Klasse
Insgesamt betrachtet ist die Positionierung der Sonnet-Reihe jetzt klar: 80 bis 90 Prozent der Fähigkeiten von Opus zu einem niedrigeren Preis. Beim Start von Sonnet 5 stand vor allem im Fokus, dass Agentenaufgaben nur etwa ein Drittel der Kosten von Opus verursachen; mit der 5.5-Generation zieht die Geschwindigkeit an, und die Benchmark-Werte rücken noch näher an Opus 5.5 heran – im Ranking von Artificial Analysis trennen beide nur 2 Punkte.
Die Änderung bei der kostenlosen Stufe hat größere Auswirkungen. Willisons Einschätzung zufolge erhalten kostenlose Nutzer von claude.ai jetzt ein Modell, das deutlich stärker ist als die Luna-Serie, die auf der kostenlosen Stufe von ChatGPT läuft. Bei OpenAI setzt GPT-6 Luna auf niedrige Preise: Die neuesten Arena-Daten zeigen Kosten von nur rund 0,05 US-Dollar pro Aufgabe. Anthropic hat Haiku 5.5 noch nicht angekündigt; Willison erwartet die Veröffentlichung in den kommenden Wochen, wenn die günstige Stufe direkt auf Luna trifft.
Für Entwickler lautet die konkreteste Empfehlung, nicht vorschnell die Max-Stufe zu aktivieren. Nach den derzeit verfügbaren Daten kommen die Standard- oder die xhigh-Stufe der offiziellen Ankündigung von "schneller und günstiger" näher, während die Rechnung auf der Max-Stufe sogar höher ausfallen kann als bei der Vorgängergeneration. Anthropic hat keine nach Stufen aufgeschlüsselte Kostentabelle veröffentlicht, sodass sich die Wirtschaftlichkeit für die eigene Aufgabe nur durch einen eigenen Test klären lässt.
Quellen: offizielle Launch-Seite von Anthropic, Blog von Simon Willison, CocoLoop, Testbericht von Artificial Analysis; die API-Preise entsprechen der Launch-Seite von Anthropic, Kosten pro Aufgabe und Token-Verbrauch entsprechen der Max-Stufe des Intelligenz-Index von Artificial Analysis.