Jackson Kernion, der Ingenieur bei Anthropic, der für das Fine-Tuning von Claude zuständig ist, hat kürzlich auf X in mehreren Beiträgen erklärt, warum viele Nutzer das Gefühl haben, Claude werde zwar immer klüger, seine Texte aber gleichzeitig immer schwerer lesbar. Seine Erklärung ist direkt: Spätere Modelle setzen im Training einen Schwerpunkt auf Mathematik und Code und wurden zudem stark darauf trainiert, "technische Erklärungen für andere KI-Modelle zu schreiben". Dadurch habe sich das Modell zunehmend an die "Psychologie von LLMs" gewöhnt und gelernt, für KI zu schreiben, statt für Menschen.
Ausgelöst wurde die Diskussion durch Nutzerbeschwerden über die Schreibqualität von Claude; manche meinen, Opus 4.6 sei das letzte wirklich gute "Schreibmodell" von Anthropic gewesen. Kernion widersprach diesem Eindruck nicht.
Woher kommt der "Claude-Ton"
Kernions Erklärung setzt bei der Belohnungsgestaltung im Reinforcement Learning an. Ein Teil der Belohnung im Training richtet sich danach, ob "ein anderes Modell den Text versteht", ein anderer Teil danach, ob "ein Mensch ihn versteht". Je größer der Anteil von Mathematik- und Code-Training, desto stärker das erste Signal – und desto eher neigt das Modell dazu, extrem verdichtete, mit Fachbegriffen überladene Absätze zu produzieren. Für den Eindruck beim menschlichen Lesen verwendet er einen Begriff: overly-dense info dumps, übermäßig dichte Informationsschütten.
Er zieht dazu einen Vergleich heran: Eine Gruppe, die nur untereinander kommuniziert, entwickelt mit der Zeit eine Ausdrucksweise, die innerhalb der Gruppe flüssig, außerhalb aber schwer verständlich ist. Zwischen Modellen laufe es ähnlich ab.
Um das zu korrigieren, müsse man im Training gezielt nachsteuern und einfache Erklärungen belohnen, denen menschliche Leser folgen können. Kernion sagt, das sei schwierig, das Team werde weiter daran arbeiten.
Was Opus 5.5 verändert hat
Er schrieb in seinem Beitrag:
"Opus 5.5 is our first model release with targeted improvements on sentence clarity and overly-dense info dumps." Opus 5.5 ist unser erstes Modell-Release mit gezielten Verbesserungen bei der Satzklarheit und bei übermäßig dichten Informationsschütten.
Direkt danach ergänzte er: Seit Opus 4.6 sei er mit der Schreibqualität keines Modells mehr so zufrieden gewesen. Diese Formulierung lässt Spielraum – er sagte nicht, dass Opus 5.5 bereits besser sei als 4.6.
Bei der Veröffentlichung von Opus 5.5 berichteten auch externe Medien, dass Anthropic versprochen habe, den "Claudish"-Stil zu reduzieren. Englischsprachige Nutzer hatten zuvor typische Symptome aufgelistet: sich wiederholende feste Formulierungen, mehrfach verschachtelte Zwischenüberschriften, das Zerlegen eines Sachverhalts in zu viele Stichpunkte. Das sind Einschätzungen der Nutzerseite; Anthropic hat weder eine offizielle Liste des "Claude-Tons" veröffentlicht noch Bewertungswerte zur Lesbarkeit der Texte.
Was bedeutet das für chinesischsprachige Nutzer
Alles, was Kernion diskutiert, bezieht sich auf englischsprachige Szenarien. Ob die chinesische Ausgabe die gleiche Tendenz zeigt und ob die gezielte Verbesserung auch das Chinesische abdeckt, erwähnte er nicht – auch Anthropic hat sich dazu nicht gesondert geäußert.
Aus seiner Erklärung lässt sich eines ableiten: Die Tendenz hängt von der Aufgabenart ab. Je technischer die Aufgabe, desto eher wechselt das Modell in den Modus "Schreiben für ein Modell". Entwickler, die Claude für API-Dokumentation, Lösungsbeschreibungen oder Code-Kommentare nutzen, fallen genau in diesen Bereich.
Solange es keine offiziellen Daten für das Chinesische gibt, empfiehlt die Redaktion zwei erfahrungsbasierte Vorgehensweisen: Erstens im Prompt klar benennen, wer die Leserschaft ist, etwa "für einen neu eingestiegenen Produktmanager" – das funktioniert besser als der Hinweis "einfacher schreiben". Zweitens das Modell zuerst die Schlussfolgerung formulieren und dann ausführen lassen sowie die Zahl der Informationspunkte pro Absatz begrenzen. Teams, die bereits auf Opus 5.5 umgestiegen sind, können dieselben alten Prompts erneut laufen lassen und die Ausgaben aus der Zeit von 4.6 und 5.x vergleichen, um selbst zu beurteilen, wie groß die Verbesserung ausfällt.
Quellen: X-Beiträge von Jackson Kernion, The Decoder, CocoLoop, Ifeng Tech; Kernions Position und Originalzitate wurden anhand seiner eigenen Beiträge und Medienberichten abgeglichen.