Zhipu bringt GLM-5.3-FlashX: fünfmal schneller, zweieinhalbmal teurer

Zhipu hat am 18. September GLM-5.3-FlashX vorgestellt, die API steht parallel zur Verfügung, die Modellkennung lautet GLM-5.3-FlashX. Offiziell gibt es nur eine Kennzahl: eine maximale Ausgabegeschwindigkeit von 200 Tokens pro Sekunde – laut Zhipu das Fünffache des bisherigen GLM-5.3-Flash.

An den Fähigkeiten selbst hat sich in dieser Stufe nichts geändert. Laut offener Dokumentation teilen sich Flash und FlashX dieselben Spezifikationen: ein Kontextfenster von einer Million Tokens, maximal 128.000 Tokens Ausgabe, Eingabe unterstützt Video, Bild, Text und Dateien, Ausgabe erfolgt als Text, dazu Denkmodus, Tool-Aufrufe, Streaming, Kontext-Caching und strukturierte JSON-Ausgabe. Der Unterschied ist klar benannt: FlashX bringt Durchsatz, Flash sichert den niedrigeren Preis.

Der Preis steigt mit der Geschwindigkeit

Laut öffentlichen Berichten liegt der Preis bei 2 Yuan pro Million Input-Tokens und 7 Yuan pro Million Output-Tokens – das 2,5-Fache der ursprünglichen Flash-Stufe. Zhipu selbst hat diesen Punkt in der Ankündigung nicht hervorgehoben, in den sozialen Netzwerken dreht sich die Diskussion fast ausschließlich um diesen Tausch von Geschwindigkeit gegen Kosten.

Rechnet man mit dem Faktor 2,5 zurück, liegt der Output-Preis der Flash-Stufe bei grob 2,8 Yuan pro Million Tokens. Für ein Agenten-Geschäft mit durchschnittlich einer Milliarde Output-Tokens pro Tag kostet die Ausgabe über Flash rund 84.000 Yuan im Monat, über FlashX rund 210.000 Yuan – die Differenz von 126.000 Yuan kauft dieselbe Arbeitsmenge, nur schneller erledigt. Ob sich das lohnt, hängt davon ab, ob das Geschäft durch First-Token-Latenz und Warteschlangenlänge ausgebremst wird: Bei Dialogprodukten, Echtzeit-Untertiteln oder Code-Vervollständigung, wo jede Sekunde zählt, sind 200 Tokens pro Sekunde und gut vierzig Tokens pro Sekunde zwei verschiedene Erlebnisklassen. Bei Offline-Batchverarbeitung, Dokumentenanalyse oder nächtlichen Datenläufen, wo ein paar Minuten mehr nichts kosten, bleibt Flash die passendere Wahl.

Woher kommen die 200 Tokens pro Sekunde

Zhipus Erklärung: Auf Basis der Inferenzleistung von 100.000 heimischen Chips wurde die Inferenzoptimierung verstärkt. Der Satz bleibt vage – ob die Optimierung bei spekulativer Dekodierung, paralleler Zuteilung oder Speicherorganisation ansetzt, sagt die Ankündigung nicht; ob sich die 100.000 Chips nur auf den eigenen Cluster beziehen oder Partner einschließen, wird ebenfalls nicht offengelegt.

Der Vorgänger von FlashX hat eine öffentliche Vorgeschichte. GLM-5.3-Flash lief unter dem Codenamen Ox Alpha eine Weile in der internationalen Entwickler-Community, das Aufrufvolumen habe laut Zhipu zeitweise mehr als das Doppelte von DeepSeek erreicht. Von Ox Alpha über Flash bis FlashX verfolgt Zhipu auf dieser Linie ein konsistentes Muster: erst mit niedrigen Preisen das Aufrufvolumen aufbauen, die tatsächliche Lastform erkunden, dann nach Geschwindigkeitsstufen gestaffelt abrechnen. Beim offiziellen Start von GLM-5.3 kostete eine Million Output-Tokens 4,4 US-Dollar; die Flash-Stufe drückte die aktivierten Parameter auf 18 Milliarden, um die Kosten zu senken; FlashX ist auf derselben Kurve ein weiterer Schritt in Richtung Geschwindigkeit.

Was der Preisaufschlag signalisiert

Die Standardbewegung chinesischer Großmodelle im vergangenen guten Jahr war Preissenkung – wer zuerst senkt, holt sich das Volumen. FlashX geht den umgekehrten Weg: gleiche Leistung zu einem höheren Preis, verkauft als Geschwindigkeit. Das funktioniert nur, wenn das Angebot auf der Inferenzseite nicht mehr unbegrenzt billig ist und die freie Kapazität im Cluster selbst zu etwas Bepreisbarem wird.

Ob sich das hält, entscheidet sich an zwei Punkten: ob vergleichbare heimische Konkurrenten in den kommenden Wochen mit eigenen Preisanhebungen nachziehen, und ob FlashX das Tempo-Limit von 200 Tokens pro Sekunde auch bei hoher Gleichzeitigkeit halten kann. Unabhängige Belastungstests dazu liegen bislang nicht öffentlich vor.

Quellen: Zhipu-Open-Platform-Dokumentation, offizielle Ankündigung von Zhipu, CocoLoop, Sina Technology, Chinaz; Geschwindigkeits- und Kontextangaben gegen die offizielle Dokumentation geprüft, Preisangaben nach öffentlichen Berichten.