Astra und Sol: Abo-Tempo steigt auf 50 Token pro Sekunde

OpenAI hat die Standard-Ausgabegeschwindigkeit von GPT-6 Astra und GPT-6.1 Sol in den Abonnement-Produkten eine Stufe angehoben. Codex-Chef Thibault Sottiaux kündigte am 5. Oktober auf einer Social-Media-Plattform an, dass die Standardgeschwindigkeit beider Modelle insgesamt um etwa 50 % steige – von rund 30 Token pro Sekunde auf rund 50 Token. Das betrifft alle eigenen Produkte von OpenAI sowie sämtliche Partner-Apps, die über "Sign in with ChatGPT" angebunden sind.

Nutzer müssen keine Einstellungen ändern. Laut Sottiaux wird das Update innerhalb von zwei Stunden nach und nach für alle ausgerollt.

Die "Verbesserung" am nächsten Tag

Der Zeitpunkt dieser Beschleunigung kommt nicht überraschend. Am 4. Oktober setzte Sottiaux dem Codex-Team eine öffentliche 28-Tage-Frist: Jeden Tag muss entweder etwas veröffentlicht werden, das für die Mehrheit der Codex- und ChatGPT-Work-Nutzer spürbar besser wird, oder es gibt für alle ein vollständiges Reset der Nutzungslimits.

Die Geschwindigkeitssteigerung passt genau in das Kriterium "von der Mehrheit der Nutzer spürbar". Sie ist unabhängig vom Anwendungsfall – Code schreiben, Informationen recherchieren, Agenten-Aufgaben ausführen profitieren alle davon –, und Nutzer müssen auch keine neuen Funktionen erst lernen. In einem Versprechen, das täglich etwas "abliefern" muss, lässt sich eine solche Änderung am leichtesten anerkennen.

Die Reichweite ist größer als eine reine ChatGPT-Änderung. Die von Sottiaux genannten Partner umfassen das Open-Source-Programmiertool OpenCode, Pi, Amp sowie Devin von Cognition. Diese Produkte erlauben Nutzern, sich direkt mit ihrem ChatGPT-Abonnement anzumelden und dabei das Abo-Kontingent statt der API-Abrechnung zu nutzen – die Geschwindigkeitssteigerung auf der Abo-Seite wird also unverändert an sie weitergegeben.

Von 30 auf 50 – mehr als die Hälfte

Offiziell ist von "rund 50 %" die Rede, rechnet man jedoch mit den beiden genannten Zahlen – 30 Token pro Sekunde auf 50 Token –, ergibt sich ein Zuwachs von etwa 67 %. Worin der Unterschied zwischen den beiden Angaben liegt, hat Sottiaux nicht erklärt. Eine Möglichkeit ist, dass sich die 50 % auf das gesamte Ende-zu-Ende-Erlebnis beziehen, einschließlich der Wartezeit bis zum ersten Token, während allein die Generierungsphase bei etwa zwei Dritteln liegt.

Umgerechnet in für Nutzer spürbare Zeit, eine grobe Schätzung:

Ausgabelänge30 Token/s50 Token/s
Ein Codeabschnitt mit 2.000 Tokenca. 67 Sekundenca. 40 Sekunden
Eine Agenten-Aufgabe mit 20.000 Token Ausgabeca. 11 Minutenca. 6,7 Minuten

Das betrifft nur die Zeit, in der das Modell Text erzeugt. Bei Agenten-Aufgaben kommen noch Werkzeugaufrufe, Testläufe und Wartezeiten im Netzwerk hinzu – diese Anteile werden durch die höhere Geschwindigkeit nicht kürzer. Der tatsächlich bei einer kompletten Aufgabe eingesparte Anteil liegt daher niedriger als in der Tabelle.

Tokenizer und Token-Verbrauch

Sottiaux erwähnte außerdem, dass beide Modelle einen optimierten Tokenizer nutzen, wodurch für dieselbe Aufgabe weniger Token benötigt werden. Wie stark der Rückgang konkret ausfällt, hat OpenAI nicht angegeben.

Dieser Punkt könnte für Abonnenten direkter spürbar sein als die Geschwindigkeit selbst. Die Kontingente von Codex und ChatGPT Work werden nach Token-Verbrauch berechnet: Wird für dieselbe Aufgabe weniger verbraucht, reicht dasselbe Kontingent für mehr Arbeit. Umgekehrt ändert die reine Geschwindigkeitssteigerung das Kontingent selbst nicht – schnellere Textausgabe bedeutet lediglich, dass Nutzer das Limit des Fünf-Stunden-Fensters früher erreichen. Mehrere Medienberichte wiesen genau darauf hin.

Als GPT-6.1 Sol am 29. September auf dem DevDay vorgestellt wurde, stellten unabhängige Tests fest, dass es für dieselbe Aufgabe 10 bis 30 % mehr Ausgabe-Token benötigte als die Vorgängerversion. Wie viel davon der neue Tokenizer ausgleichen kann, zeigt sich erst, wenn unabhängige Tests erneut durchgeführt werden.

Auf der API-Seite bislang keine Änderung

Die Rollenverteilung zwischen beiden Modellen ist klar. GPT-6 Astra ist das Flaggschiff, der Standard-API-Preis liegt bei 10 US-Dollar pro Million Eingabe-Token und 50 US-Dollar für Ausgabe-Token; GPT-6.1 Sol ist auf Programmier-Agenten und Computersteuerung ausgelegt, mit 2 US-Dollar für Eingabe und 10 US-Dollar für Ausgabe – jeweils ein Fünftel des Astra-Preises. Die Geschwindigkeitssteigerung auf der Abo-Seite betrifft beide Modelle gleichzeitig.

Diese Anpassung betrifft ausschließlich die Standardgeschwindigkeit in den Abonnement-Produkten. Ob sich die Geschwindigkeit für API-Nutzer, die pro Token zahlen, ebenfalls ändert, wurde von Sottiaux nicht erwähnt, und auch die API-Dokumentation von OpenAI wurde dazu bislang nicht aktualisiert.

Quellen: öffentliche Äußerungen von Thibault Sottiaux auf Social Media, CocoLoop, RuntimeWire, Crypto Briefing; die Ausgaberate basiert auf den offiziell genannten Token-pro-Sekunde-Werten, Zuwachs und Zeitersparnis sind danach hochgerechnet.