OpenAI will 14-fach schnellere API-Stufe breiter öffnen

OpenAI bereitet offenbar vor, den Ultrafast-Inferenzmodus für mehr Entwickler zu öffnen. Am 26. September entdeckten ausländische Medien in der Playground-Oberfläche der Responses API eine noch nicht aktivierte Geschwindigkeitsoption mit drei Stufen: Standard, Fast und Ultrafast. Die Freischaltung könnte rund um den DevDay am 29. September erfolgen, eine offizielle Ankündigung gibt es bislang nicht, der genaue Umfang bleibt offiziellen Angaben vorbehalten.

Derzeit steht Ultrafast nur einer kleinen Gruppe eingeladener Kunden zur Verfügung. Sollte die Drei-Stufen-Option offiziell live gehen, würde Geschwindigkeit von einem internen Testprivileg zu einer Abrechnungsoption, die normale Entwickler je nach Aufgabe frei wählen können.

Die Zahlen aus der Vorschau im August

Ultrafast startete am 13. August als limitierte Vorschau, zunächst nur für das Modell GPT-5.6 Sol. Laut OpenAI liefert der Modus bis zu 750 Token pro Sekunde und ist damit bis zu 14-mal schneller als die Verarbeitung im Standard-Modus. Die zugrunde liegende Rechenleistung stammt von Cerebras' Wafer-Scale-Chips.

Cerebras betont ausdrücklich, dass es sich nicht um eine destillierte oder quantisierte, abgespeckte Version handelt: Modellarchitektur, Gewichte, Präzision, Kontextkonfiguration und Inferenzeinstellungen sind identisch mit dem GPT-5.6 Sol am Standard-Endpunkt. Der Geschwindigkeitsvorsprung stammt aus der Hardware — jeder Wafer-Scale-Chip verfügt über 44 GB SRAM direkt auf dem Chip, die Gewichte bleiben dauerhaft auf dem Chip gespeichert, wodurch der Datenaustausch zwischen Speicher und Recheneinheiten entfällt.

Auch die Einschränkungen der Vorschauphase sind klar benannt: verfügbar nur über die API, nicht in ChatGPT oder Codex, und das Ausbautempo richtet sich nach der verfügbaren Rechenkapazität.

Cerebras hat zwei Vergleichszahlen veröffentlicht. Im GDP-Val-Test, der Wissensarbeit misst, war Ultrafast End-to-End 5,6-mal schneller, ohne Qualitätsverlust. Bei den 2500 Aufgaben von Humanity's Last Exam brauchte die Ultrafast-Version 11 Stunden und 11 Minuten, Claude Fable 5 dagegen 78 Stunden und 27 Minuten. Beide Werte stammen aus dem Cerebras-Blog, die Testbedingungen wurden vom Unternehmen selbst festgelegt, eine unabhängige Nachprüfung durch Dritte liegt bislang nicht vor.

"It now finishes for me before I even have the opportunity to context-switch."

Das Zitat stammt von OpenAI-Forscher Jeffrey Wang und meint, dass das Ergebnis schon vorliegt, bevor er überhaupt zu einer anderen Aufgabe wechseln kann.

Der dritte Schritt mit Cerebras

Betrachtet man die Zusammenarbeit von OpenAI und Cerebras als Ganzes, ist Ultrafast bereits der dritte Meilenstein.

Im Januar dieses Jahres unterzeichnete OpenAI eine Rechenleistungsvereinbarung mit Cerebras, die bis 2028 eine schrittweise Bereitstellung von 750 Megawatt Kapazität vorsieht. GPT-5.3-Codex-Spark im Februar war der erste konkrete Einsatz — ein speziell verschlanktes Coding-Modell, das auf Cerebras' WSE-3 läuft, über 1000 Token pro Sekunde erreicht und ausschließlich Codex innerhalb von ChatGPT Pro vorbehalten war. Im April kamen Berichte über eine zusätzliche Einkaufszusage von rund 20 Milliarden US-Dollar hinzu.

Bei Codex-Spark wurde eigens ein kleines Modell für Geschwindigkeit gebaut, bei Ultrafast läuft dagegen das Flaggschiffmodell unverändert auf schneller Hardware. Der erste Weg opfert einen Teil der Fähigkeiten, der zweite opfert keine Fähigkeiten, verlagert die Kosten aber auf die Rechenleistung. Ob Cerebras' Kapazitäten eine breitere Öffnung tragen können, entscheidet, wie weit diese Freigabe tatsächlich reicht.

Wie sich die drei Stufen aufteilen

Mit drei Stufen nebeneinander können Entwickler die Latenz je nach Aufgabe wählen. Bei Coding-Assistenten oder Echtzeit-Kundenservice — Szenarien, in denen jemand vor dem Bildschirm auf das Ergebnis wartet — wirkt sich Geschwindigkeit direkt auf die Erfahrung aus; bei nächtlichen Batch-Verarbeitungen und Evaluierungen lohnt sich dagegen eher etwas langsamer, dafür günstiger. Dasselbe Modell nach Antwortgeschwindigkeit zu staffeln, ähnelt dem Prinzip, wie Cloud-Anbieter nach Instanztyp abrechnen.

Zwei Fragen bleiben offen. Erstens der Preis: Seit der Vorschau hat OpenAI für Ultrafast keinen Stückpreis genannt, auch der Preisunterschied zur Stufe Fast ist unklar. Zweitens die Abdeckung: GPT-6 Sol und GPT-6 Astra sind bereits nacheinander erschienen, derzeit lässt sich aber nicht bestätigen, ob jedes GPT-6-Modell bei seinem Start Ultrafast unterstützt.

Sollte die Funktion tatsächlich am DevDay live gehen, wird die Preisseite das Erste sein, worauf Entwickler schauen.

Quellen: Ankündigung der Ultrafast-Vorschau in der OpenAI-Entwickler-Community, offizieller Cerebras-Blog, CocoLoop, TestingCatalog; die Angaben zu 750 Token pro Sekunde, dem 14-fachen Tempo sowie der 5,6-fachen Beschleunigung im GDP-Val-Test stammen jeweils von OpenAI und Cerebras selbst.