Wenn Sie in letzter Zeit Codex in ChatGPT Pro verwendet haben, ist Ihnen vielleicht eine neue Option namens Codex-Spark aufgefallen, deren Antwortgeschwindigkeit ungewöhnlich schnell ist.
Dies ist nicht das Ergebnis einer Parameteroptimierung, sondern ein Wechsel der zugrunde liegenden Hardware.
Auf welchem Chip läuft es?
GPT-5.3-Codex-Spark läuft auf dem Cerebras WSE-3 (Wafer Scale Engine 3), nicht auf einer Nvidia-GPU.
Es ist das erste Mal, dass OpenAI ein formelles Produktionsmodell auf Inferenz-Hardware außerhalb von Nvidia bereitstellt.
Der WSE-3 ist ein etwa tellergroßes Siliziumstück, das über 4 Billionen Transistoren integriert, über einen enormen On-Chip-Speicher verfügt und darauf ausgelegt ist, Latenzengpässe durch Datenbewegungen zu beseitigen.
Praktische Wirkung: über 1000 Token pro Sekunde.
Der normale GPT-5.3-Codex läuft mit etwa 65 Token/s. Codex-Spark ist etwa 15-mal schneller.Umfang des Vertrags zwischen OpenAI und Cerebras
OpenAI hat im Januar dieses Jahres einen mehrjährigen Vertrag mit Cerebras unterzeichnet. Zusage: Bis 2028 stufenweise 750 Megawatt Cerebras-Rechenleistung in Betrieb zu nehmen, mit einem Gesamtauftragswert von über 10 Milliarden US-Dollar.
Sam Altman hat Nvidia jedoch nicht verleugnet. Seine Aussage war: "Nvidia hat die besten Chips der Welt hergestellt", die langfristige Zusammenarbeit bleibe unverändert. Die derzeitige Strategie von OpenAI ist die parallele Nutzung mehrerer Anbieter: Nvidia als Hauptlast für das Training, Cerebras für Inferenz mit niedriger Latenz, AMD hat eine 6-GW-Vereinbarung unterzeichnet, und kundenspezifische Chips von Broadcom befinden sich ebenfalls in der Entwicklung.
Die Aussage von Cerebras stammt von Sachin Katti: "Die Einführung von Wafer-Scale-Computing in die Produktionsumgebung gibt uns eine neue Möglichkeit, Codex bei latenzempfindlichen Aufgaben reaktionsfähig zu halten."
Wofür kann Codex-Spark verwendet werden?
OpenAI positioniert es als "tägliches Produktivitätstool für Entwickler", nicht für tiefgehende komplexe Überlegungen, sondern für Arbeiten, die schnelle Iterationen und sofortiges Feedback erfordern:
- Schnelle Codebearbeitung und lokale Refaktorisierung
- Echtzeit-Debugging und Fehlerlokalisierung
- Schreiben von PRDs, Benutzerforschungsdokumenten, Überwachungsmetriken
- Verwalten von Tests und Verfolgen des Aufgabenfortschritts
Der Kernwert ist: kein Warten. Eine Funktion ändern, eine Frage stellen, eine Logik testen – nahezu sofortige Antwort.
Es unterstützt eine "Eingreifen-mitten-im-Prozess"-Arbeitsweise – Sie können die Ausführung der KI jederzeit unterbrechen, die Richtung anpassen, anstatt darauf zu warten, dass sie einen großen Block durchläuft, bevor Sie das Ergebnis sehen.
Benchmark-Daten
| Metrik | GPT-5.2-Codex | GPT-5.3-Codex-Spark |
|---|---|---|
| Terminal-Bench 2.0 | 64% | 77,3% |
| Inferenzgeschwindigkeit | ~65 Token/s | 1000+ Token/s |
| Relative Ausgabegeschwindigkeit | Basis | Etwa 25% schneller |
| Token-Verbrauch bei einigen Aufgaben | Basis | Etwa 50% weniger |
Die Bewertungen sind gestiegen, und die Geschwindigkeit ist um das 15-fache höher – beides gleichzeitig zu sehen, ist selten.
Die größere Bedeutung dieser Sache
Derzeit ist Codex-Spark nur für zahlende ChatGPT-Nutzer verfügbar, der API-Zugang ist noch in Arbeit, es gibt keine separate Preisgestaltung.
OpenAI gab bekannt, dass Codex jetzt über 1 Million wöchentlich aktive Nutzer hat. In diesem Umfang bestimmt die Inferenzlatenz direkt das Produkterlebnis, sie ist nicht nur eine Zahl auf einem Datenblatt.
Das entscheidendere Signal liegt darin: Wenn Cerebras von "theoretisch könnte es Nvidia ersetzen" zu "der ersten Nicht-Nvidia-Hardware, die OpenAI in die Produktion bringt" wird, hat diese Veränderung in der Chipindustrie ein konkretes Gewicht.
Und ob Nvidia davon betroffen sein wird – im Trainingsbereich kann kurzfristig niemand etwas erschüttern. Aber im Inferenzmarkt ist dieser Riss bereits geöffnet, und geöffnet wurde er von OpenAI.
Quellenangabe: OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia (Tom's Hardware); Introducing OpenAI GPT-5.3-Codex-Spark Powered (Cerebras AI Blog); CocoLoop; OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks (SiliconANGLE)