OpenAI lässt Codex-Spark auf Cerebras laufen – 15-mal schneller

Wenn Sie in letzter Zeit Codex in ChatGPT Pro verwendet haben, ist Ihnen vielleicht eine neue Option namens Codex-Spark aufgefallen, deren Antwortgeschwindigkeit ungewöhnlich schnell ist.

Dies ist nicht das Ergebnis einer Parameteroptimierung, sondern ein Wechsel der zugrunde liegenden Hardware.

Auf welchem Chip läuft es?

GPT-5.3-Codex-Spark läuft auf dem Cerebras WSE-3 (Wafer Scale Engine 3), nicht auf einer Nvidia-GPU.

Es ist das erste Mal, dass OpenAI ein formelles Produktionsmodell auf Inferenz-Hardware außerhalb von Nvidia bereitstellt.

Der WSE-3 ist ein etwa tellergroßes Siliziumstück, das über 4 Billionen Transistoren integriert, über einen enormen On-Chip-Speicher verfügt und darauf ausgelegt ist, Latenzengpässe durch Datenbewegungen zu beseitigen.

Praktische Wirkung: über 1000 Token pro Sekunde.Der normale GPT-5.3-Codex läuft mit etwa 65 Token/s. Codex-Spark ist etwa 15-mal schneller.

Umfang des Vertrags zwischen OpenAI und Cerebras

OpenAI hat im Januar dieses Jahres einen mehrjährigen Vertrag mit Cerebras unterzeichnet. Zusage: Bis 2028 stufenweise 750 Megawatt Cerebras-Rechenleistung in Betrieb zu nehmen, mit einem Gesamtauftragswert von über 10 Milliarden US-Dollar.

Sam Altman hat Nvidia jedoch nicht verleugnet. Seine Aussage war: "Nvidia hat die besten Chips der Welt hergestellt", die langfristige Zusammenarbeit bleibe unverändert. Die derzeitige Strategie von OpenAI ist die parallele Nutzung mehrerer Anbieter: Nvidia als Hauptlast für das Training, Cerebras für Inferenz mit niedriger Latenz, AMD hat eine 6-GW-Vereinbarung unterzeichnet, und kundenspezifische Chips von Broadcom befinden sich ebenfalls in der Entwicklung.

Die Aussage von Cerebras stammt von Sachin Katti: "Die Einführung von Wafer-Scale-Computing in die Produktionsumgebung gibt uns eine neue Möglichkeit, Codex bei latenzempfindlichen Aufgaben reaktionsfähig zu halten."

Wofür kann Codex-Spark verwendet werden?

OpenAI positioniert es als "tägliches Produktivitätstool für Entwickler", nicht für tiefgehende komplexe Überlegungen, sondern für Arbeiten, die schnelle Iterationen und sofortiges Feedback erfordern:

  • Schnelle Codebearbeitung und lokale Refaktorisierung
  • Echtzeit-Debugging und Fehlerlokalisierung
  • Schreiben von PRDs, Benutzerforschungsdokumenten, Überwachungsmetriken
  • Verwalten von Tests und Verfolgen des Aufgabenfortschritts

Der Kernwert ist: kein Warten. Eine Funktion ändern, eine Frage stellen, eine Logik testen – nahezu sofortige Antwort.

Es unterstützt eine "Eingreifen-mitten-im-Prozess"-Arbeitsweise – Sie können die Ausführung der KI jederzeit unterbrechen, die Richtung anpassen, anstatt darauf zu warten, dass sie einen großen Block durchläuft, bevor Sie das Ergebnis sehen.

Benchmark-Daten

Metrik GPT-5.2-Codex GPT-5.3-Codex-Spark
Terminal-Bench 2.0 64% 77,3%
Inferenzgeschwindigkeit ~65 Token/s 1000+ Token/s
Relative Ausgabegeschwindigkeit Basis Etwa 25% schneller
Token-Verbrauch bei einigen Aufgaben Basis Etwa 50% weniger

Die Bewertungen sind gestiegen, und die Geschwindigkeit ist um das 15-fache höher – beides gleichzeitig zu sehen, ist selten.

Die größere Bedeutung dieser Sache

Derzeit ist Codex-Spark nur für zahlende ChatGPT-Nutzer verfügbar, der API-Zugang ist noch in Arbeit, es gibt keine separate Preisgestaltung.

OpenAI gab bekannt, dass Codex jetzt über 1 Million wöchentlich aktive Nutzer hat. In diesem Umfang bestimmt die Inferenzlatenz direkt das Produkterlebnis, sie ist nicht nur eine Zahl auf einem Datenblatt.

Das entscheidendere Signal liegt darin: Wenn Cerebras von "theoretisch könnte es Nvidia ersetzen" zu "der ersten Nicht-Nvidia-Hardware, die OpenAI in die Produktion bringt" wird, hat diese Veränderung in der Chipindustrie ein konkretes Gewicht.

Und ob Nvidia davon betroffen sein wird – im Trainingsbereich kann kurzfristig niemand etwas erschüttern. Aber im Inferenzmarkt ist dieser Riss bereits geöffnet, und geöffnet wurde er von OpenAI.

Quellenangabe: OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia (Tom's Hardware); Introducing OpenAI GPT-5.3-Codex-Spark Powered (Cerebras AI Blog); CocoLoop; OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks (SiliconANGLE)