OpenAI fait tourner Codex-Spark sur Cerebras, 15 fois plus rapide

Si vous utilisez récemment Codex dans ChatGPT Pro, vous avez peut-être remarqué une nouvelle option appelée Codex-Spark, dont la vitesse de réponse est anormalement rapide.

Ce n'est pas le résultat d'un réglage de paramètres, mais d'un changement du matériel sous-jacent.

Sur quelle puce cela tourne-t-il ?

GPT-5.3-Codex-Spark fonctionne sur le Cerebras WSE-3 (Wafer Scale Engine 3), et non sur un GPU Nvidia.

C'est la première fois qu'OpenAI déploie un modèle de production formel sur du matériel d'inférence autre que Nvidia.

Le WSE-3 est une tranche de silicium de la taille d'une assiette, intégrant plus de 4 000 milliards de transistors, avec une mémoire sur puce massive, conçue pour éliminer les goulots d'étranglement de latence causés par le déplacement des données.

Effet pratique : plus de 1000 tokens par seconde.

Le GPT-5.3-Codex standard tourne à environ 65 tokens/s. Codex-Spark est environ 15 fois plus rapide.

L'ampleur du contrat entre OpenAI et Cerebras

OpenAI a signé un contrat pluriannuel avec Cerebras en janvier dernier. Engagement : déployer par phases 750 mégawatts de puissance de calcul Cerebras d'ici 2028, pour une valeur contractuelle totale dépassant les 10 milliards de dollars.

Cependant, Sam Altman n'a pas non plus renié Nvidia, déclarant que "Nvidia a fabriqué les meilleures puces du monde" et que la coopération à long terme reste inchangée. La stratégie actuelle d'OpenAI est multi-fournisseurs en parallèle : Nvidia comme pilier pour l'entraînement, Cerebras pour l'inférence à faible latence, AMD a signé un accord de 6 GW, et des puces personnalisées Broadcom sont également en développement.

La déclaration de Cerebras vient de Sachin Katti : "Introduire le calcul à l'échelle du wafer dans l'environnement de production nous donne une nouvelle façon de maintenir la réactivité de Codex dans les tâches sensibles à la latence."

À quoi sert Codex-Spark ?

OpenAI le positionne comme un "outil de productivité quotidienne pour les développeurs", non pas pour un raisonnement complexe et profond, mais pour les travaux nécessitant des itérations rapides et un retour immédiat :

  • Édition rapide de code et refactorisation locale
  • Débogage en temps réel et localisation des erreurs
  • Rédaction de PRD, documents de recherche utilisateur, métriques de surveillance
  • Gestion des tests et suivi de l'avancement des tâches

La valeur fondamentale est ne pas attendre. Modifier une fonction, poser une question, tester une logique – une réponse quasi instantanée.

Il prend en charge un mode de travail "d'intervention en cours de route" – vous pouvez interrompre l'exécution de l'IA à tout moment, ajuster la direction, au lieu d'attendre qu'elle termine un long bloc pour voir le résultat.

Données de benchmark

Métrique GPT-5.2-Codex GPT-5.3-Codex-Spark
Terminal-Bench 2.0 64% 77,3%
Vitesse d'inférence ~65 tokens/s 1000+ tokens/s
Vitesse de sortie relative Base Environ 25% plus rapide
Consommation de tokens pour certaines tâches Base Environ 50% de moins

Les scores ont augmenté, et la vitesse est 15 fois supérieure – deux choses qui arrivent rarement en même temps.

La signification plus large de cette affaire

Actuellement, Codex-Spark n'est disponible que pour les utilisateurs payants de ChatGPT, l'accès à l'API est encore en cours, sans tarification séparée.

OpenAI a révélé que Codex compte désormais plus d'un million d'utilisateurs actifs hebdomadaires. À cette échelle, la latence d'inférence détermine directement l'expérience produit, ce n'est pas seulement un chiffre sur une fiche technique.

Le signal le plus crucial réside dans le fait que lorsque Cerebras passe de "théoriquement pourrait remplacer Nvidia" à "le premier matériel non-Nvidia qu'OpenAI met en production", ce changement a un poids concret dans l'industrie des puces.

Quant à savoir si Nvidia sera affectée – dans l'entraînement, personne ne peut l'ébranler à court terme. Mais sur le marché de l'inférence, cette fissure est déjà ouverte, et celui qui l'a ouverte, c'est OpenAI.

Sources de référence : OpenAI launches GPT-5.3-Codex-Spark on Cerebras chips — marks AI giant's first production deployment away from Nvidia (Tom's Hardware) ; Introducing OpenAI GPT-5.3-Codex-Spark Powered (Cerebras AI Blog) ; CocoLoop ; OpenAI's rapid GPT-5.3-Codex model moves beyond simple coding tasks (SiliconANGLE)