OpenAI s'apprête à élargir son mode Ultrafast, 14 fois plus rapide

OpenAI se prépare à ouvrir le mode d'inférence Ultrafast à davantage de développeurs. Le 26 septembre, des médias étrangers ont repéré dans l'interface Playground de la Responses API une option de vitesse pas encore activée, répartie en trois paliers : Standard, Fast et Ultrafast. Le déploiement pourrait intervenir autour du DevDay du 29 septembre, mais OpenAI n'a fait aucune annonce officielle à ce sujet, et le périmètre exact reste à confirmer par l'entreprise elle-même.

Pour l'instant, Ultrafast n'est accessible qu'à un petit groupe de clients invités. Si l'option à trois paliers est officiellement lancée, la vitesse passera d'un privilège réservé aux tests internes à une option de facturation que les développeurs ordinaires pourront choisir selon la tâche à accomplir.

Les chiffres livrés lors de l'aperçu d'août

Ultrafast a fait ses débuts le 13 août sous la forme d'un aperçu limité, réservé au seul modèle GPT-5.6 Sol. Selon OpenAI, ce mode peut délivrer jusqu'à 750 tokens par seconde, soit jusqu'à 14 fois plus rapide que le traitement en mode Standard, grâce à la puissance de calcul des puces à l'échelle d'une plaquette (wafer-scale) de Cerebras.

Cerebras a tenu à préciser qu'il ne s'agit pas d'une version distillée ou quantifiée et allégée : l'architecture du modèle, les poids, la précision, la configuration de contexte et les paramètres d'inférence sont identiques à ceux du GPT-5.6 Sol sur le point de terminaison standard. L'écart de vitesse vient du matériel : chaque puce wafer-scale embarque 44 Go de SRAM directement sur la puce, les poids restant résidents sur celle-ci, ce qui supprime le temps passé à déplacer les données entre la mémoire et les unités de calcul.

Les limites de la phase d'aperçu sont également clairement énoncées : disponible uniquement via l'API, absent de ChatGPT et de Codex, et le rythme de montée en charge suit la capacité de calcul disponible.

Cerebras a publié deux comparatifs de son cru. Sur le test GDP-Val, qui mesure le travail de connaissance, Ultrafast s'est montré 5,6 fois plus rapide de bout en bout, sans perte de qualité ; pour venir à bout des 2 500 questions de Humanity's Last Exam, la version Ultrafast a mis 11 heures et 11 minutes, contre 78 heures et 27 minutes pour Claude Fable 5. Ces deux chiffres proviennent du blog de Cerebras, avec des conditions de test définies par l'entreprise elle-même, et aucune reproduction indépendante par un tiers n'a encore eu lieu.

"It now finishes for me before I even have the opportunity to context-switch."

Cette phrase est signée Jeffrey Wang, chercheur chez OpenAI, et signifie que le résultat arrive avant même qu'il n'ait eu le temps de passer à autre chose.

Le troisième pas aux côtés de Cerebras

En prenant du recul sur l'ensemble du partenariat entre OpenAI et Cerebras, Ultrafast constitue déjà le troisième jalon.

En janvier de cette année, OpenAI a signé un accord de capacité de calcul avec Cerebras, s'engageant à déployer progressivement 750 mégawatts d'ici 2028. GPT-5.3-Codex-Spark, lancé en février, en a été la première concrétisation : un modèle de programmation spécialement allégé, fonctionnant sur les puces WSE-3 de Cerebras, dépassant les 1 000 tokens par seconde, mais réservé uniquement à Codex au sein de ChatGPT Pro. En avril, des informations ont fait état d'un engagement d'achat supplémentaire d'environ 20 milliards de dollars.

L'approche de Codex-Spark consistait à construire un petit modèle dédié à la vitesse ; Ultrafast, à l'inverse, fait tourner le modèle phare tel quel sur du matériel rapide. La première approche sacrifie une partie des capacités, la seconde n'en sacrifie aucune, mais reporte le coût sur le calcul. La capacité de production de Cerebras à soutenir une ouverture plus large déterminera jusqu'où cet élargissement pourra réellement aller.

Comment se répartissent les trois paliers

Avec trois paliers côte à côte, les développeurs pourront choisir la latence en fonction de la tâche. Pour les assistants de programmation ou le support client en temps réel — des scénarios où quelqu'un attend le résultat devant son écran — la vitesse influe directement sur l'expérience ; pour le traitement par lots nocturne et les évaluations, être un peu plus lent en échange d'un coût plus faible est préférable. Répartir un même modèle selon sa vitesse de réponse rappelle la logique des fournisseurs cloud qui facturent selon le type d'instance.

Deux questions restent sans réponse. La première concerne le prix : depuis l'aperçu jusqu'à aujourd'hui, Ultrafast n'a jamais publié de tarif unitaire, et l'écart de prix avec le palier Fast reste inconnu. La seconde concerne la couverture : GPT-6 Sol et GPT-6 Astra sont déjà sortis l'un après l'autre, mais il est pour l'instant impossible de confirmer que chaque modèle de la série GPT-6 prendra en charge Ultrafast dès son lancement.

Si le lancement a effectivement lieu le jour du DevDay, la page tarifaire sera le premier endroit que les développeurs iront consulter.

Sources : annonce de l'aperçu Ultrafast sur la communauté de développeurs OpenAI, blog officiel de Cerebras, CocoLoop, TestingCatalog ; les chiffres de 750 tokens par seconde, l'accélération de 14 fois et l'accélération de 5,6 fois sur GDP-Val sont tous des données autodéclarées par OpenAI et Cerebras.