Le palier d'inférence Ultrafast a mis fin à sa préversion sur invitation. Le 8 octobre, OpenAI a officiellement ouvert ce palier de service dans la Responses API pour GPT-6.1 Sol, et pour la première fois affiché son prix sur la page de tarification. Lors de l'appel, le modèle reste gpt-6.1-sol ; il suffit de régler service_tier sur "ultrafast". Le modèle lui-même n'a pas changé, c'est l'intervalle entre les tokens de sortie qui est raccourci.
Ce palier est ouvert à tous les utilisateurs de l'API, soumis à des limites de débit, avec prise en charge du traitement mondial ainsi que de la résidence des données aux États-Unis et dans l'UE. Codex et ChatGPT Work ont été lancés en même temps, mais réservés au Pro 500, aux offres entreprise éligibles facturées à l'usage et aux offres éducation facturées par points ; côté entreprise, un administrateur doit l'activer manuellement.
Comment sont facturés les cinq paliers
Selon la page de tarification d'OpenAI, un contexte est considéré comme court jusqu'à 272 000 tokens en entrée ; les prix par palier sont les suivants (en dollars par million de tokens) :
| Palier | Entrée | Entrée en cache | Écriture en cache | Sortie |
|---|---|---|---|---|
| Batch / Flex | 1 | 0.05 | 1.25 | 5 |
| Standard | 2 | 0.10 | 2.50 | 10 |
| Fast | 4 | 0.20 | 5 | 20 |
| Ultrafast | 12 | 0.60 | 15 | 60 |
Au-delà de 272 000 tokens, en contexte long, Ultrafast passe à 24 dollars en entrée et 90 dollars en sortie. Tous les tarifs valent 6 fois ceux du palier standard, de même pour les deux postes liés au cache.
C'est vraiment combien plus rapide
La documentation d'OpenAI ne donne que des multiplicateurs relatifs, sans vitesse absolue. Le compte développeurs officiel d'OpenAI parle de "jusqu'à environ 8 fois" ; plusieurs médias citent une répartition plus précise : jusqu'à environ 8 fois dans Codex, jusqu'à environ 6 fois dans l'API. VentureBeat a rapporté une vitesse d'environ 300 tokens par seconde, un chiffre absent de la documentation officielle, c'est donc le multiplicateur qui fait référence.
Ultrafast dispose de ses propres limites de débit : 1 million de tokens par minute pour le palier Build, 4 millions pour Launch, 40 millions pour Grow, sans consommer le quota des paliers standard et Fast.
Le cas d'usage listé par OpenAI est formulé ainsi :
"Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts."
(Conçu pour les tâches où la vitesse et l'intelligence font la différence : déboguer une panne, des agents qui naviguent dans des applications, et des expériences en direct où chaque seconde compte.)
Faisons le calcul
Supposons une tâche d'agent qui lit 200 000 tokens et en génère 20 000, sans compter le cache. En gros : le palier standard coûterait environ 0,6 dollar, Fast environ 1,2 dollar, Ultrafast environ 3,6 dollars.
En comptant sur la vitesse maximale de 6 fois dans le scénario API, une tâche qui prenait 6 minutes pourrait être ramenée à environ 1 minute, soit 5 minutes gagnées pour environ 3 dollars de plus, ce qui équivaut à 0,6 dollar de plus par minute d'attente économisée. C'est le cas le plus favorable ; quand le gain de vitesse réel n'atteint pas le plafond, le coût par minute grimpe.
Pour un ingénieur en train de déboguer une panne, cette somme ne pèse presque rien ; les équipes qui exécutent des tâches hors ligne par lots continueront d'utiliser Batch et Flex, dont le prix ne représente que la moitié du palier standard.
Ce palier avait déjà connu une phase de préversion. Le 13 août, Ultrafast avait débuté en préversion limitée, réservée à GPT-5.6 Sol ; OpenAI affirmait alors atteindre jusqu'à 750 tokens par seconde, jusqu'à 14 fois plus rapide que le traitement standard, la puissance de calcul provenant des puces wafer-scale de Cerebras. Avec le lancement officiel de GPT-6.1 Sol, le multiplicateur officiel est passé à 6 à 8 fois, et cette annonce ne mentionne pas le matériel sous-jacent.
OpenAI n'a pas encore communiqué le volume d'utilisation d'Ultrafast ni la part d'utilisateurs payants. La documentation ne précise pas non plus si ce palier s'étendra à d'autres modèles, comme Astra.
Sources : journal des modifications pour développeurs d'OpenAI, CocoLoop, page de tarification de l'API OpenAI (prix par palier pour contexte court et long), VentureBeat, Runtime Wire ; Runtime Wire a vérifié les limites de débit et le périmètre de déploiement.