Astra et Sol : l'abonnement accélère à 50 tokens/seconde

OpenAI a relevé d'un niveau la vitesse de sortie par défaut de GPT-6 Astra et de GPT-6.1 Sol dans ses produits par abonnement. Thibault Sottiaux, responsable de Codex, a annoncé le 5 octobre sur un réseau social que la vitesse par défaut des deux modèles augmentait globalement d'environ 50 %, passant d'environ 30 tokens par seconde à environ 50, et que cela concerne l'ensemble des produits d'OpenAI ainsi que toutes les applications partenaires connectées via "Sign in with ChatGPT".

Les utilisateurs n'ont besoin de modifier aucun paramètre. Selon Sottiaux, la mise à jour sera déployée progressivement auprès de tous dans un délai de deux heures.

L'"amélioration" livrée dès le lendemain

Le moment choisi pour cette accélération n'a rien d'un hasard. Le 4 octobre, Sottiaux a fixé à l'équipe Codex un délai public de 28 jours : chaque jour, il faut publier quelque chose qui apporte une amélioration perceptible pour la majorité des utilisateurs de Codex et de ChatGPT Work, sous peine d'une remise à zéro complète des quotas d'usage pour tout le monde.

Le gain de vitesse correspond exactement à ce critère de "perceptible par la majorité des utilisateurs". Il ne dépend pas du cas d'usage : écrire du code, rechercher des informations ou exécuter des tâches d'agent en profitent tous, et il ne demande pas non plus aux utilisateurs d'apprendre une nouvelle fonctionnalité. Dans un engagement qui impose de livrer quelque chose chaque jour, ce type de changement est le plus facile à faire reconnaître.

La portée est également plus large qu'un simple changement sur ChatGPT. Parmi les partenaires cités par Sottiaux figurent l'outil de programmation open source OpenCode, Pi, Amp, ainsi que Devin, de Cognition. Ces produits permettent aux utilisateurs de se connecter directement avec leur abonnement ChatGPT, en consommant le quota de l'abonnement plutôt qu'une facturation à l'API — le gain de vitesse côté abonnement leur est donc transmis tel quel.

De 30 à 50 : le calcul dépasse la moitié

L'annonce officielle parle d'"environ 50 %", mais, si l'on calcule à partir des deux chiffres donnés — de 30 à 50 tokens par seconde —, la hausse réelle est d'environ 67 %. Sottiaux n'a pas expliqué la différence entre les deux façons de compter. Une hypothèse est que les 50 % désignent l'expérience globale de bout en bout, incluant le temps d'attente avant le premier token, alors que la seule phase de génération afficherait une hausse d'environ deux tiers.

Converti en temps perceptible par l'utilisateur, une estimation grossière :

Longueur de la sortie30 tokens/s50 tokens/s
Un extrait de code de 2 000 tokensenviron 67 secondesenviron 40 secondes
Une tâche d'agent avec 20 000 tokens en sortieenviron 11 minutesenviron 6,7 minutes

Cela ne prend en compte que le temps où le modèle génère du texte. Dans les tâches d'agent, il y a aussi les appels d'outils, l'exécution de tests et l'attente réseau, des éléments qui ne se raccourcissent pas avec le gain de vitesse. La part de temps réellement économisée pour accomplir une tâche est donc probablement inférieure aux chiffres du tableau.

Tokenizer et consommation de tokens

Sottiaux a également indiqué que les deux modèles utilisent désormais un tokenizer optimisé, ce qui réduit le nombre de tokens nécessaires pour accomplir la même tâche. OpenAI n'a donné aucun chiffre précis sur l'ampleur de cette réduction.

Ce point pourrait avoir un impact plus direct sur les abonnés que la vitesse elle-même. Les quotas de Codex et de ChatGPT Work sont calculés selon la consommation de tokens : si une même tâche consomme moins de tokens, le même quota permet de faire davantage. À l'inverse, une simple hausse de vitesse ne modifie pas le quota en soi : générer du texte plus vite fait seulement atteindre plus tôt la limite de la fenêtre de cinq heures. Certains médias ont justement souligné ce point dans leurs articles.

Lors du lancement de GPT-6.1 Sol au DevDay, le 29 septembre, des tests menés par des tiers ont montré qu'il utilisait 10 à 30 % de tokens de sortie en plus que la génération précédente pour accomplir la même tâche. La part que le nouveau tokenizer parvient à compenser ne sera connue qu'une fois des tests indépendants refaits.

Aucun changement, pour l'instant, côté API

La répartition des rôles entre les deux modèles est claire. GPT-6 Astra est le modèle phare, avec un tarif API standard de 10 dollars par million de tokens en entrée et 50 dollars en sortie ; GPT-6.1 Sol est orienté vers les agents de programmation et le pilotage d'ordinateur, avec 2 dollars en entrée et 10 dollars en sortie, soit un cinquième du tarif d'Astra dans les deux cas. Ce gain de vitesse côté abonnement concerne les deux modèles à la fois.

Cet ajustement ne concerne que la vitesse par défaut des produits par abonnement. Pour les utilisateurs de l'API, qui paient au token, Sottiaux n'a pas précisé si la vitesse évolue également, et la documentation API d'OpenAI n'a pas non plus été mise à jour sur ce point.

Sources : déclarations publiques de Thibault Sottiaux sur les réseaux sociaux, CocoLoop, RuntimeWire, Crypto Briefing ; le débit de sortie suit les chiffres de tokens par seconde communiqués officiellement, la hausse et le temps économisé étant des estimations basées sur ce calcul.