Le 21 août, OpenAI a baissé les tarifs d'appel de l'API de GPT-5.6 Sol : le prix de l'input passe de 5 à 4 dollars par million de tokens, celui de l'output de 30 à 20 dollars, et celui de l'input mis en cache de 0,5 à 0,4 dollar. Ce nouveau tarif s'applique pendant trois mois, jusqu'au 21 novembre.
Le périmètre est clairement défini. Les appels API sont facturés au nouveau tarif, et les crédits consommés dans ChatGPT Work et Codex baissent également. Les abonnements mensuels Pro, Plus et Business restent inchangés. OpenAI justifie ce geste par le fait que les capacités des modèles continuent de progresser tout en gagnant en efficacité, une partie des économies réalisées étant reversée.
Le calcul selon l'usage réel
Le discours officiel évoque "plus de 20%", mais la baisse n'est pas uniforme sur les trois postes de tarification : l'input recule de 20%, l'input en cache de 20%, et l'output d'un tiers. C'est l'output qui est le plus touché, et l'économie réelle dépend de la forme de la charge de travail.
Un calcul rapide pour un agent de programmation. Ce type de tâche se caractérise par un input lourd et un output léger, avec une relecture répétée du même contexte de code, d'où un taux élevé de succès de cache. Supposons une tâche consommant 1 million de tokens en entrée et 100 000 en sortie, avec 80% de l'input provenant du cache : à l'ancien tarif, cela donne 0,2×5 + 0,8×0,5 + 0,1×30 = 4,4 dollars ; au nouveau tarif, 0,8 + 0,32 + 2 = 3,12 dollars, soit une économie d'environ 29%.
Pour des charges à forte proportion d'output, comme les conversations ou la génération de textes longs, l'économie grimpe encore, se rapprochant du tiers de baisse appliqué à l'output. À l'inverse, pour des requêtes courtes de type recherche pure, avec un output de quelques centaines de tokens seulement, l'économie se limite quasiment aux 20% de l'input. Une même annonce peut ainsi produire des écarts de plus de dix points de pourcentage selon le produit.
Une position désormais sous Opus 5
Après cette baisse, la place de Sol dans la grille tarifaire a changé. Chez Anthropic, Claude Fable 5 facture 10 dollars l'input et 50 dollars l'output par million de tokens, contre 5 et 25 dollars pour Opus 5. L'ancien tarif de Sol, 5/30, se situait légèrement au-dessus d'Opus 5 ; le nouveau, 4/20, se retrouve désormais en dessous.
La concurrence sur ce segment est directe. Les développeurs prêts à payer pour un modèle haut de gamme sont généralement ceux qui intègrent le modèle dans des assistants de programmation, des systèmes de service client ou des pipelines d'agents exécutant des tâches longues ; la facture s'accumule mois après mois, et l'incitation à changer de fournisseur ne dépend que du coût unitaire. La présence d'Anthropic dans la programmation, ajoutée à la pression tarifaire continue des modèles chinois sur ce même segment, pèse sur ce groupe d'utilisateurs facturés à l'usage.
Au-delà du prix unitaire, il existe un autre calcul facile à négliger : la valeur absolue de l'input en cache. Une fois descendu à 0,4 dollar, la part de l'input qui touche le cache devient dix fois moins chère que celle qui n'y touche pas ; dans les scénarios d'appels répétés à contexte long, ce ratio pèse davantage sur la facture mensuelle que le tarif affiché lui-même. Les équipes qui parviennent à contenir leur facture misent surtout sur le taux de succès du cache, le prix catalogue passant alors au second plan.
Pourquoi seulement trois mois
Trois mois, c'est une fenêtre très courte. La gamme GPT-5.6 a lancé trois niveaux d'un coup début juillet, et fin juillet, Luna et Terra avaient déjà connu une baisse de prix - Luna de 80%, Terra de 20%. C'est maintenant au tour du modèle haut de gamme, et OpenAI propose un tarif limité dans le temps, sans modifier la grille tarifaire elle-même.
L'avantage d'une limite dans le temps est de ménager une porte de sortie : après le 21 novembre, le prix revient automatiquement à 5/30, sans qu'il soit nécessaire d'annoncer une nouvelle "hausse", ni de comptabiliser cette remise comme un engagement financier de long terme. Le revers de la médaille, c'est que les développeurs le savent tout aussi bien : combien de logique d'appel vont-ils réécrire, combien de trafic existant vont-ils migrer pour un tarif assorti d'un compte à rebours, la question reste ouverte. Ceux qui migrent réellement pour ce prix sont surtout ceux qui comparaient déjà en permanence les deux fournisseurs.
"As we continue to push the frontier of capabilities while improving efficiency, we're dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months."
Le fait que le prix des abonnements ne bouge pas d'un iota est également révélateur. L'abonnement mensuel constitue un revenu fixe et prévisible, tandis que le volet facturé à l'usage est le champ de bataille où l'entreprise affronte directement ses concurrents. Cette remise cible précisément l'API et les crédits Codex, c'est-à-dire les comptes capables de brûler plusieurs milliers de dollars par mois et de changer de base_url à tout moment.
Pour les développeurs en Chine, l'impact réel dépend du canal utilisé. Ceux qui appellent directement l'API sont facturés au nouveau tarif ; ceux qui passent par des revendeurs ou des proxys doivent attendre que ces intermédiaires répercutent la baisse, et l'écart de prix entre les deux constitue souvent, dans l'intervalle, leur marge bénéficiaire des prochains mois. Il faudra attendre le retour au tarif initial dans trois mois pour savoir si le même volume d'appels suivra le mouvement.
Sources : communiqué officiel d'OpenAI, CocoLoop, avis de la communauté de développeurs d'OpenAI, Reuters ; les trois tarifs d'input, d'output et d'input en cache de Sol, ainsi que la période de trois mois, ont été vérifiés sur la page tarifaire officielle d'OpenAI.