Le 22 septembre, OpenAI a lancé GPT-6 Sol et GPT-6 Luna, avec pour identifiants de modèle sur l'API gpt-6-sol et gpt-6-luna, disponibles dès le jour même. Les prix des deux modèles représentent la moitié de ceux de leurs équivalents de la génération précédente, GPT-5.6, avec une fenêtre de contexte de 1,1 million de tokens. Du côté de ChatGPT, les forfaits Work, Pro, Business, Enterprise et Edu peuvent déjà utiliser ces deux modèles ; Luna arrive aussi dans la version gratuite et la version Go de l'application de bureau, et Codex reçoit la mise à jour en même temps que ChatGPT Work. OpenAI n'a pas publié les poids des modèles : les deux ne sont accessibles que via l'API.
Les résultats communiqués par OpenAI
Dans son dossier de lancement, OpenAI liste plusieurs résultats :
- AutomationBench 1.0.6 (tâches professionnelles) : Sol, au niveau de raisonnement xhigh, atteint 33,2 % de précision, pour un coût de 0,27 dollar par tâche ; Luna, au niveau high, dépasse la génération précédente de 5,4 points, avec un coût inférieur de 58 %.
- DeepSWE v1.1 (programmation) : Sol atteint 68,8 % au niveau max, Luna 66,6 %.
- OSWorld 2.0, version hors ligne (utilisation d'un ordinateur) : Sol atteint 60,5 % au niveau xhigh, comparable selon OpenAI à Opus 5 au niveau intermédiaire, mais avec un coût inférieur de 80 % ; Luna, au niveau max, dépasse le Sol de la génération précédente, pour environ un dixième du coût.
- Agents' Last Exam : Sol atteint 56,4 % au niveau max.
Le lancement s'accompagne aussi d'un système de mise en cache des prompts révisé. Selon OpenAI, à chaque tour, un agent doit renvoyer les mêmes instructions, définitions d'outils et historique ; le nouveau système augmente par défaut le taux de succès du cache, avec une remise pouvant atteindre 90 % sur la lecture.
Le regard d'un tiers : prix en baisse, scores stables
Les nouveaux tests d'Artificial Analysis divergent du dossier officiel justement sur le plan des capacités. Selon cette société, l'indice d'intelligence et l'indice d'agent de codage des deux modèles restent globalement stables par rapport à GPT-5.6 : sur l'indice d'agent de codage, Sol obtient 57 points au niveau max, soit 2 de plus que la génération précédente ; Luna obtient 41 points, soit 2 de moins que la génération précédente.
Le véritable changement de ce lancement se situe du côté des coûts. Sur le même test d'indice d'intelligence, Sol coûte 1,06 dollar par tâche au niveau max, contre 1,99 dollar pour la génération précédente ; Luna coûte 0,07 dollar, contre 0,18 dollar pour la génération précédente.
Faire le calcul
Selon une estimation approximative basée sur les chiffres d'Artificial Analysis : une équipe exécutant 10 000 tâches similaires par jour économiserait environ 9 300 dollars par jour avec Sol, soit près de 280 000 dollars par mois ; en passant au niveau léger Luna, pour le même volume de tâches, le coût quotidien passerait de 1 800 à 700 dollars. Il ne s'agit que d'une extrapolation directe des chiffres de référence ; la facture réelle dépend de la longueur des tâches, du niveau de raisonnement et du taux de succès du cache — ce dernier point étant particulièrement important : pour les applications d'agents qui renvoient sans cesse le même prompt système, chaque hausse de dix points du taux de succès permet d'économiser plus que la baisse du prix unitaire elle-même.
À titre de comparaison, Anthropic a lancé le même jour Claude Opus 5.5, avec un coût d'exploitation global inférieur de 40 % à celui d'Opus 5, à 4 dollars en entrée et 20 dollars en sortie. Les deux entreprises ont baissé le même jour le prix de leurs modèles phares : le prix de Sol équivaut à la moitié de celui d'Opus 5.5, tandis que Luna fait descendre le niveau léger jusqu'à 0,10 dollar.
Pour les développeurs en Chine, l'impact réel de cette baisse de prix dépend du canal d'accès utilisé. Les équipes qui appellent directement l'API officielle bénéficient pleinement de la baisse ; celles qui passent par des services relais ou des canaux de fournisseurs cloud devront attendre les annonces de chacun pour savoir si leur marge est ajustée en conséquence. Pour les produits d'agents facturés au coût de la tâche, la structure des marges ressentira le changement en premier : à fonctionnalité égale, une fois le coût d'inférence divisé par deux, les conceptions qui limitaient auparavant le nombre d'appels pour maîtriser les coûts peuvent être assouplies — au prix que les concurrents peuvent faire de même.
Sources : dossier de lancement d'OpenAI, article d'évaluation d'Artificial Analysis, CocoLoop, MarkTechPost ; l'évaluation tierce a vérifié le coût par tâche et le score de l'indice d'agent de codage.