GPT-6.1 Sol arrive avec un prix d'API cinq fois inférieur à Astra

OpenAI a présenté GPT-6.1 Sol lors du DevDay du 29 septembre, positionné sur les agents de codage, le pilotage d'ordinateur et les tâches bureautiques professionnelles. Le tarif standard de l'API est de 2 dollars par million de tokens en entrée, 0,10 dollar pour les tokens en entrée mis en cache et 10 dollars pour les tokens en sortie, au même niveau que GPT-6 Sol ; comparé au modèle phare GPT-6 Astra, facturé 10, 0,20 et 50 dollars, l'entrée comme la sortie sont cinq fois moins chères.

Le rythme des sorties est soutenu. GPT-6 Astra est arrivé il y a 26 jours, et GPT-6 Sol n'était en ligne que depuis 7 jours lorsqu'il a été remplacé par la version 6.1. Selon OpenAI, le nouveau modèle est "proche d'Astra" en codage et en pilotage d'ordinateur.

Des scores proches du modèle phare, mais un écart qui subsiste sur certains points

Dans les chiffres publiés par OpenAI, GPT-6.1 Sol atteint 75,2 % sur DeepSWE v1.1 au niveau de raisonnement le plus élevé, à égalité avec Astra mais pour environ un cinquième du coût. Sur OSWorld 2.0, au niveau de raisonnement maximal, il obtient 71,4 %, soit 2,1 points de pourcentage de moins qu'Astra, pour un coût par tâche environ sept fois inférieur. Sur Terminal-Bench Science 0.1, qui évalue des flux de recherche en ligne de commande, le coût moyen par tâche est de 5,47 dollars, contre 23,21 dollars pour Claude Opus 5.5 et 23,80 dollars pour Astra.

Le test indépendant d'Artificial Analysis, un évaluateur tiers, aboutit à des conclusions proches : l'indice d'intelligence est supérieur de 4 points à celui de GPT-6 Sol et inférieur d'1 point à celui de GPT-6 Astra ; sur les tests de précision des connaissances, le taux d'hallucination est passé de 60 % à 54 %. Le prix à payer est que le modèle "parle davantage" : pour accomplir la même tâche, il utilise 10 à 30 % de tokens de sortie en plus. La remise sur la lecture en cache est passée de 90 % à 95 %, ce qui compense en partie ce surcoût.

Tous les critères ne sont pas aussi proches. Dans les données publiées par OpenAI lui-même, sur l'ExploitBench interne, Sol obtient 21,5 % contre 31,5 % pour Astra ; sur TroubleshootingBench, consacré au dépannage, c'est 47,96 % contre 63,46 %. Dans les scénarios nécessitant de longues chaînes de dépannage, le modèle phare garde un net avantage.

Conditions d'accès et quelques restrictions

GPT-6.1 Sol est déjà disponible sur ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu ; les utilisateurs de la version gratuite et du forfait Go n'y ont pas encore accès, et il n'est pas non plus intégré à l'interface de chat classique. Les développeurs l'appellent via gpt-6.1-sol, avec une fenêtre de contexte d'environ 1,05 million de tokens et une sortie maximale de 128 000 tokens par appel.

Quelques détails sont à noter :

  • La partie d'un même prompt qui dépasse 272 000 tokens est facturée au double en entrée et à 1,5 fois en sortie ;
  • Les niveaux de raisonnement none et minimal ne sont pas pris en charge ;
  • En passant par l'interface Chat Completions, il n'est pas possible d'appeler des outils ; il faut basculer vers la Responses API.

Le deuxième point touche surtout les équipes qui travaillent sur l'interaction en temps réel. L'astuce consistant à désactiver le raisonnement pour réduire la latence ne fonctionne plus sur 6.1 Sol.

Comment les développeurs en Chine peuvent y accéder

L'API officielle d'OpenAI ne dessert plus la Chine continentale depuis juillet 2024, et cela ne change pas. Dans cette liste de lancement, les canaux tiers collent davantage à la réalité des développeurs chinois : OpenRouter et Vercel AI Gateway sont disponibles en même temps, et les forfaits Pro+, Max, Business et Enterprise de GitHub Copilot sont également proposés.

Pour les équipes en Chine, la référence la plus directe reste la fourchette de prix des modèles nationaux. GLM-5.3 avait déjà annoncé un tarif d'API de 4,4 dollars par million de tokens en sortie, moins de la moitié de celui de GPT-6.1 Sol. Cette fois, Sol fait passer une capacité de codage de niveau phare à un palier de 10 dollars, réduisant un peu l'avantage de prix que les modèles nationaux avaient sur le codage ; reste à voir si les autres acteurs ajusteront leurs tarifs en réponse.

Une autre variable se situe du côté d'OpenAI lui-même. La veille, l'entreprise venait de retirer GPT-6.1 Astra, initialement prévu pour octobre, invoquant des normes de sécurité non atteintes, et aucune date n'est encore fixée pour la prochaine mise à jour de la gamme phare. D'ici là, 6.1 Sol devrait rester le modèle que OpenAI met en avant pour les développeurs.

Sources : page officielle de lancement et bilan du DevDay d'OpenAI, évaluation indépendante d'Artificial Analysis, CocoLoop, compilations de tests de DataCamp et Vellum ; les tarifs de chaque palier d'API, la longueur de contexte et le multiplicateur de facturation pour les prompts longs suivent les chiffres publiés par OpenAI.