Claude Opus 5.5 lancé, coûts d'exploitation en baisse de 40 %

Anthropic a lancé le 22 septembre Claude Opus 5.5, premier modèle de la série Claude 5.5. Le positionnement officiel tient en deux idées : des performances comparables à celles de Claude Fable 5.1 sur la plupart des tâches, pour un coût d'exploitation global inférieur de 40 % à celui d'Opus 5.

En détaillant la grille tarifaire, l'entrée coûte 4 dollars par million de tokens et la sortie 20 dollars, soit une baisse de 20 % sur chaque poste ; la lecture du cache tombe de 0,50 à 0,20 dollar, une baisse de 60 %. Côté vitesse de sortie, Anthropic annonce plus de 30 % de gain par rapport à Opus 5, avec en plus un mode fast à 8 et 40 dollars, jusqu'à 2,5 fois plus rapide. Le modèle est disponible sur l'API de la plateforme Claude (identifiant de modèle claude-opus-5-5), sur AWS, Google Cloud et Microsoft Azure, ainsi que simultanément sur les plateformes grand public ; la sortie maximale par requête est de 128 000 tokens.

Résultats de benchmarks

La page officielle de lancement fournit le comparatif suivant.

BenchmarkOpus 5.5Fable 5.1Opus 5
Terminal-Bench 4.066.4%55.8%52.3%
FrontierCode v1.154.4%50.3%48.0%
CursorBench 4.057.8%51.8%46.6%
GDPval-AA v2.11846 Elo17351708
OSWorld 2.081.8%80.7%74.0%

Artificial Analysis, cabinet d'évaluation tiers, place Opus 5.5 en tête de son indice d'intelligence, avec un score de 58. Le même jour, Claude Code est passé en version 2.1.280 et fait déjà d'Opus 5.5 le modèle Opus par défaut.

La page de lancement cite également les retours de plusieurs clients ayant testé le modèle : GitHub indique que, pour résoudre les mêmes tâches en terminal, le nombre d'étapes nécessaires est inférieur de moitié à celui d'Opus 5 ; Optiver rapporte une qualité comparable à celle d'Opus 5 avec environ moitié moins de tours, pour un coût réduit de 40 à 50 % ; Deloitte indique qu'au niveau de raisonnement le plus bas, le modèle détecte 72 % des défauts connus, contre 56 % pour Opus 5 au niveau le plus élevé. Tous ces chiffres proviennent de déclarations de clients rapportées par l'éditeur lui-même sur sa page de lancement, sans vérification indépendante par un tiers.

Ce qu'Anthropic dit sur la sécurité

Anthropic affirme qu'Opus 5.5 a passé un audit comportemental automatisé, avec le meilleur score d'alignement jamais enregistré, et que les tentatives de contourner les limites du bac à sable ont chuté de 85 % par rapport à Opus 5. La majorité des tâches liées à la cybersécurité continuent d'être orientées vers Opus 4.8, et le niveau de protection dans le domaine biologique reste identique à celui de Claude Fable 5.1. Le modèle conserve les protections contre la distillation du processus de raisonnement, porte un filigrane conforme à l'AI Act de l'UE, et les entreprises peuvent opter pour une rétention nulle des données. Avant le lancement, METR et Frontier Design ont participé à l'évaluation.

Les taux précis d'échec, de refus de réponse et le détail des tests red-team ne pourront être vérifiés qu'à la publication de la system card complète ; la page officielle elle-même ne fournit pas ces chiffres.

Replacé dans la grille tarifaire du même jour

Le 22 septembre également, OpenAI a lancé GPT-6 Sol et Luna, dont les prix d'API sont réduits de moitié par rapport à la génération précédente : Sol est à 2 et 10 dollars, Luna à 0,10 et 0,50 dollar. En comparaison directe, le prix unitaire d'Opus 5.5 reste le double de celui de Sol ; ce qu'Anthropic vend sur ce même segment, c'est un score équivalent avec moins d'étapes : selon Optiver et GitHub, la baisse du nombre de tours par tâche compense en partie l'écart de prix unitaire sur la facture. L'ampleur de cette compensation dépend de la nature précise de la tâche, sans réponse universelle.

Du côté des développeurs, un test au résultat inverse a déjà émergé. Le blogueur technique Simon Willison a demandé à Opus 5.5, au niveau de raisonnement maximal, de générer un SVG complexe ; le modèle a épuisé la totalité des 128 000 tokens de sortie sans achever la tâche. Un niveau de raisonnement élevé combiné à une sortie longue épuise facilement tout le budget de sortie ; avant toute intégration dans un flux automatisé, cette limite doit être anticipée.

Pour les équipes utilisant déjà Opus 5, le coût de migration se concentre sur deux points : il faut changer l'identifiant du modèle, et les changements de vitesse de sortie et de nombre de tours rendent les paramètres existants de timeout et de nouvelle tentative inadaptés. La baisse de prix se fait davantage sentir sur les scénarios à appels fréquents, en particulier avec cette réduction de 60 % sur la lecture du cache — plus le system prompt permanent est long et plus les requêtes sont denses, plus la part d'économie est importante.

Sources: page officielle de lancement d'Anthropic, Artificial Analysis, CocoLoop, blog de Simon Willison ; la page officielle de lancement sert de référence pour les prix de chaque palier, les benchmarks et les mesures de sécurité.