Claude Sonnet 5.5 : plus rapide de 30 %, prix inchangé

Anthropic a lancé Claude Sonnet 5.5 le 28 septembre, deuxième modèle de la famille Claude 5.5 après Opus 5.5. L'entreprise avance deux chiffres clés : une vitesse supérieure d'au moins 30 % à celle de Sonnet 5, et un coût par tâche inférieur d'au maximum 30 % pour la plupart des usages. Les tarifs de l'API restent inchangés : 2 dollars par million de tokens en entrée, 10 dollars en sortie, et 0,2 dollar pour la lecture en cache.

Le modèle est disponible dès le jour du lancement sur la plateforme Claude, AWS, Google Cloud et Microsoft Azure, sous le nom d'API claude-sonnet-5-5, avec l'option de rétention zéro des données proposée comme d'habitude sur toutes ces plateformes. Le développeur indépendant Simon Willison a remarqué que le niveau gratuit de claude.ai utilise déjà Sonnet 5.5.

Le bilan officiel

Voici les principaux résultats mentionnés par Anthropic sur sa page de lancement :

RéférenceSonnet 5.5
Terminal-Bench 4.070,6 %
OSWorld 2.1 (partiel)80,1 %
Humanity's Last Exam (avec outils)64,5 %
CursorBench 4.055,5 %
FrontierCode 1.1 (Max)46,2 %
GDPval-AA v2.11844

Les retours de plusieurs clients ayant testé le modèle en avant-première portent surtout sur la vitesse. Box indique que le nouveau modèle est 2,4 fois plus rapide que la version précédente, et Slack affirme avoir obtenu des résultats meilleurs et plus rapides sans modifier ses prompts.

"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."

Sonnet 5.5 code vite et peut être recadré en une phrase au fil des itérations, selon Tyler Nishida, d'Every.

L'autre son de cloche des tests indépendants

Artificial Analysis attribue à Sonnet 5.5 un indice d'intelligence de 56 points, en deuxième position, à seulement 2 points des 58 points d'Opus 5.5. Sur son propre test Terminal-Bench 4.0, Sonnet 5.5 obtient 64 %, contre 60 % pour Opus 5.5 et GPT-6 Astra. Le point faible se situe sur les questions factuelles : 54 % de précision factuelle, contre 66 % pour Opus 5.5, et un score également inférieur de 6 points à celui d'Opus 5.5 sur les tests de raisonnement scientifique.

Sur le coût, les chiffres ne correspondent pas au discours officiel. En faisant tourner l'ensemble des tests au niveau de raisonnement maximal (max), Artificial Analysis mesure que Sonnet 5.5 produit en moyenne environ 193 000 tokens de sortie par tâche, soit environ 60 % de plus qu'Opus 5.5 et Sonnet 5 au même niveau max, et 7 fois plus que GPT-6 Astra. Le tarif unitaire restant inchangé mais le nombre de tokens augmentant, le coût par tâche atteint environ 7,6 dollars, soit environ 50 % de plus que Sonnet 5.

Les deux méthodologies diffèrent. Anthropic parle de "la plupart des tâches", c'est-à-dire du codage et de la rédaction courants au niveau par défaut, alors qu'Artificial Analysis teste le cas extrême où le budget de réflexion est poussé au maximum. Willison a observé le même phénomène : en demandant au modèle d'écrire une petite application WebGL au niveau max, il a consommé 128 000 tokens pour 1,28 dollar ; au niveau xhigh, le résultat est arrivé en 41 secondes pour environ 0,06 dollar seulement. Il signale aussi que Sonnet 5.5 partage un défaut avec Opus 5.5 : au niveau max, il épuise facilement son plafond de tokens.

Face aux modèles de même catégorie

En comparaison, le positionnement de la gamme Sonnet est désormais clair : offrir 80 à 90 % des capacités d'Opus à un prix inférieur. Lors de son lancement, Sonnet 5 mettait en avant un coût d'environ un tiers de celui d'Opus pour les tâches agentiques ; avec la génération 5.5, la vitesse progresse et les scores de référence se rapprochent encore un peu plus d'Opus 5.5, les deux modèles n'étant séparés que de 2 points dans le classement d'Artificial Analysis.

Le changement au niveau gratuit a un impact plus large. Selon Willison, les utilisateurs gratuits de claude.ai disposent désormais d'un modèle nettement supérieur à la série Luna utilisée par le niveau gratuit de ChatGPT. Du côté d'OpenAI, GPT-6 Luna mise sur les prix bas : les dernières données d'Arena indiquent un coût par tâche d'environ 0,05 dollar seulement. Anthropic n'a pas encore annoncé Haiku 5.5 ; Willison s'attend à son arrivée dans les prochaines semaines, moment où l'offre d'entrée de gamme affrontera vraiment Luna.

Pour les développeurs, la conclusion la plus concrète est de ne pas se précipiter sur le niveau max. D'après les données publiques actuelles, les niveaux par défaut ou xhigh se rapprochent davantage de la promesse officielle de "plus rapide et moins cher", tandis que la facture au niveau max peut dépasser celle de la génération précédente. Anthropic n'a publié aucun tableau de coûts détaillé par niveau, donc pour savoir si cela vaut le coup pour une tâche donnée, il faut simplement tester soi-même.

Sources : page de lancement officielle d'Anthropic, blog de Simon Willison, CocoLoop, rapport d'évaluation d'Artificial Analysis ; les tarifs de l'API sont ceux de la page de lancement d'Anthropic, le coût par tâche et l'usage de tokens correspondent au niveau max de l'indice d'intelligence d'Artificial Analysis.