Sonnet 4.6 en programmation n’est qu’à 1,2 point d’Opus pour un prix 5 fois inférieur

Si vous hésitez encore à acheter du quota API pour Claude Opus 4.6, cet article pourrait vous faire économiser de l’argent.

Anthropic a publié Claude Sonnet 4.6 en février, au même prix que Sonnet 4.5 – 3 $/million de tokens en entrée, 15 $/million de tokens en sortie – mais ses scores aux benchmarks se rapprochent directement de ceux de l’Opus 4.6, pourtant 5 fois plus cher.

Les chiffres parlent

Voici d’abord la comparaison la plus directe :

Benchmark Sonnet 4.6 Opus 4.6 Écart
SWE-bench Verified (programmation) 79,6 % 80,8 % -1,2 %
OSWorld-Verified (contrôle d’ordinateur) 72,5 % 72,7 % -0,2 %
Mathématiques (MATH-500) 89 % Non publié
GPQA Diamond (raisonnement scientifique) 74,1 % 91,3 % -17,2 %

En programmation et en contrôle d’ordinateur – c’est-à-dire la plupart des tâches pour lesquelles les entreprises utilisent Claude – Sonnet 4.6 est déjà presque à égalité avec Opus 4.6. L’écart réel apparaît dans les tâches plus académiques comme le raisonnement scientifique, où Opus 4.6 atteint 91,3 % contre 74,1 % pour Sonnet – un fossé qu’on ne peut ignorer.

Mais si votre cas d’usage est principalement l’écriture de code, le contrôle de navigateurs et le traitement de longs documents, payer 5 fois plus pour une amélioration de 1,2 point de pourcentage en programmation – en faisant le calcul, vous verrez que ce n’est pas un choix judicieux.

À quel point la courbe du contrôle d’ordinateur est raide

Anthropic a publié un ensemble de données montrant l’évolution des scores OSWorld-Verified (test standard mesurant la capacité d’une IA à contrôler un ordinateur de manière autonome) au cours des 16 derniers mois :

  • Sonnet 3.5 : 14,9 %
  • Sonnet 3.5 v2 : 28,0 %
  • Sonnet 3.6 : 42,2 %
  • Sonnet 4.5 : 61,4 %
  • Sonnet 4.6 : 72,5 %

En un an et demi, de 14,9 % à 72,5 % – cette courbe est plus raide que ce que la plupart des gens perçoivent. Lors de tests d’automatisation de flux de travail dans le secteur de l’assurance, Sonnet 4.6 a atteint une précision de 94 %, couvrant des tâches complexes comme la manipulation de feuilles de calcul Excel complexes, le remplissage de formulaires web en plusieurs étapes et l’appel d’applications de bureau anciennes.

Les mathématiques ont fait un bond énorme

Sonnet 4.5 a obtenu 62 points en mathématiques, et Sonnet 4.6 a directement bondi à 89 points. Il s’agit de la plus grande amélioration individuelle au sein d’une même génération de produit. Anthropic n’a pas divulgué les raisons spécifiques en détail, mais combiné à l’amélioration globale de la capacité de raisonnement, il est probable que cela soit lié à une meilleure qualité de la chaîne de pensée (chain-of-thought).

Données de préférence des utilisateurs

Anthropic a mené une série de tests internes de Claude Code, permettant aux développeurs de comparer la qualité des sorties sans savoir quel modèle se cachait derrière :

  • Sonnet 4.6 vs Sonnet 4.5 : 70 % des utilisateurs ont choisi Sonnet 4.6
  • Sonnet 4.6 vs Opus 4.5 : 59 % des utilisateurs ont choisi Sonnet 4.6

Le deuxième ensemble de données est plus intéressant. Opus 4.5 est bien plus cher que Sonnet 4.6, mais dans l’évaluation subjective des sorties de programmation réelles, Sonnet 4.6 a été plus populaire. Les raisons invoquées incluent : un suivi des instructions plus précis, moins d’hallucinations et pas de sur-ingénierie (c’est un problème de longue date de la série Opus – elle a tendance à complexifier des demandes simples).

Le contexte 1M n’est pas un gadget

Cette fois, Sonnet 4.6 est également doté d’une fenêtre de contexte d’1 million de tokens (version bêta), sans nécessité d’en-tête supplémentaire. Les requêtes dépassant 200k passent automatiquement par ce canal et sont facturées au tarif standard.

À quoi correspond 1 million de tokens ? L’intégralité de la base de code d’une entreprise de taille moyenne, ou des dizaines d’articles académiques, peuvent être placés dans une seule requête pour traitement. Les scénarios qui nécessitaient auparavant un découpage RAG peuvent désormais être directement injectés pour que le modèle trouve lui-même les corrélations.

Lequel choisir ?

Choisissez Sonnet 4.6 si :

  • Vos tâches principales sont l’écriture de code, le contrôle de navigateurs, le traitement de longs documents
  • Volume de requêtes élevé, sensible au prix
  • Vous n’avez pas besoin de raisonnement scientifique de niveau doctoral

Choisissez Opus 4.6 si :

  • Vous avez besoin d’un raisonnement scientifique intense ou de tâches académiques
  • Besoins de contexte extrêmement complexes
  • La différence de prix n’a pas d’importance, seul le meilleur résultat compte

Pour la plupart des développeurs et des entreprises, Sonnet 4.6 est actuellement le point d’entrée Claude offrant le meilleur rapport qualité-prix. Opus 4.6 coûte 15/75 $, Sonnet 4.6 coûte 3/15 $ – des capacités de programmation identiques pour une différence de prix de 5 fois. Ce calcul n’est pas difficile à faire.

Sources de référence : Introducing Claude Sonnet 4.6 (officiel d’Anthropic) ; CocoLoop ; Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide (NxCode) ; Claude Sonnet 4.6: 1M context and stronger computer use (Gend.co)