La plateforme d'évaluation Arena a ajouté le 2 octobre Claude Sonnet 5.5 (niveau Max) et GPT-6.1 Sol (niveau Max) au classement de l'Agent Arena. Les deux modèles se classent respectivement 3e et 5e, avec des taux d'amélioration net de 12,52 % et 11,23 %. Les deux premières places restent occupées par les modèles d'Anthropic eux-mêmes, Claude Fable 5.1 (14,31 %) et Opus 5.5 (13,82 %) ; la 4e place revient à GPT-6 Astra (12,27 %).
L'Agent Arena note différemment des arènes de texte classiques. Elle comptabilise de vraies sessions où des utilisateurs emploient le modèle comme un agent : celui-ci doit appeler des outils, exécuter des tâches en plusieurs étapes, et en fin de compte ce qui compte, c'est la satisfaction de l'utilisateur. Selon la page du classement, environ 2,158 millions de sessions ont été cumulées à ce jour, répartis sur 51 modèles. Le taux d'amélioration net combine la fiabilité des appels d'outils, l'achèvement des tâches et la « steerability » (capacité à être orienté) ; le 30 septembre, Arena a révisé l'algorithme de steerability, qui ne regardait auparavant que « si, après correction, le modèle avait changé », et évalue désormais chaque réponse évaluable au fil de la conversation — les modèles qui font juste du premier coup gagnent des points supplémentaires.
Troisième et cinquième : l'écart tient dans la marge d'erreur
Au seul classement, Sonnet 5.5 devance GPT-6 Astra et GPT-6.1 Sol. Mais en tenant compte de la marge d'erreur, le tableau change : le score de Sonnet 5.5 est de 12,52 % ± 3,09 %, celui de GPT-6.1 Sol de 11,23 % ± 2,76 % ; les deux intervalles se recoupent largement et ne sont qu'à 0,25 point de pourcentage de la 4e place, Astra. Les nouveaux modèles venant juste d'entrer au classement, l'échantillon de sessions reste faible, d'où une marge d'erreur bien plus large que celle d'Opus 5.5 (± 2,17 %). Avec les données actuelles, il est difficile d'affirmer qui, entre la 3e et la 5e place, est réellement le plus fort.
Sur les sous-catégories, chacun a ses points forts. Sonnet 5.5 arrive premier sur la reprise après échec de commandes Bash, avec 15,05 % ; GPT-6.1 Sol arrive premier sur l'hallucination d'outils, avec seulement 0,49 % de taux d'invention d'outils inexistants, et se classe deuxième sur « confirmation par l'utilisateur de la fin de la tâche » avec 15,47 %.
C'est la facture qui creuse l'écart
Les tarifs API des deux modèles sont en réalité identiques : 2 dollars par million de tokens en entrée, 10 dollars par million en sortie. Mais sur des tâches de type agent, le coût par tâche peut varier de plusieurs fois. La page des coûts d'Arena montre :
| Modèle | Taux d'amélioration net | Coût par tâche |
|---|---|---|
| Claude Fable 5.1 | 14,31 % | environ 4,91 dollars |
| Claude Opus 5.5 | 13,82 % | environ 1,56 dollar |
| Claude Sonnet 5.5 | 12,52 % | environ 2,99 dollars |
| GPT-6 Astra | 12,27 % | environ 3,10 dollars |
| GPT-6.1 Sol | 11,23 % | environ 0,58 dollar |
| DeepSeek V4.1 Flash | 4,02 % | environ 0,11 dollar |
Même prix au token, mais un coût par tâche environ cinq fois différent : l'écart vient du volume de tokens consommés. Au niveau Max, Sonnet 5.5 tend à écrire plus long et à « réfléchir » plus longtemps ; des évaluations tierces antérieures avaient déjà constaté qu'il consomme nettement plus de tokens par tâche que la génération précédente. Résultat : il obtient un score plus bas et coûte plus cher que son propre modèle Opus 5.5, plus grand au sein de la gamme Claude, et ne figure pas sur la frontière coût-efficacité (frontière de Pareto) relevée par Arena. Cette frontière est aujourd'hui formée de quatre points : Fable 5.1, Opus 5.5, GPT-6.1 Sol et DeepSeek V4.1 Flash.
GPT-6.1 Sol est celui qui a redessiné cette frontière cette fois-ci. Selon la comparaison donnée par Arena lors de l'annonce : son coût médian par tâche est inférieur de 39 % à celui de la version précédente, GPT-6 Sol, pour un score supérieur de 1,52 point de pourcentage ; comparé à GPT-6 Astra, il est 81 % moins cher, avec un écart de score limité à 1,04 point de pourcentage. GPT-6.1 Sol a remplacé GPT-6 Sol à peine plus d'une semaine après sa sortie, et ce classement offre à OpenAI une validation tierce du principe « moins cher sans perdre de points ».
Ces chiffres de coût ont aussi leurs limites méthodologiques. Arena comptabilise des sessions lancées par les utilisateurs sur sa propre plateforme, et les types de tâches sont surtout l'écriture de code, la recherche d'informations et l'exécution de commandes — une répartition qui ne correspond pas forcément aux flux de travail réels en entreprise ; les coûts sont calculés d'après ce qu'Arena paie réellement pour ses appels API, et les factures d'entreprise bénéficiant de remises sur le cache ou sur le volume seront plus basses. Pour s'appuyer sur ce tableau dans une décision d'achat, il vaut mieux d'abord retester sur un échantillon de ses propres tâches.
Face à la génération précédente
Avec le temps, la lignée Sonnet continue d'avancer sur l'Agent Arena. La génération précédente, Sonnet 5, était 6e à sa première apparition ; cette fois, 5.5 entre dans le top 3. Du côté d'OpenAI, le rythme est différent : GPT-6 Sol est entré au classement le 25 septembre avec un taux d'amélioration net de 9,71 % ; une semaine plus tard, 6.1 Sol a pris le relais, avec un score en hausse d'environ un point et demi et un coût en baisse d'environ 40 %.
Pour les développeurs, le choix du modèle pour faire tourner des agents dépend du volume de tâches. Pour qui exécute seulement quelques tâches complexes de temps en temps, un modèle au score élevé et au prix pas trop excessif, comme Opus 5.5, est plus rassurant ; pour qui doit en faire tourner un grand volume facturé à l'usage, des modèles à faible coût comme GPT-6.1 Sol ou DeepSeek V4.1 Flash conviennent mieux. Quant à Sonnet 5.5, on ne sait pas encore où il se situerait en coût et en score à un niveau de raisonnement plus bas : Arena n'a pour l'instant testé que le niveau Max, sans données sur ce point.
Sources : classement Agent Arena d'Arena, page de frontière des coûts d'Arena, CocoLoop, compte officiel d'Arena, Artificial Analysis ; les taux d'amélioration net, marges d'erreur et coûts par tâche de chaque modèle correspondent aux valeurs affichées sur la page d'Arena.