La plateforme d'évaluation de modèles Arena a annoncé dans la nuit du 27 septembre, heure de Pékin, que Claude Opus 5.5 (High) s'était hissé à la première place de Text Arena dès ses débuts, avec un score de 1509. Ce chiffre dépasse de 18 points la génération précédente, Opus 5 (High), qui occupe désormais la 11e place.
Text Arena est le classement le plus ancien d'Arena : les utilisateurs voient simultanément les réponses de deux modèles anonymes et votent pour la meilleure, puis la plateforme convertit ces votes en score selon une méthode proche d'Elo. Le classement a déjà accumulé plus de 8,5 millions de votes, couvrant l'écriture, la programmation, les mathématiques et les questions du quotidien.
Les six premières places reviennent toutes à Anthropic
Après cette mise à jour, les six premières places de Text Arena appartiennent entièrement à Anthropic. Selon l'ordre affiché sur la page d'Arena :
| Rang | Modèle | Score | Votes |
|---|---|---|---|
| 1 | Claude Opus 5.5 (High) | 1509 ±12 | 2 307 |
| 2 | Claude Opus 4.6 (High) | 1505 ±3 | 76 518 |
| 3 | Claude Fable 5 (High) | 1504 ±4 | 36 462 |
| 4 | Claude Opus 4.7 (High) | 1502 ±4 | 64 007 |
| 5 | Claude Fable 5.1 (Max) | 1501 ±7 | 9 942 |
| 6 | Claude Opus 4.6 | 1498 ±3 | 80 836 |
La septième place revient à Muse Spark 1.2 (xHigh), de Meta, avec 1496 points ; le modèle le mieux classé de Google est Gemini 3.8 Flash (High), à la 10e place, avec 1492 points. Parmi les 15 premiers, seuls trois noms apparaissent : Anthropic, Meta et Google ; la série GPT-6, tout juste lancée par OpenAI le 22 septembre, n'y figure pas.
Arena a également placé Opus 5.5 sur la frontière coût-efficacité de Text Arena. En convertissant les prix d'entrée et de sortie, son tarif combiné s'élève à 16 dollars par million de tokens. Anthropic a fixé le prix API d'Opus 5.5 à 4 dollars en entrée et 20 dollars en sortie, soit un cinquième de moins que pour Opus 5 dans les deux cas.
Encore trop peu de votes
L'écart entre la première et la sixième place n'est que de 11 points, alors que l'intervalle de confiance d'Opus 5.5 lui-même est déjà de ±12. Autrement dit, entre la première et la sixième place, ces modèles ne peuvent pour l'instant pas être distingués statistiquement.
La raison tient au nombre de votes. Opus 5.5 est en ligne depuis moins d'une semaine et n'a accumulé que 2 307 votes ; Opus 4.6 (High), juste derrière, en compte déjà plus de 76 000, avec une marge de seulement ±3. Qu'un modèle tout juste arrivé dans le classement affiche une marge large et un score qui fluctue fortement est habituel chez Arena - dans les semaines qui viennent, le score pourrait tout aussi bien monter que descendre.
Dans son annonce, Arena s'est contenté de dire que le modèle avait « pris la tête dès ses débuts », sans fournir de classement par catégorie. La position d'Opus 5.5 dans les sous-classements de programmation, de mathématiques ou d'écriture créative n'a pour l'instant pas été communiquée.
Pourquoi Opus 5 se retrouve derrière des modèles plus anciens
Le plus intrigant dans ce classement, c'est Opus 5. Par ordre de sortie, il est plus récent qu'Opus 4.6 et 4.7, mais sur Text Arena il ne se classe que 11e, avec 14 points de retard sur Opus 4.6 (High) et 13 points sur son cousin maison Fable 5 (High).
Text Arena mesure la réponse que les utilisateurs préfèrent lors de comparaisons anonymes, ce qui n'équivaut pas au taux de bonnes réponses. La longueur, le ton et la mise en forme des réponses influencent le vote ; un modèle plus performant en raisonnement peut tout à fait perdre un vote de préférence parce qu'il écrit de façon trop verbeuse ou trop proche d'un mode d'emploi.
Anthropic a mis l'accent sur l'écriture pour cette génération. Des ingénieurs de l'entreprise avaient déjà expliqué publiquement pourquoi l'écriture de Claude s'était dégradée, attribuant le problème à une pondération des récompenses en apprentissage par renforcement qui poussait le modèle à écrire de plus en plus comme s'il s'adressait à une IA. Opus 5.5 est la première version à recevoir une amélioration ciblée sur la clarté des phrases. Quelle part des 18 points d'avance d'Opus 5.5 sur Opus 5 provient de cet ajustement d'écriture et quelle part vient d'une capacité réellement supérieure, les données d'Arena ne permettent pas de le démêler, et Anthropic n'a pas non plus publié d'évaluation correspondante.
En reliant les générations entre elles : Opus 4.6 et 4.7 restent aujourd'hui dans le top 4, Opus 5 n'a pas réussi à prendre la relève après sa sortie, et il aura fallu attendre Opus 5.5 pour que la première place change de visage. Pour l'instant, le principal rival d'Anthropic sur ce classement de préférence, c'est sa propre ancienne version.
Sources : compte officiel d'Arena, classement Arena Text, CocoLoop, page tarifaire des modèles d'Anthropic ; scores, intervalles de confiance et nombres de votes correspondent aux données actuelles de la page Arena.