A plataforma de avaliação de modelos Arena anunciou na madrugada de 27 de setembro, no horário de Pequim, que a Claude Opus 5.5 (High) alcançou o primeiro lugar na Text Arena logo em sua estreia, com pontuação de 1509. O número é 18 pontos acima da geração anterior, a Opus 5 (High), que hoje ocupa a 11ª posição.
A Text Arena é o ranking mais antigo da Arena: os usuários veem simultaneamente as respostas de dois modelos anônimos e votam na que consideram melhor, e a plataforma converte esses votos em pontuação por um método semelhante ao Elo. O ranking já acumula mais de 8,5 milhões de votos, cobrindo perguntas de escrita, programação, matemática e do dia a dia.
Os seis primeiros lugares são todos da Anthropic
Depois desta atualização, os seis primeiros lugares da Text Arena pertencem inteiramente à Anthropic. Na ordem exibida na página da Arena:
| Posição | Modelo | Pontuação | Votos |
|---|---|---|---|
| 1 | Claude Opus 5.5 (High) | 1509 ±12 | 2.307 |
| 2 | Claude Opus 4.6 (High) | 1505 ±3 | 76.518 |
| 3 | Claude Fable 5 (High) | 1504 ±4 | 36.462 |
| 4 | Claude Opus 4.7 (High) | 1502 ±4 | 64.007 |
| 5 | Claude Fable 5.1 (Max) | 1501 ±7 | 9.942 |
| 6 | Claude Opus 4.6 | 1498 ±3 | 80.836 |
O sétimo lugar ficou com a Muse Spark 1.2 (xHigh), da Meta, com 1496 pontos; o modelo mais bem colocado do Google é o Gemini 3.8 Flash (High), na 10ª posição, com 1492 pontos. Entre os 15 primeiros aparecem apenas três nomes - Anthropic, Meta e Google -; a série GPT-6, lançada pela OpenAI em 22 de setembro, não figura nessa faixa.
A Arena também marcou a Opus 5.5 na fronteira de custo-benefício da Text Arena. Convertendo os preços de entrada e saída, seu preço combinado é de 16 dólares por milhão de tokens. A Anthropic fixou o preço de API da Opus 5.5 em 4 dólares para entrada e 20 dólares para saída, ambos um quinto mais baratos do que na Opus 5.
Votos ainda insuficientes
A diferença entre o primeiro e o sexto lugar é de apenas 11 pontos, enquanto o próprio intervalo de confiança da Opus 5.5 já é de ±12. Em outras palavras, do primeiro ao sexto lugar, esses modelos ainda não podem ser distinguidos estatisticamente.
O motivo está no número de votos. A Opus 5.5 está no ar há menos de uma semana e acumulou apenas 2.307 votos; a Opus 4.6 (High), logo atrás, já tem mais de 76 mil, com intervalo de apenas ±3. É normal na Arena que modelos recém-chegados ao ranking tenham intervalos amplos e pontuações que oscilam bastante - nas próximas semanas a pontuação pode tanto subir quanto cair.
No próprio anúncio, a Arena disse apenas que o modelo «estreou já na liderança», sem divulgar classificações por categoria. Em qual posição a Opus 5.5 fica nos rankings de programação, matemática ou escrita criativa, a empresa ainda não informou.
Por que a Opus 5 ficou atrás de modelos mais antigos
O ponto mais intrigante deste ranking é a Opus 5. Pela ordem de lançamento, ela é mais recente que a Opus 4.6 e a 4.7, mas na Text Arena ocupa apenas a 11ª posição, 14 pontos atrás da Opus 4.6 (High) e 13 pontos atrás da também Anthropic Fable 5 (High).
A Text Arena mede qual resposta os usuários preferem em comparações anônimas, o que não equivale à taxa de acerto na resolução de problemas. O comprimento, o tom e o formato das respostas influenciam os votos; um modelo mais forte em raciocínio pode perfeitamente perder uma votação de preferência por escrever de forma prolixa ou parecida demais com um manual.
A Anthropic investiu nesta geração em qualidade de escrita. Engenheiros da empresa já haviam explicado publicamente por que a escrita da Claude havia piorado, atribuindo o problema à ponderação de recompensas do aprendizado por reforço, que fazia o modelo escrever cada vez mais como se estivesse se dirigindo a uma IA. A Opus 5.5 é a primeira versão com melhorias direcionadas à clareza das frases. Quanto dos 18 pontos de vantagem da Opus 5.5 sobre a Opus 5 vem desse ajuste de escrita e quanto vem de capacidade real, os dados da Arena não permitem separar, e a Anthropic também não apresentou avaliações correspondentes.
Olhando as gerações em sequência: Opus 4.6 e 4.7 permanecem até hoje entre os quatro primeiros, a Opus 5 não conseguiu assumir a liderança após seu lançamento, e só a Opus 5.5 trouxe um novo rosto para o primeiro lugar. No momento, o principal rival da Anthropic neste ranking de preferência é a sua própria versão anterior.
Fontes: conta oficial da Arena, ranking Arena Text, CocoLoop, página de preços de modelos da Anthropic; pontuações, intervalos de confiança e números de votos conforme os dados atuais da página da Arena.