A plataforma de avaliação Arena incluiu o Claude Sonnet 5.5 (nível Max) e o GPT-6.1 Sol (nível Max) no ranking do Agent Arena em 2 de outubro. Os dois modelos ficaram, respectivamente, em 3º e 5º lugar, com taxas de melhoria líquida de 12,52% e 11,23%. As duas primeiras posições continuam com modelos da própria Anthropic: Claude Fable 5.1 (14,31%) e Opus 5.5 (13,82%); o 4º lugar é do GPT-6 Astra (12,27%).
O Agent Arena pontua de forma diferente das arenas de texto já conhecidas. Ele contabiliza sessões reais em que usuários utilizam o modelo como um agente: o modelo precisa chamar ferramentas, executar tarefas de múltiplas etapas, e o que conta no final é se o usuário ficou satisfeito. Segundo a página do ranking, já foram acumuladas cerca de 2,158 milhões de sessões, abrangendo 51 modelos. A taxa de melhoria líquida combina a confiabilidade nas chamadas de ferramentas, a conclusão das tarefas e a direcionabilidade (steerability); em 30 de setembro a Arena atualizou o algoritmo de direcionabilidade, que antes avaliava apenas “se, depois de corrigido, o modelo mudou ou não”, e agora avalia cada resposta avaliável dentro da conversa — modelos que acertam de primeira ganham pontos extras.
3º e 5º lugar: a diferença está dentro da margem de erro
Olhando só para a posição, o Sonnet 5.5 superou o GPT-6 Astra e o GPT-6.1 Sol. Mas ao considerar a margem de erro, o quadro muda: a pontuação do Sonnet 5.5 é 12,52% ± 3,09%, e a do GPT-6.1 Sol é 11,23% ± 2,76%; as duas faixas se sobrepõem em grande parte e ficam só 0,25 ponto percentual do 4º colocado, o Astra. Como os modelos acabaram de entrar no ranking, a amostra de sessões ainda é pequena, e a margem de erro é bem mais larga do que a do Opus 5.5 (± 2,17%). Com os dados atuais, é difícil dizer com certeza quem entre o 3º e o 5º lugar é realmente mais forte.
Em categorias específicas, cada modelo tem seus pontos fortes. O Sonnet 5.5 lidera em recuperação após falhas de comandos Bash, com 15,05%; o GPT-6.1 Sol lidera em alucinação de ferramentas, com apenas 0,49% de taxa de invenção de ferramentas inexistentes, e fica em 2º lugar em “confirmação de conclusão da tarefa pelo usuário”, com 15,47%.
A conta é o que separa os dois
Os preços de API dos dois modelos são, na verdade, iguais: US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Mas, em tarefas de agente, o custo por tarefa chega a variar várias vezes. A página de custos da Arena mostra:
| Modelo | Taxa de melhoria líquida | Custo por tarefa |
|---|---|---|
| Claude Fable 5.1 | 14,31% | cerca de US$ 4,91 |
| Claude Opus 5.5 | 13,82% | cerca de US$ 1,56 |
| Claude Sonnet 5.5 | 12,52% | cerca de US$ 2,99 |
| GPT-6 Astra | 12,27% | cerca de US$ 3,10 |
| GPT-6.1 Sol | 11,23% | cerca de US$ 0,58 |
| DeepSeek V4.1 Flash | 4,02% | cerca de US$ 0,11 |
Preço de token igual, mas custo por tarefa cerca de cinco vezes diferente — a diferença está no volume de tokens consumidos. No nível Max, o Sonnet 5.5 tende a escrever respostas mais longas e “pensar” por mais tempo; avaliações independentes anteriores já tinham constatado que ele consome bem mais tokens por tarefa do que a geração anterior. O resultado é que ele pontua menos e custa mais do que o próprio Opus 5.5, maior dentro da família Claude, e não entra na fronteira de custo-eficiência (fronteira de Pareto) marcada pela Arena. Essa fronteira hoje é formada por quatro pontos: Fable 5.1, Opus 5.5, GPT-6.1 Sol e DeepSeek V4.1 Flash.
O GPT-6.1 Sol foi quem redesenhou essa fronteira desta vez. Segundo a comparação divulgada pela Arena no lançamento: seu custo mediano por tarefa é 39% menor do que o da versão anterior, o GPT-6 Sol, com uma pontuação 1,52 ponto percentual maior; comparado ao GPT-6 Astra, é 81% mais barato, com uma diferença de pontuação dentro de 1,04 ponto percentual. O GPT-6.1 Sol substituiu o GPT-6 Sol pouco mais de uma semana após seu lançamento, e este ranking dá à OpenAI uma validação externa de que é possível ficar “mais barato sem perder pontuação”.
Esses números de custo também têm limitações de metodologia. A Arena contabiliza sessões iniciadas por usuários na própria plataforma, e os tipos de tarefa são principalmente escrita de código, pesquisa de informações e execução de comandos — uma distribuição que pode não corresponder aos fluxos de trabalho reais dentro das empresas; os custos são calculados com base no que a Arena realmente paga nas chamadas de API, e contas empresariais com descontos de cache ou de volume tendem a ser mais baixas. Para usar esta tabela em decisões de compra, o ideal é primeiro testar com uma amostra das próprias tarefas.
Comparando com a geração anterior
Olhando para o histórico, a linha Sonnet vem avançando continuamente no Agent Arena. A geração anterior, o Sonnet 5, ficou em 6º lugar na primeira aparição; agora o 5.5 entrou no top 3. Do lado da OpenAI, o ritmo é outro: o GPT-6 Sol entrou no ranking em 25 de setembro com taxa de melhoria líquida de 9,71%; uma semana depois, o 6.1 Sol veio na sequência, com pontuação cerca de um ponto e meio maior e custo cerca de 40% menor.
Para desenvolvedores, a escolha do modelo para rodar agentes depende do volume de tarefas. Para quem roda só algumas tarefas complexas de vez em quando, um modelo com pontuação alta e preço não tão exagerado, como o Opus 5.5, é mais tranquilo; para quem precisa rodar em grande volume e pagar por uso, opções de baixo custo como o GPT-6.1 Sol e o DeepSeek V4.1 Flash são mais adequadas. Já o Sonnet 5.5, não se sabe ainda onde ficaria em custo e pontuação em um nível de raciocínio mais baixo — até agora a Arena só testou o nível Max, e não há dados sobre isso.
Fontes: ranking do Agent Arena da Arena, página de fronteira de custos da Arena, CocoLoop, conta oficial da Arena, Artificial Analysis; as taxas de melhoria líquida, margens de erro e custos por tarefa de cada modelo seguem os valores exibidos na página da Arena.