Sonnet 5.5 fica em 3º e GPT-6.1 Sol em 5º no Agent Arena

A plataforma de avaliação Arena incluiu o Claude Sonnet 5.5 (nível Max) e o GPT-6.1 Sol (nível Max) no ranking do Agent Arena em 2 de outubro. Os dois modelos ficaram, respectivamente, em 3º e 5º lugar, com taxas de melhoria líquida de 12,52% e 11,23%. As duas primeiras posições continuam com modelos da própria Anthropic: Claude Fable 5.1 (14,31%) e Opus 5.5 (13,82%); o 4º lugar é do GPT-6 Astra (12,27%).

O Agent Arena pontua de forma diferente das arenas de texto já conhecidas. Ele contabiliza sessões reais em que usuários utilizam o modelo como um agente: o modelo precisa chamar ferramentas, executar tarefas de múltiplas etapas, e o que conta no final é se o usuário ficou satisfeito. Segundo a página do ranking, já foram acumuladas cerca de 2,158 milhões de sessões, abrangendo 51 modelos. A taxa de melhoria líquida combina a confiabilidade nas chamadas de ferramentas, a conclusão das tarefas e a direcionabilidade (steerability); em 30 de setembro a Arena atualizou o algoritmo de direcionabilidade, que antes avaliava apenas “se, depois de corrigido, o modelo mudou ou não”, e agora avalia cada resposta avaliável dentro da conversa — modelos que acertam de primeira ganham pontos extras.

3º e 5º lugar: a diferença está dentro da margem de erro

Olhando só para a posição, o Sonnet 5.5 superou o GPT-6 Astra e o GPT-6.1 Sol. Mas ao considerar a margem de erro, o quadro muda: a pontuação do Sonnet 5.5 é 12,52% ± 3,09%, e a do GPT-6.1 Sol é 11,23% ± 2,76%; as duas faixas se sobrepõem em grande parte e ficam só 0,25 ponto percentual do 4º colocado, o Astra. Como os modelos acabaram de entrar no ranking, a amostra de sessões ainda é pequena, e a margem de erro é bem mais larga do que a do Opus 5.5 (± 2,17%). Com os dados atuais, é difícil dizer com certeza quem entre o 3º e o 5º lugar é realmente mais forte.

Em categorias específicas, cada modelo tem seus pontos fortes. O Sonnet 5.5 lidera em recuperação após falhas de comandos Bash, com 15,05%; o GPT-6.1 Sol lidera em alucinação de ferramentas, com apenas 0,49% de taxa de invenção de ferramentas inexistentes, e fica em 2º lugar em “confirmação de conclusão da tarefa pelo usuário”, com 15,47%.

A conta é o que separa os dois

Os preços de API dos dois modelos são, na verdade, iguais: US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Mas, em tarefas de agente, o custo por tarefa chega a variar várias vezes. A página de custos da Arena mostra:

ModeloTaxa de melhoria líquidaCusto por tarefa
Claude Fable 5.114,31%cerca de US$ 4,91
Claude Opus 5.513,82%cerca de US$ 1,56
Claude Sonnet 5.512,52%cerca de US$ 2,99
GPT-6 Astra12,27%cerca de US$ 3,10
GPT-6.1 Sol11,23%cerca de US$ 0,58
DeepSeek V4.1 Flash4,02%cerca de US$ 0,11

Preço de token igual, mas custo por tarefa cerca de cinco vezes diferente — a diferença está no volume de tokens consumidos. No nível Max, o Sonnet 5.5 tende a escrever respostas mais longas e “pensar” por mais tempo; avaliações independentes anteriores já tinham constatado que ele consome bem mais tokens por tarefa do que a geração anterior. O resultado é que ele pontua menos e custa mais do que o próprio Opus 5.5, maior dentro da família Claude, e não entra na fronteira de custo-eficiência (fronteira de Pareto) marcada pela Arena. Essa fronteira hoje é formada por quatro pontos: Fable 5.1, Opus 5.5, GPT-6.1 Sol e DeepSeek V4.1 Flash.

O GPT-6.1 Sol foi quem redesenhou essa fronteira desta vez. Segundo a comparação divulgada pela Arena no lançamento: seu custo mediano por tarefa é 39% menor do que o da versão anterior, o GPT-6 Sol, com uma pontuação 1,52 ponto percentual maior; comparado ao GPT-6 Astra, é 81% mais barato, com uma diferença de pontuação dentro de 1,04 ponto percentual. O GPT-6.1 Sol substituiu o GPT-6 Sol pouco mais de uma semana após seu lançamento, e este ranking dá à OpenAI uma validação externa de que é possível ficar “mais barato sem perder pontuação”.

Esses números de custo também têm limitações de metodologia. A Arena contabiliza sessões iniciadas por usuários na própria plataforma, e os tipos de tarefa são principalmente escrita de código, pesquisa de informações e execução de comandos — uma distribuição que pode não corresponder aos fluxos de trabalho reais dentro das empresas; os custos são calculados com base no que a Arena realmente paga nas chamadas de API, e contas empresariais com descontos de cache ou de volume tendem a ser mais baixas. Para usar esta tabela em decisões de compra, o ideal é primeiro testar com uma amostra das próprias tarefas.

Comparando com a geração anterior

Olhando para o histórico, a linha Sonnet vem avançando continuamente no Agent Arena. A geração anterior, o Sonnet 5, ficou em 6º lugar na primeira aparição; agora o 5.5 entrou no top 3. Do lado da OpenAI, o ritmo é outro: o GPT-6 Sol entrou no ranking em 25 de setembro com taxa de melhoria líquida de 9,71%; uma semana depois, o 6.1 Sol veio na sequência, com pontuação cerca de um ponto e meio maior e custo cerca de 40% menor.

Para desenvolvedores, a escolha do modelo para rodar agentes depende do volume de tarefas. Para quem roda só algumas tarefas complexas de vez em quando, um modelo com pontuação alta e preço não tão exagerado, como o Opus 5.5, é mais tranquilo; para quem precisa rodar em grande volume e pagar por uso, opções de baixo custo como o GPT-6.1 Sol e o DeepSeek V4.1 Flash são mais adequadas. Já o Sonnet 5.5, não se sabe ainda onde ficaria em custo e pontuação em um nível de raciocínio mais baixo — até agora a Arena só testou o nível Max, e não há dados sobre isso.

Fontes: ranking do Agent Arena da Arena, página de fronteira de custos da Arena, CocoLoop, conta oficial da Arena, Artificial Analysis; as taxas de melhoria líquida, margens de erro e custos por tarefa de cada modelo seguem os valores exibidos na página da Arena.