A Anthropic lançou o Claude Sonnet 5.5 em 28 de setembro, o segundo modelo da família Claude 5.5 depois do Opus 5.5. A empresa destaca dois números principais: velocidade pelo menos 30% maior que a do Sonnet 5, e custo por tarefa até 30% menor na maioria dos trabalhos. Os preços da API não mudaram: continuam em 2 dólares por milhão de tokens de entrada, 10 dólares de saída e 0,2 dólar para leitura em cache.
O modelo está disponível desde o lançamento na própria plataforma da Claude, na AWS, no Google Cloud e no Microsoft Azure, com o nome de API claude-sonnet-5-5, e a opção de retenção zero de dados continua disponível em todas as plataformas, como sempre. O desenvolvedor independente Simon Willison notou que o nível gratuito do claude.ai já foi trocado para o Sonnet 5.5.
O boletim oficial
Estes são os principais resultados listados pela Anthropic na página de lançamento:
| Benchmark | Sonnet 5.5 |
|---|---|
| Terminal-Bench 4.0 | 70,6% |
| OSWorld 2.1 (parcial) | 80,1% |
| Humanity's Last Exam (com ferramentas) | 64,5% |
| CursorBench 4.0 | 55,5% |
| FrontierCode 1.1 (Max) | 46,2% |
| GDPval-AA v2.1 | 1844 |
O retorno de vários clientes que testaram o modelo antecipadamente se concentrou na velocidade. A Box afirma que o novo modelo é 2,4 vezes mais rápido que a versão anterior, e o Slack diz ter obtido resultados melhores e mais rápidos sem alterar os prompts.
"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."
O Sonnet 5.5 programa rápido e basta uma instrução para reconduzi-lo durante a iteração, segundo Tyler Nishida, da Every.
O outro lado, segundo testes independentes
A Artificial Analysis deu ao Sonnet 5.5 um índice de inteligência de 56 pontos, em segundo lugar, apenas 2 pontos abaixo dos 58 do Opus 5.5. No próprio teste Terminal-Bench 4.0 da empresa, o Sonnet 5.5 obteve 64%, contra 60% do Opus 5.5 e do GPT-6 Astra. O ponto fraco está nas questões factuais: precisão factual de 54%, contra 66% do Opus 5.5, e também 6 pontos abaixo do Opus 5.5 em testes de raciocínio científico.
O item custo não bate com o discurso oficial. Ao rodar todo o conjunto de testes no nível máximo de raciocínio (max), a Artificial Analysis mediu que o Sonnet 5.5 gera, em média, cerca de 193 mil tokens de saída por tarefa, cerca de 60% mais que o Opus 5.5 e o Sonnet 5 no mesmo nível max, e 7 vezes mais que o GPT-6 Astra. Com o preço unitário igual e mais tokens gerados, o custo por tarefa fica em torno de 7,6 dólares, cerca de 50% mais que o Sonnet 5.
Os dois critérios são diferentes. A Anthropic fala da "maioria dos trabalhos", ou seja, tarefas comuns de programação e escrita no nível padrão; a Artificial Analysis testa o cenário extremo, com o orçamento de raciocínio no máximo. Willison notou o mesmo fenômeno: ao pedir ao modelo que escrevesse um pequeno aplicativo WebGL no nível max, ele consumiu 128 mil tokens e 1,28 dólar; já no nível xhigh, o resultado saiu em 41 segundos e custou apenas cerca de 0,06 dólar. Ele também aponta que o Sonnet 5.5 compartilha um defeito com o Opus 5.5: no nível max, é fácil esgotar o limite de tokens.
Comparado com modelos da mesma categoria
Em conjunto, o posicionamento da linha Sonnet está claro agora: entregar de 80% a 90% da capacidade do Opus por um preço menor. No lançamento, o Sonnet 5 era divulgado como custando cerca de um terço do Opus em tarefas de agentes; nesta geração 5.5, a velocidade aumentou e as notas de benchmark se aproximaram ainda mais do Opus 5.5, com apenas 2 pontos de diferença no ranking da Artificial Analysis.
A mudança no nível gratuito tem impacto maior. Na avaliação de Willison, os usuários gratuitos do claude.ai agora recebem um modelo bem superior à série Luna usada no nível gratuito do ChatGPT. Do lado da OpenAI, o GPT-6 Luna aposta em preços baixos: os dados mais recentes do Arena mostram um custo por tarefa de apenas cerca de 0,05 dólar. A Anthropic ainda não anunciou o Haiku 5.5; Willison espera que ele chegue nas próximas semanas, quando o nível de entrada finalmente enfrentará o Luna diretamente.
Para os desenvolvedores, a ação mais direta é não se apressar em ativar o nível max. Pelos dados públicos atuais, os níveis padrão ou xhigh se aproximam mais da promessa oficial de "mais rápido e mais barato", enquanto a conta no nível max pode ficar até mais cara que na geração anterior. A Anthropic não divulgou uma tabela de custos por nível, então, para saber se vale a pena numa tarefa específica, é preciso testar por conta própria.
Fontes: página oficial de lançamento da Anthropic, blog de Simon Willison, CocoLoop, relatório de avaliação da Artificial Analysis; os preços da API seguem a página de lançamento da Anthropic, e o custo por tarefa e o uso de tokens seguem o critério do nível max do índice de inteligência da Artificial Analysis.