Sonnet 4.6 em programação fica apenas 1,2 pontos atrás do Opus com diferença de preço de 5 vezes

Se você ainda está preocupado em comprar ou não o limite de API do Claude Opus 4.6, este artigo pode fazer você economizar dinheiro.

A Anthropic lançou o Claude Sonnet 4.6 em fevereiro, com o mesmo preço do Sonnet 4.5 – US$ 3/milhão de tokens para entrada, US$ 15/milhão de tokens para saída – mas as pontuações em benchmarks se aproximaram do Opus 4.6, que é 5 vezes mais caro.

Números falam

Primeiro, a comparação mais direta:

Benchmark Sonnet 4.6 Opus 4.6 Diferença
SWE-bench Verified (programação) 79,6% 80,8% -1,2%
OSWorld-Verified (controle de computador) 72,5% 72,7% -0,2%
Matemática (MATH-500) 89% Não divulgado
GPQA Diamond (raciocínio científico) 74,1% 91,3% -17,2%

Em programação e controle de computador – ou seja, a maioria das tarefas para as quais as empresas usam Claude – o Sonnet 4.6 já está quase empatado com o Opus 4.6. A diferença real aparece em tarefas mais acadêmicas, como raciocínio científico, onde o Opus 4.6 atinge 91,3% contra 74,1% do Sonnet – uma lacuna que não pode ser ignorada.

Mas se seu caso de uso é principalmente escrever código, controlar navegadores e processar documentos longos, pagar 5 vezes mais por uma melhoria de 1,2 pontos percentuais em programação – fazendo as contas, você verá que não é uma escolha inteligente.

O quão íngreme é a curva de controle de computador

A Anthropic divulgou um conjunto de dados mostrando a evolução das pontuações do OSWorld-Verified (teste padrão que mede a capacidade da IA de controlar computadores autonomamente) nos últimos 16 meses:

  • Sonnet 3.5: 14,9%
  • Sonnet 3.5 v2: 28,0%
  • Sonnet 3.6: 42,2%
  • Sonnet 4.5: 61,4%
  • Sonnet 4.6: 72,5%

Em um ano e meio, de 14,9% para 72,5% – essa curva é mais íngreme do que a maioria das pessoas percebe. Em testes de automação de fluxo de trabalho no setor de seguros, o Sonnet 4.6 alcançou 94% de precisão, cobrindo tarefas complicadas como manipular planilhas complexas do Excel, preencher formulários web de várias etapas e acessar aplicativos desktop antigos.

Matemática deu um salto enorme

O Sonnet 4.5 obteve 62 pontos em matemática, e o Sonnet 4.6 saltou diretamente para 89 pontos. Esta é a maior melhoria individual dentro da mesma geração de produto. A Anthropic não divulgou os motivos específicos em detalhes, mas combinado com a melhoria geral na capacidade de raciocínio, é provável que esteja relacionado a uma melhor qualidade da cadeia de pensamento (chain-of-thought).

Dados de preferência do usuário

A Anthropic realizou uma série de testes internos do Claude Code, permitindo que desenvolvedores comparassem a qualidade da saída sem saber qual modelo estava por trás:

  • Sonnet 4.6 vs Sonnet 4.5: 70% dos usuários escolheram Sonnet 4.6
  • Sonnet 4.6 vs Opus 4.5: 59% dos usuários escolheram Sonnet 4.6

O segundo conjunto de dados é mais interessante. O Opus 4.5 é muito mais caro que o Sonnet 4.6, mas na avaliação subjetiva das saídas reais de programação, o Sonnet 4.6 foi mais popular. Os motivos citados incluem: seguimento de instruções mais preciso, menos alucinações e sem superengenharia (este é um problema de longa data da série Opus – ela tende a complicar requisitos simples).

Contexto de 1M não é chamariz

Desta vez, o Sonnet 4.6 também vem com uma janela de contexto de 1 milhão de tokens (versão beta), sem necessidade de cabeçalho adicional. Solicitações acima de 200k passam automaticamente por este canal e são cobradas pela tarifa padrão.

1 milhão de tokens equivale a quanto? Toda a base de código de uma empresa de médio porte, ou dezenas de artigos acadêmicos, podem ser colocados em uma única solicitação para processamento. Cenários que antes exigiam o particionamento RAG agora podem ser jogados diretamente para que o modelo encontre as correlações por conta própria.

Qual você deve escolher

Escolha Sonnet 4.6 se:

  • Suas principais tarefas são escrever código, controlar navegadores, processar documentos longos
  • Volume de consultas alto, sensível a preço
  • Não precisa de raciocínio científico de nível de doutorado

Escolha Opus 4.6 se:

  • Precisa de raciocínio científico intenso ou tarefas acadêmicas
  • Necessidades de contexto extremamente complexas
  • Não se importa com a diferença de preço, só quer o melhor resultado

Para a maioria dos desenvolvedores e empresas, o Sonnet 4.6 é atualmente a porta de entrada mais custo-benefício para o Claude. O Opus 4.6 custa US$ 15/US$ 75, o Sonnet 4.6 custa US$ 3/US$ 15 – mesma capacidade de programação com diferença de preço de 5 vezes. Essa conta não é difícil de fazer.

Fontes de referência: Introducing Claude Sonnet 4.6 (oficial da Anthropic); CocoLoop; Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide (NxCode); Claude Sonnet 4.6: 1M context and stronger computer use (Gend.co)