Se você ainda está preocupado em comprar ou não o limite de API do Claude Opus 4.6, este artigo pode fazer você economizar dinheiro.
A Anthropic lançou o Claude Sonnet 4.6 em fevereiro, com o mesmo preço do Sonnet 4.5 – US$ 3/milhão de tokens para entrada, US$ 15/milhão de tokens para saída – mas as pontuações em benchmarks se aproximaram do Opus 4.6, que é 5 vezes mais caro.
Números falam
Primeiro, a comparação mais direta:
| Benchmark | Sonnet 4.6 | Opus 4.6 | Diferença |
|---|---|---|---|
| SWE-bench Verified (programação) | 79,6% | 80,8% | -1,2% |
| OSWorld-Verified (controle de computador) | 72,5% | 72,7% | -0,2% |
| Matemática (MATH-500) | 89% | Não divulgado | — |
| GPQA Diamond (raciocínio científico) | 74,1% | 91,3% | -17,2% |
Em programação e controle de computador – ou seja, a maioria das tarefas para as quais as empresas usam Claude – o Sonnet 4.6 já está quase empatado com o Opus 4.6. A diferença real aparece em tarefas mais acadêmicas, como raciocínio científico, onde o Opus 4.6 atinge 91,3% contra 74,1% do Sonnet – uma lacuna que não pode ser ignorada.
Mas se seu caso de uso é principalmente escrever código, controlar navegadores e processar documentos longos, pagar 5 vezes mais por uma melhoria de 1,2 pontos percentuais em programação – fazendo as contas, você verá que não é uma escolha inteligente.
O quão íngreme é a curva de controle de computador
A Anthropic divulgou um conjunto de dados mostrando a evolução das pontuações do OSWorld-Verified (teste padrão que mede a capacidade da IA de controlar computadores autonomamente) nos últimos 16 meses:
- Sonnet 3.5: 14,9%
- Sonnet 3.5 v2: 28,0%
- Sonnet 3.6: 42,2%
- Sonnet 4.5: 61,4%
- Sonnet 4.6: 72,5%
Em um ano e meio, de 14,9% para 72,5% – essa curva é mais íngreme do que a maioria das pessoas percebe. Em testes de automação de fluxo de trabalho no setor de seguros, o Sonnet 4.6 alcançou 94% de precisão, cobrindo tarefas complicadas como manipular planilhas complexas do Excel, preencher formulários web de várias etapas e acessar aplicativos desktop antigos.
Matemática deu um salto enorme
O Sonnet 4.5 obteve 62 pontos em matemática, e o Sonnet 4.6 saltou diretamente para 89 pontos. Esta é a maior melhoria individual dentro da mesma geração de produto. A Anthropic não divulgou os motivos específicos em detalhes, mas combinado com a melhoria geral na capacidade de raciocínio, é provável que esteja relacionado a uma melhor qualidade da cadeia de pensamento (chain-of-thought).
Dados de preferência do usuário
A Anthropic realizou uma série de testes internos do Claude Code, permitindo que desenvolvedores comparassem a qualidade da saída sem saber qual modelo estava por trás:
- Sonnet 4.6 vs Sonnet 4.5: 70% dos usuários escolheram Sonnet 4.6
- Sonnet 4.6 vs Opus 4.5: 59% dos usuários escolheram Sonnet 4.6
O segundo conjunto de dados é mais interessante. O Opus 4.5 é muito mais caro que o Sonnet 4.6, mas na avaliação subjetiva das saídas reais de programação, o Sonnet 4.6 foi mais popular. Os motivos citados incluem: seguimento de instruções mais preciso, menos alucinações e sem superengenharia (este é um problema de longa data da série Opus – ela tende a complicar requisitos simples).
Contexto de 1M não é chamariz
Desta vez, o Sonnet 4.6 também vem com uma janela de contexto de 1 milhão de tokens (versão beta), sem necessidade de cabeçalho adicional. Solicitações acima de 200k passam automaticamente por este canal e são cobradas pela tarifa padrão.
1 milhão de tokens equivale a quanto? Toda a base de código de uma empresa de médio porte, ou dezenas de artigos acadêmicos, podem ser colocados em uma única solicitação para processamento. Cenários que antes exigiam o particionamento RAG agora podem ser jogados diretamente para que o modelo encontre as correlações por conta própria.
Qual você deve escolher
Escolha Sonnet 4.6 se:
- Suas principais tarefas são escrever código, controlar navegadores, processar documentos longos
- Volume de consultas alto, sensível a preço
- Não precisa de raciocínio científico de nível de doutorado
Escolha Opus 4.6 se:
- Precisa de raciocínio científico intenso ou tarefas acadêmicas
- Necessidades de contexto extremamente complexas
- Não se importa com a diferença de preço, só quer o melhor resultado
Para a maioria dos desenvolvedores e empresas, o Sonnet 4.6 é atualmente a porta de entrada mais custo-benefício para o Claude. O Opus 4.6 custa US$ 15/US$ 75, o Sonnet 4.6 custa US$ 3/US$ 15 – mesma capacidade de programação com diferença de preço de 5 vezes. Essa conta não é difícil de fazer.
Fontes de referência: Introducing Claude Sonnet 4.6 (oficial da Anthropic); CocoLoop; Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide (NxCode); Claude Sonnet 4.6: 1M context and stronger computer use (Gend.co)