DeepSeek V3.2 adota atenção esparsa e reduz custos de inferência pela metade

No final de setembro do ano passado, a DeepSeek lançou silenciosamente o V3.2, sem grande alarde, mas esta versão trouxe uma mudança arquitetônica bastante interessante.

A alteração central do V3.2 não está na escala de parâmetros, mas no mecanismo de atenção. Eles criaram algo chamado DeepSeek Sparse Attention (DSA), transformando a atenção densa tradicional em uma versão esparsa.

Onde a atenção esparsa realmente economiza

O mecanismo de atenção tradicional tem complexidade O(L²) — quando o comprimento da sequência dobra, a carga computacional quadruplica. Quando sua janela de contexto chega a 128K tokens, esse custo se torna muito significativo.

O funcionamento do DSA:

  • Primeiro, usa o Lightning Indexer (precisão FP8) para calcular rapidamente a pontuação de correlação entre cada query e os tokens históricos
  • Em seguida, seleciona apenas os Top-k tokens mais relevantes para o cálculo da atenção
  • A complexidade cai de O(L²) para O(Lk), onde k é um número pequeno e fixo

Simplificando: "nem toda palavra precisa ver todas as outras palavras, basta ver apenas as mais importantes". Essa ideia não é nova, mas a DeepSeek a implementou e colocou em produção.

Desempenho: nem muito melhor, nem muito pior

Para ser honesto: os benchmarks do V3.2 em comparação com o V3.1 são, no geral, semelhantes, não é um lançamento "mais forte".

Tarefa Resultado V3.2
MMLU-Pro 85,0
AIME 2025 89,3
Codeforces Rating 2121 (aumento de 2046)
GPQA/HLE raciocínio Ligeira queda

A capacidade de programação realmente melhorou, a pontuação no Codeforces subiu de 2046 para 2121, um aumento considerável. No entanto, os benchmarks de raciocínio caíram ligeiramente devido à "redução dos tokens de raciocínio gerados" — este é um dos custos da atenção esparsa, a cadeia de pensamento gerada fica mais curta.

Portanto, o V3.2 é uma troca entre eficiência e capacidade, não uma superioridade abrangente.

O barato é o ponto de venda

Preço: Entrada $0,28/M, Saída $0,42/M.

Cache hit: $0,028/M, 90% mais barato que cache miss.

Comparação:

Modelo Entrada (/M) Saída (/M)
GPT-5 $1,25 $10
Claude Sonnet 4 $3 $15
DeepSeek V3.2 $0,28 $0,42

Em comparação com o GPT-5, a diferença de custo é de quase 5 vezes. Este não é o modelo mais poderoso em desempenho, mas se seu cenário envolve aplicações com alto volume de chamadas e sensibilidade a custos, a relação custo-benefício do V3.2 realmente não tem concorrentes.

Janela de contexto de 128K tokens, pesos no Hugging Face, licença MIT, uso comercial livre.

Detalhes da arquitetura

O DSA está embutido na base do Transformer, operando sob o modo MQA do MLA. A inferência é otimizada principalmente para clusters de GPU H800, o desempenho real em outros hardwares pode variar, a DeepSeek afirma que ainda está realizando validações em maior escala.

A fase de treinamento usou GRPO unificado de aprendizado por reforço, combinando alinhamento de raciocínio, seguimento de instruções e tarefas de agente em um único treinamento.

Como ver isso

O V3.2 não é um modelo "mais inteligente", é um modelo "mais econômico".

O mecanismo de atenção esparsa é uma compensação de engenharia — sacrificar um pouco da capacidade de raciocínio para obter uma economia substancial de custos computacionais, e então refletir essa economia diretamente nos preços da API.

Para desenvolvedores de aplicações, esse caminho é mais prático do que se preocupar apenas com benchmarks. Nem todo cenário precisa do modelo mais forte, mas toda startup se preocupa com os custos de API.

A abordagem da DeepSeek nessa questão é diferente da OpenAI e da Anthropic — estas últimas tendem a lançar primeiro o modelo mais forte e depois otimizar os custos gradualmente. A DeepSeek primeiro reduz os custos, aumenta a base de usuários e depois se diferencia com base nisso.

Essa tática é comum na indústria de tecnologia chinesa, mas o fato de funcionar no campo dos grandes modelos ainda é digno de atenção.

Fontes de referência: CocoLoop, DeepSeek V3.2-Exp Release: Pricing, API Costs, Context Window & Benchmarks (llm-stats.com); DeepSeek V3.2 Exp Model Specs, Costs & Benchmarks (Galaxy.ai); Top 10 Cheapest Providers for DeepSeek V3.2 in 2026 (DEV Community)