DeepSeek V3: 671B parâmetros, apenas 37B ativados

Em dezembro do ano passado, a DeepSeek lançou o V3. O que mais incomodou os concorrentes não foi o desempenho – mas o custo.

Arquitetura

O núcleo do design do V3 é Mixture of Experts:

  • Total de parâmetros: 671B
  • Parâmetros realmente ativados por token: 37B
  • 256 especialistas por camada, 8 selecionados por vez

É como ter 256 médicos especialistas, mas a cada consulta você convoca apenas os 8 mais relevantes. Muitos parâmetros, mas custo computacional controlado – essa é a essência do MoE.

Resultados de benchmarks

  • MMLU: 87,1% (nível GPT-4o)
  • MATH-500: 90,2%
  • Codeforces: percentil 51,6
  • GPQA Diamond: 59,1%

Esses resultados estão entre os melhores dos modelos de código aberto no final de 2025.

US$ 5,5 milhões para treinar um modelo de ponta

O custo de treinamento do V3 é de aproximadamente US$ 5,5 milhões. No mesmo período, empresas americanas gastavam centenas de milhões de dólares para treinar modelos de porte similar. Esse número fez toda a indústria refletir: a DeepSeek é muito econômica, ou todos os outros estão desperdiçando demais?

Os segredos da economia incluem:

  • Treinamento de precisão mista FP8, que reduz pela metade a demanda por largura de banda de memória
  • Uso estratégico de instâncias spot, custo computacional reduzido em 70%
  • A própria arquitetura MoE é um poupador natural de recursos computacionais

Por que isso importa

Um mês após o lançamento do V3, a DeepSeek lançou o R1. Juntos, esses dois modelos provam essencialmente uma coisa: pesquisa de ponta em IA não precisa necessariamente queimar bilhões de dólares. Para o cenário global de competição em IA, esse sinal é mais importante do que qualquer benchmark isolado.

Fonte de referência: CocoLoop, relatório técnico do DeepSeek V3, guia técnico do BentoML