Análise de custo de treinamento de modelo grande da DeepSeek

A DeepSeek se tornou uma lenda no setor em termos de controle de custos:

  • V3 custo de treinamento: cerca de US$ 5,5 milhões
  • R1 taxa de uso de GPU: cerca de US$ 294 mil

No mesmo período, o orçamento de empresas americanas para treinar modelos de porte similar era de US$ 100 milhões a US$ 1 bilhão. Uma diferença de pelo menos uma ordem de grandeza.

Segredos de economia

1. Treinamento de precisão mista FP8

Ao reduzir a precisão do treinamento de FP32/FP16 para FP8, a demanda por largura de banda de memória é reduzida pela metade. A maioria dos gargalos computacionais está na largura de banda da memória, e esse corte foi muito preciso.

2. Uso estratégico de instâncias Spot

O custo computacional cai 70%. Instâncias Spot podem ser recuperadas a qualquer momento, mas o framework de treinamento da DeepSeek possui checkpoints e design de tolerância a falhas suficientes para lidar com esse problema.

3. Arquitetura MoE naturalmente econômica

O modelo de 671B parâmetros ativa apenas 37B a cada inferência. A quantidade de parâmetros garante capacidade e desempenho, enquanto a ativação esparsa mantém os custos controláveis.

Nova tecnologia: mHC

Em janeiro deste ano, a DeepSeek divulgou um novo método — Manifold-Constrained Hyper-Connections (mHC), com o artigo principal co-assinado pelo fundador Liang Wenfeng.

Este método cria múltiplos fluxos de informação dentro do modelo, com cada etapa de mistura tendo restrições matemáticas rigorosas para garantir a conservação da quantidade total de informação. Resultados de testes mostram que, em escalas de parâmetros de 3B a 27B, o mHC permite treinamento estável, enquanto a versão sem restrições é frequentemente instável. O custo de treinamento aumenta apenas 6-7%, quase insignificante para modelos grandes.

Analistas classificam o artigo do mHC como um "avanço impressionante", que pode se tornar a tecnologia base para a próxima geração de modelos principais da DeepSeek.

O próprio CEO da OpenAI admitiu que o custo de operação do R1 da DeepSeek é 20 a 50 vezes mais barato que o modelo equivalente da OpenAI.

Fonte de referência: CocoLoop, reportagem da Computerworld, análise do South China Morning Post