DeepSeek V4 roda em chip da Huawei

DeepSeek está prestes a lançar o V4, mas desta vez o mais notável não é o tamanho dos parâmetros do modelo, e sim o chip em que ele roda.

De acordo com o The Information, o DeepSeek V4 rodará no chip Ascend 950PR da Huawei. Este é o primeiro modelo de IA de ponta construído especificamente para uma arquitetura de chip doméstica chinesa.

Primeiro, o modelo em si

As especificações do V4 são impressionantes:

Parâmetro Valor
Total de parâmetros Cerca de 1 trilhão (arquitetura MoE)
Parâmetros ativados na inferência Cerca de 37 bilhões
Janela de contexto 1 milhão de tokens
Pontuação SWE-bench 81%

A lógica do uso da arquitetura MoE é a mesma do V3: 1 trilhão de parâmetros é armazenado, mas a cada inferência apenas 37 bilhões são ativados. O custo operacional real é mais próximo de um modelo denso de 37 bilhões de parâmetros, enquanto a capacidade pode alcançar a marca de 1 trilhão. O preço da API após o treinamento é de US$ 0,30 por milhão de tokens, uma ordem de grandeza mais barato que a série GPT.

A multimodalidade também foi incorporada: o V4 suporta processamento nativo de texto, imagem e geração de vídeo.

Por que a questão do chip da Huawei é importante?

Os modelos anteriores do DeepSeek, incluindo V3 e R1, foram treinados em NVIDIA A100/H100 (ou pelo menos usaram o ecossistema CUDA). O V4 é o primeiro modelo construído do zero com base na arquitetura CANN da Huawei.

Especificações de hardware do Ascend 950PR:

  • Potência de computação: FP8 1 PFLOPS / FP4 2 PFLOPS
  • Largura de banda de interconexão: 2 TB/s
  • Processo de fabricação: Processo N+3 da SMIC (desempenho próximo ao nível de 5nm)
  • Integrado na placa aceleradora Atlas 350 da Huawei

Para que o V4 funcionasse neste chip, a DeepSeek, em colaboração com a Huawei e a Cambricon, reescreveu uma grande quantidade de código de baixo nível, com o objetivo de contornar completamente o ecossistema CUDA da NVIDIA.

A análise da TrendForce acredita que, se for bem-sucedido, o pipeline de desenvolvimento da DeepSeek poderá alcançar independência substancial do CUDA em um a dois anos.

Alibaba, ByteDance e Tencent estão todos disputando chips da Huawei

A reação do mercado é direta: Alibaba, ByteDance e Tencent já fizeram pedidos à Huawei totalizando centenas de milhares de chips Ascend. A demanda disparou e os preços dos chips da Huawei já subiram cerca de 20%.

A Huawei planeja produzir cerca de 600.000 chips Ascend 910C em 2026, o dobro de 2025, com uma capacidade total de produção Ascend de 1,6 milhão de chips.

Pensando de outra forma: se o DeepSeek V4 funcionar bem no chip da Huawei, os fabricantes de IA domésticos terão um caminho alternativo viável e realista – não mais dependendo inteiramente da NVIDIA. Isso tem um significado maior para toda a cadeia industrial do que o próprio V4.

Mas o chip da Huawei é realmente bom?

Sinceramente, isso ainda é uma incógnita.

Os números teóricos de potência de computação do Ascend 950PR parecem bons, mas a eficiência real do treinamento distribuído e da inferência, em comparação com o ecossistema H100 da NVIDIA, ainda não possui dados de validação em larga escala. O V4-Lite está atualmente em teste interno em nós de API; os desenvolvedores relatam um aumento de 30% na velocidade de inferência e uma melhoria significativa na recuperação de contexto – mas isso em um ambiente especialmente otimizado.

O verdadeiro teste é: após o lançamento da versão oficial do V4, o desempenho será tão estável quanto o anunciado?

Se funcionar, esta será uma prova real do caminho da independência de hardware de IA da China. Se não funcionar bem, apenas mostra que a direção da independência está correta, mas o tempo ainda não é suficiente.

A versão oficial do V4 está prevista para meados de abril. Vamos aguardar os resultados.

Fonte de referência: CocoLoop, DeepSeek's V4 model will run on Huawei chips, The Information reports (WHBL); Decoding DeepSeek V4: How Huawei's Ascend 950PR Is Powering China's Push to Break CUDA Dependence (TrendForce); DeepSeek V4 points to growing use of Huawei chips in AI models (TechWire Asia); DeepSeek V4 And Tencent's New Hunyuan Model To Launch In April (Dataconomy)