DeepSeek V4 se ejecuta en chip de Huawei

DeepSeek está a punto de lanzar V4, pero esta vez lo más destacable no es el tamaño de los parámetros del modelo, sino el chip en el que se ejecuta.

Según The Information, DeepSeek V4 se ejecutará en el chip Ascend 950PR de Huawei. Este es el primer modelo de IA de vanguardia construido específicamente para una arquitectura de chip nacional china.

Primero, el modelo en sí

Las especificaciones de V4 son impresionantes:

Parámetro Valor
Parámetros totales Aprox. 1 billón (arquitectura MoE)
Parámetros activados en inferencia Aprox. 37 mil millones
Ventana de contexto 1 millón de tokens
Puntuación SWE-bench 81%

La lógica de usar la arquitectura MoE es la misma que en V3: se almacenan 1 billón de parámetros, pero en cada inferencia solo se activan 37 mil millones. El costo operativo real se acerca más al de un modelo denso de 37 mil millones de parámetros, mientras que la capacidad puede alcanzar el nivel de un billón. El precio de la API después del entrenamiento es de 0,30 USD por millón de tokens, un orden de magnitud más barato que la serie GPT.

La multimodalidad también se ha integrado: V4 admite el procesamiento nativo de texto, imágenes y generación de video.

¿Por qué es importante el asunto del chip de Huawei?

Los modelos anteriores de DeepSeek, incluidos V3 y R1, se entrenaron en NVIDIA A100/H100 (o al menos usaron el ecosistema CUDA). V4 es el primer modelo construido desde cero sobre la arquitectura CANN de Huawei.

Especificaciones de hardware del Ascend 950PR:

  • Potencia de cómputo: FP8 1 PFLOPS / FP4 2 PFLOPS
  • Ancho de banda de interconexión: 2 TB/s
  • Proceso de fabricación: Proceso N+3 de SMIC (rendimiento cercano al nivel de 5nm)
  • Integrado en la tarjeta aceleradora Atlas 350 de Huawei

Para que V4 funcionara en este chip, DeepSeek, en colaboración con Huawei y Cambricon, reescribió una gran cantidad de código de bajo nivel, con el objetivo de sortear por completo el ecosistema CUDA de NVIDIA.

El análisis de TrendForce sugiere que, si tiene éxito, el pipeline de desarrollo de DeepSeek podría lograr una independencia sustancial de CUDA en uno o dos años.

Alibaba, ByteDance y Tencent están acaparando chips de Huawei

La reacción del mercado es directa: Alibaba, ByteDance y Tencent ya han realizado pedidos a Huawei por un total de cientos de miles de chips Ascend. La demanda se ha disparado y los precios de los chips de Huawei ya han aumentado aproximadamente un 20%.

Huawei planea producir alrededor de 600.000 chips Ascend 910C en 2026, el doble que en 2025, con una capacidad total de producción Ascend de 1,6 millones de chips.

Pensándolo de otra manera: si DeepSeek V4 funciona bien en el chip de Huawei, los fabricantes de IA nacionales tendrán un camino alternativo viable y realista, sin depender completamente de NVIDIA. Esto tiene un significado mayor para toda la cadena industrial que el propio V4.

Pero, ¿el chip de Huawei es realmente bueno?

Sinceramente, esto sigue siendo una incógnita.

Las cifras teóricas de potencia de cómputo del Ascend 950PR parecen buenas, pero la eficiencia real del entrenamiento distribuido y la inferencia, en comparación con el ecosistema H100 de NVIDIA, aún no cuenta con datos de validación a gran escala. V4-Lite se encuentra actualmente en pruebas internas en nodos de API; los desarrolladores informan de un aumento del 30% en la velocidad de inferencia y una mejora significativa en la recuperación de contexto, pero esto en un entorno especialmente optimizado.

La verdadera prueba es: después del lanzamiento de la versión oficial de V4, ¿será el rendimiento tan estable como se anuncia?

Si funciona, será una prueba real del camino de independencia del hardware de IA de China. Si no funciona bien, solo demuestra que la dirección de la independencia es correcta, pero el tiempo aún no es suficiente.

Se espera que la versión oficial de V4 se lance a mediados de abril. Esperemos los resultados.

Fuente de referencia: CocoLoop, DeepSeek's V4 model will run on Huawei chips, The Information reports (WHBL); Decoding DeepSeek V4: How Huawei's Ascend 950PR Is Powering China's Push to Break CUDA Dependence (TrendForce); DeepSeek V4 points to growing use of Huawei chips in AI models (TechWire Asia); DeepSeek V4 And Tencent's New Hunyuan Model To Launch In April (Dataconomy)