Análisis del coste de entrenamiento de modelos grandes de DeepSeek

DeepSeek se ha convertido en una leyenda del sector en cuanto a control de costes:

  • V3 coste de entrenamiento: aproximadamente 5,5 millones de dólares
  • R1 tarifa de uso de GPU: aproximadamente 294.000 dólares

En el mismo periodo, los presupuestos de las empresas estadounidenses para entrenar modelos de escala similar oscilaban entre 100 millones y 1.000 millones de dólares. Una diferencia de al menos un orden de magnitud.

Trucos de ahorro

1. Entrenamiento de precisión mixta FP8

Al reducir la precisión del entrenamiento de FP32/FP16 a FP8, la demanda de ancho de banda de memoria se reduce a la mitad. La mayoría de los cuellos de botella computacionales están en el ancho de banda de la memoria, y este recorte fue muy preciso.

2. Uso estratégico de instancias Spot

El coste computacional se reduce un 70%. Las instancias Spot pueden ser recuperadas en cualquier momento, pero el framework de entrenamiento de DeepSeek cuenta con suficientes puntos de control y diseño de tolerancia a fallos para manejar este problema.

3. La arquitectura MoE ahorra potencia de cálculo de forma natural

El modelo de 671B parámetros activa solo 37B en cada inferencia. La cantidad de parámetros garantiza capacidad y rendimiento, mientras que la activación dispersa mantiene los costes controlables.

Nueva tecnología: mHC

En enero de este año, DeepSeek publicó un nuevo método — Manifold-Constrained Hyper-Connections (mHC), cuyo artículo principal fue cofirmado por el fundador Liang Wenfeng.

Este método crea múltiples flujos de información dentro del modelo, con cada paso de mezcla sujeto a estrictas restricciones matemáticas para garantizar la conservación de la cantidad total de información. Los resultados de las pruebas muestran que, en escalas de parámetros de 3B a 27B, mHC permite un entrenamiento estable, mientras que la versión sin restricciones suele ser inestable. El coste de entrenamiento aumenta solo un 6-7%, casi insignificante para modelos grandes.

Algunos analistas califican el artículo de mHC como un "avance sorprendente", que podría convertirse en la tecnología base para la próxima generación de modelos principales de DeepSeek.

El propio CEO de OpenAI admitió que el coste de operación del R1 de DeepSeek es 20 a 50 veces más barato que el modelo equivalente de OpenAI.

Fuente de referencia: CocoLoop, informe de Computerworld, análisis de South China Morning Post