En diciembre del año pasado, DeepSeek lanzó V3. Lo que más inquietó a la competencia no fue el rendimiento, sino el costo.
Arquitectura
El núcleo del diseño de V3 es Mixture of Experts:
- Parámetros totales: 671B
- Parámetros realmente activados por token: 37B
- 256 expertos por capa, se seleccionan 8 cada vez
Es como tener 256 médicos especialistas, pero en cada consulta solo se convoca a los 8 más relevantes. Muchos parámetros, pero costo computacional controlado: esa es la esencia de MoE.
Resultados en benchmarks
- MMLU: 87,1 % (nivel GPT-4o)
- MATH-500: 90,2 %
- Codeforces: percentil 51,6
- GPQA Diamond: 59,1 %
Estos resultados se encuentran entre los mejores de los modelos de código abierto a finales de 2025.
5,5 millones de dólares para entrenar un modelo de primer nivel
El costo de entrenamiento de V3 es de aproximadamente 5,5 millones de dólares. En el mismo período, las empresas estadounidenses gastaban cientos de millones de dólares para entrenar modelos de escala similar. Esta cifra hizo que toda la industria reflexionara: ¿DeepSeek es demasiado austero, o todos los demás están derrochando?
Los secretos del ahorro incluyen:
- Entrenamiento de precisión mixta FP8, que reduce a la mitad la demanda de ancho de banda de memoria
- Uso estratégico de instancias spot, costo computacional reducido en un 70 %
- La propia arquitectura MoE es un ahorrador natural de recursos computacionales
Por qué es importante
Un mes después del lanzamiento de V3, DeepSeek lanzó R1. Juntos, estos dos modelos demuestran esencialmente una cosa: la investigación de vanguardia en IA no tiene por qué quemar miles de millones de dólares. Para el panorama global de la competencia en IA, esta señal es más importante que cualquier benchmark individual.
Fuente de referencia: CocoLoop, informe técnico de DeepSeek V3, guía técnica de BentoML