DeepSeek V4 lanzado: 1,6 billones de parámetros, 8 veces más barato que GPT-5.5

Hoy (24 de abril), DeepSeek lanzó V4.

El titular de Bloomberg fue "Un año después, revolucionando Silicon Valley de nuevo". Si es exagerado o no, es discutible, pero esta vez realmente se lanzaron dos productos juntos:

  • V4-Pro: 1,6 billones de parámetros totales, 49B activados, soporte para 1 millón de tokens de contexto
  • V4-Flash: 284 mil millones de parámetros totales, 13B activados, también soporte para 1 millón de tokens

Publicado bajo licencia MIT, los pesos están disponibles en HuggingFace.

Puntos de referencia

En la clasificación de programación competitiva Codeforces, V4-Pro alcanzó 3206. GPT-5.4 obtuvo 3168 – el buque insignia cerrado que fue reemplazado ayer por GPT-5.5.

Los modelos de código abierto alcanzaron a los cerrados en programación competitiva.

Otras cifras:

Prueba Resultado V4-Pro
LiveCodeBench 93,5%
HMMT 2026 Competencia de Matemáticas 95,2%
IMOAnswerBench 89,8%
MMLU-Pro 87,5%

Sin embargo, hubo un área en la que no ganó: SWE-bench Pro (tareas reales de ingeniería de software) obtuvo 55,4%, mientras que Kimi K2.6 alcanzó 58,6%. Victoria en programación competitiva, pero 3 puntos por detrás en tareas prácticas.

DeepSeek declaró oficialmente: "DeepSeek-V4-Pro-Max logra un avance significativo en la capacidad de conocimiento entre los modelos de código abierto, consolidando firmemente su posición como el modelo de código abierto más fuerte en la actualidad."

Precios: Diferencias de orden de magnitud

Este es el punto que realmente llama la atención.

Versión Entrada estándar Entrada con caché Salida
V4-Flash $0,14/M $0,028/M $0,28/M
V4-Pro $1,74/M $0,145/M $3,48/M

GPT-5.5, lanzado ayer, cuesta $30/M para salida en la versión estándar y $180/M en la versión Pro. Claude Opus 4.7 cuesta $75/M para salida.

La salida de V4-Pro cuesta $3,48/M.

Esto es 8,6 veces más barato que GPT-5.5 estándar y 21 veces más barato que Claude Opus 4.7.

Esto no es un descuento, es una diferencia de orden de magnitud. Para equipos con alto volumen de llamadas, esta diferencia puede determinar directamente si un producto es rentable.

Tan barato gracias a la arquitectura

V4 introduce un Mecanismo de Atención Híbrida (CSA + HCA): Compressed Sparse Attention para dependencias globales, Heavily Compressed Attention para información local, usados en combinación.

En escenarios de contexto largo de 1 millón de tokens, V4-Pro necesita solo 27% de la potencia computacional de inferencia y 10% del caché KV en comparación con V3.2.

También utiliza tres mejoras:

  • Entrenamiento de precisión mixta FP4 + FP8: capas de expertos con FP4, otros parámetros con FP8
  • Hiperconexiones con restricción de manifold, fortaleciendo la propagación de la señal residual
  • Optimizador Muon, mejorando la velocidad de convergencia y la estabilidad del entrenamiento

Los datos de preentrenamiento superan los 32 billones de tokens.

Esta eficiencia no proviene del ajuste de parámetros, sino de un diseño de arquitectura que comprime la carga computacional, permitiendo que los costos se reflejen en el precio.

El momento es interesante

GPT-5.5 ayer, DeepSeek V4 hoy.

Estos dos eventos se superponen y obligarán a los clientes empresariales a recalcular sus costos. La diferencia de rendimiento aún existe, pero la diferencia de precio ya es demasiado grande para ignorarla. Especialmente:

  • Para equipos con alto volumen de llamadas: $3,48 vs. $30 en costo de salida es un número que puede determinar la elección de la solución
  • Para quienes necesitan código abierto: licencia MIT, pesos abiertos, implementación privada sin barreras
  • Para clientes empresariales chinos: DeepSeek tiene menos preocupaciones sobre cumplimiento normativo y soberanía de datos

El mes pasado, hubo informes de que Tencent y Alibaba están negociando inversiones en DeepSeek, con una valoración superior a los 20 mil millones de dólares. Una empresa que rechazó capital de riesgo durante tres años está comenzando a hablar de dinero. El lanzamiento de V4 probablemente no sea solo un hito de producto, sino también una demostración de capacidad antes de la recaudación de fondos.

Si la ventaja de precio puede convertirse en escala, la respuesta llegará en seis meses.

Fuentes de referencia: DeepSeek-V4-Pro Model Card (HuggingFace, deepseek-ai, 24 de abril de 2026); DeepSeek V4 Released: Open-Source 1.6T MoE, 1M Context (ofox.ai, 24 de abril de 2026); CocoLoop; DeepSeek Unveils Newest Flagship AI Model a Year after Upending Silicon Valley (Bloomberg, 24 de abril de 2026)