A finales de septiembre del año pasado, DeepSeek lanzó silenciosamente V3.2, sin mucho alboroto, pero esta versión trajo un cambio arquitectónico bastante interesante.
El cambio central de V3.2 no está en la escala de parámetros, sino en el mecanismo de atención. Crearon algo llamado DeepSeek Sparse Attention (DSA), transformando la atención densa tradicional en una versión dispersa.
Dónde ahorra realmente la atención dispersa
El mecanismo de atención tradicional tiene una complejidad O(L²) — cuando la longitud de la secuencia se duplica, la carga computacional se cuadruplica. Cuando tu ventana de contexto alcanza los 128K tokens, este costo se vuelve muy significativo.
El funcionamiento de DSA:
- Primero, utiliza el Lightning Indexer (precisión FP8) para calcular rápidamente la puntuación de correlación entre cada query y los tokens históricos
- Luego, selecciona solo los Top-k tokens más relevantes para el cálculo de atención
- La complejidad se reduce de O(L²) a O(Lk), donde k es un número pequeño y fijo
En términos simples: "no todas las palabras necesitan ver todas las demás palabras, solo basta con ver las más importantes". Esta idea no es nueva, pero DeepSeek la implementó y la puso en producción.
Rendimiento: ni mucho mejor, ni mucho peor
Para ser honestos: los benchmarks de V3.2 en comparación con V3.1 son, en general, similares, no es un lanzamiento "más fuerte".
| Tarea | Resultado V3.2 |
|---|---|
| MMLU-Pro | 85,0 |
| AIME 2025 | 89,3 |
| Codeforces Rating | 2121 (aumento desde 2046) |
| GPQA/HLE razonamiento | Ligera disminución |
La capacidad de programación realmente mejoró, la puntuación de Codeforces subió de 2046 a 2121, un aumento considerable. Sin embargo, los benchmarks de razonamiento disminuyeron ligeramente debido a la "reducción de los tokens de razonamiento generados" — este es uno de los costos de la atención dispersa, la cadena de pensamiento generada se vuelve más corta.
Por lo tanto, V3.2 es un intercambio entre eficiencia y capacidad, no una superioridad integral.
Lo barato es el punto de venta
Precio: Entrada $0,28/M, Salida $0,42/M.
Acierto de caché: $0,028/M, 90% más barato que fallo de caché.
Comparación:
| Modelo | Entrada (/M) | Salida (/M) |
|---|---|---|
| GPT-5 | $1,25 | $10 |
| Claude Sonnet 4 | $3 | $15 |
| DeepSeek V3.2 | $0,28 | $0,42 |
En comparación con GPT-5, la diferencia de costo es de casi 5 veces. Este no es el modelo más potente en rendimiento, pero si tu escenario son aplicaciones con alto volumen de llamadas y sensibles al costo, la relación calidad-precio de V3.2 realmente no tiene competencia.
Ventana de contexto de 128K tokens, pesos en Hugging Face, licencia MIT, uso comercial libre.
Detalles de la arquitectura
DSA está integrado en la base del Transformer, funcionando bajo el modo MQA de MLA. La inferencia está optimizada principalmente para clústeres de GPU H800, el rendimiento real en otros hardware puede variar, DeepSeek afirma que todavía está realizando validaciones a mayor escala.
La fase de entrenamiento utilizó GRPO unificado de aprendizaje por refuerzo, combinando alineación de razonamiento, seguimiento de instrucciones y tareas de agente en un solo entrenamiento.
Cómo ver esto
V3.2 no es un modelo "más inteligente", es un modelo "más económico".
El mecanismo de atención dispersa es una compensación de ingeniería — sacrificar un poco de capacidad de razonamiento para obtener un ahorro sustancial de costos computacionales, y luego reflejar ese ahorro directamente en los precios de la API.
Para los desarrolladores de aplicaciones, este camino es más práctico que obsesionarse con los benchmarks. No todos los escenarios necesitan el modelo más potente, pero todas las startups se preocupan por los costos de API.
El enfoque de DeepSeek en este asunto es diferente al de OpenAI y Anthropic — estas últimas tienden a lanzar primero el modelo más potente y luego optimizar los costos gradualmente. DeepSeek primero reduce los costos, aumenta la base de usuarios y luego se diferencia sobre esa base.
Esta táctica es común en la industria tecnológica china, pero el hecho de que funcione en el campo de los modelos grandes sigue siendo digno de atención.
Fuentes de referencia: CocoLoop, DeepSeek V3.2-Exp Release: Pricing, API Costs, Context Window & Benchmarks (llm-stats.com); DeepSeek V3.2 Exp Model Specs, Costs & Benchmarks (Galaxy.ai); Top 10 Cheapest Providers for DeepSeek V3.2 in 2026 (DEV Community)