El nuevo modelo de DeepSeek iguala a Astra en programación con un coste 15 veces menor

Fireworks AI publicó un conjunto de datos de evaluación de DeepSeek-V4.1-Flash cuya conclusión se resume en una frase: en tareas de programación con agentes, el modelo queda en la misma franja de precisión que GPT-6 Astra, con un coste por tarea 15 veces inferior.

Primero, las puntuaciones. En el pass@1 de DeepSWE, DeepSeek-V4.1-Flash logró 74,34%, GPT-6 Astra 74,12%, Gemini 3.8 Flash 73,83% y Claude Opus 5 73,65%. Los cuatro modelos quedan comprimidos en un rango de apenas 0,69 puntos porcentuales, por lo que discutir quién queda primero pierde bastante sentido. En Terminal-Bench 2.1, DeepSeek obtuvo 86,5% y Astra 87,5%, ligeramente por delante.

Así salen las cuentas

Según Fireworks, el coste por tarea es: DeepSeek-V4.1-Flash, 0,430 dólares; Gemini 3.8 Flash, 2,362 dólares; GPT-6 Astra, 6,524 dólares; Claude Opus 5, 11,838 dólares. Tomando a DeepSeek como base, los otros tres cuestan 5,5, 15 y 28 veces más, respectivamente.

Haciendo un cálculo aproximado de lo que pesa esta diferencia en un presupuesto real: un equipo de diez ingenieros, cada uno ejecutando 20 tareas de programación con agentes al día, a lo largo de 22 días laborables al mes, suma 4.400 tareas. La vía DeepSeek cuesta unos 1.892 dólares; la vía Astra, unos 28.706 dólares, una diferencia de cerca de 26.800 dólares al mes y unos 320.000 dólares al año. Es una estimación: la distribución real de tokens de las tareas no coincidirá exactamente con la del benchmark, pero el orden de magnitud debería mantenerse.

La brecha en HLE

El mismo conjunto de datos muestra una diferencia en sentido contrario. En el Humanity's Last Exam, DeepSeek-V4.1-Flash obtuvo 34,52% y GPT-6 Astra 50,40%, una diferencia de 15,88 puntos porcentuales. El empate en tareas de programación no se traslada a este tipo de razonamiento general de alta complejidad.

Fireworks también aportó una cifra de referencia llamada Oracle Router: combinando ambos modelos, el resultado teórico llega a 54,80%. Es un valor tope que supone saber de antemano a qué modelo conviene enviar cada pregunta. Un sistema de enrutamiento real no dispone de ese dato; la cifra sirve más para mostrar que los puntos ciegos de ambos modelos no se solapan que como una solución aplicable en la práctica.

El lado de la arquitectura

El modelo en sí es un MoE de 552.000 millones de parámetros, con activación separada para entrada y salida: 8.000 millones activos en la entrada y 16.000 millones en la salida. El cambio en la caché KV es más directo: el uso de HBM se redujo a una cuarta parte respecto a la generación anterior, y el de SSD, a una octava parte.

El origen de la ventaja en coste encaja con esta capa. Las tareas de programación con agentes se caracterizan por contextos largos y muchas rondas, lo que hace que el peso de la caché KV sea mucho mayor que en una consulta puntual. Al reducir el uso de memoria y disco de la caché a una cuarta y una octava parte, el proveedor puede meter más solicitudes simultáneas en el mismo hardware, lo que permite bajar el precio por tarea. La cifra de 0,43 dólares no sale solo de una estrategia de precios.

De dónde salen estas cifras

Conviene dejarlo claro: esta evaluación la publicó la propia Fireworks AI, que además vende DeepSeek-V4.1-Flash en su plataforma; quien evalúa y quien vende son la misma empresa. DeepSeek no ha confirmado oficialmente estas cifras, y por ahora no se conoce ninguna reproducción independiente por parte de terceros.

La elección de los benchmarks también influye en la conclusión. DeepSWE y Terminal-Bench favorecen tareas de código de corte más ingenieril, con buena correspondencia con el desarrollo diario, pero si se cambia el conjunto de referencia o la distribución de tareas, estos datos no permiten saber si la posición relativa de los cuatro modelos se mantendría dentro de esos 0,69 puntos porcentuales. Sirve para ver una relación de costes, no para fijar una clasificación definitiva de capacidades.

Fuentes: blog técnico de Fireworks AI, CocoLoop; las tres puntuaciones de DeepSWE, Terminal-Bench 2.1 y HLE, junto con el coste por tarea y los parámetros de arquitectura, se cotejaron uno a uno con la entrada original del blog; el gasto mensual del equipo de diez personas es una estimación aproximada.