El 10 de septiembre, DeepSeek lanzó oficialmente DeepSeek-V4.1-Flash. El nombre del modelo en la API es deepseek-flash, y ese mismo día, a las 12:00 del mediodía, la tarifa de la línea Flash también pasó a un nuevo nivel. El ID de prueba interna publicado dos días antes, deepseek-v4.1-flash-expires-on-0910, caducó según la fecha incluida en su propio nombre.
Oficialmente, esta versión se presenta como "el modelo más pequeño de una serie de arquitectura completamente nueva", con comprensión visual multimodal nativa. Los nombres de modelo antiguos deepseek-v4-flash y deepseek-v4-flash-vision-exp no desaparecerán de inmediato: se redirigen temporalmente a V4.1 Flash, de modo que quien los llama obtiene la nueva versión sin cambiar su código.
Cómo queda la nueva tabla de precios
Según la página oficial de precios, deepseek-flash tiene una longitud de contexto de 1 millón de tokens y una salida máxima de 384.000 tokens. El precio en horario valle por millón de tokens se divide en tres niveles: 0,02 yuanes por acierto de caché en la entrada, 1 yuan por fallo de caché, 4 yuanes en la salida; en horario punta, los tres valores se duplican, hasta 0,04, 2 y 8 yuanes.
La definición del horario punta sigue el esquema que DeepSeek usa desde julio: de lunes a viernes, hora de Pekín, de 9:00 a 12:00 y de 14:00 a 18:00, siete horas en total; el resto se cuenta como horario valle. Ese reparto sigue el horario laboral de China continental, así que quienes llaman a la API desde otras zonas horarias terminan con un precio medio efectivo más bajo que los equipos locales.
La empresa llama a este cambio una "rebaja". Según informes públicos, tras el ajuste de precios punta/valle de agosto, el precio de acierto de caché en horario valle de Flash llegó a subir a 0,05 yuanes en algún momento; pero la página oficial de precios solo muestra el valor vigente, sin conservar historial, así que este dato no se puede verificar directamente ahí. Lo que sí se confirma son las cifras actuales, y otra consecuencia que traen consigo.
El nombre "Pro" se queda temporalmente sin modelo propio
A partir de las 12:00 del 14 de septiembre, todas las peticiones enviadas a deepseek-v4-pro se redirigirán por completo a V4.1 Flash, facturadas al precio de Flash. En la página de precios, deepseek-v4-pro sigue apuntando a DeepSeek-V4-Pro-0813, cuyos tres valores en horario valle son 0,15, 4,5 y 13,5 yuanes, y en horario punta, 0,30, 9 y 27 yuanes.
Al poner ambos conjuntos uno junto al otro: bajo el mismo nombre de modelo, el precio de salida cae de 13,5 a 4 yuanes, y el de entrada con fallo de caché cae de 4,5 a 1 yuan. Para los equipos que tienen deepseek-v4-pro fijado en su configuración, la factura bajará sola después del lunes, pero el modelo detrás de ese nombre habrá cambiado.
El anuncio oficial no detalla el calendario de V4.1 Pro. La regla de redirección solo dice "antes de que se lance V4.1 Pro", lo que fija un orden, no una fecha. En otras palabras, la línea Pro está ahora en un vacío: el Pro antiguo ha dejado de aceptar peticiones, el nuevo Pro aún no tiene ventana de lanzamiento, y en medio queda un modelo del tamaño de Flash sosteniendo el puesto. Cuánto durará ese vacío no se puede confirmar por ahora.
Arquitectura y benchmarks
Los detalles de la arquitectura proceden del anuncio oficial: 552.000 millones de parámetros, con una estructura Causal-Encoder-Decoder, y una activación de 8.000 millones en la entrada y 16.000 millones en la salida. Esa proporción de activación es muy baja respecto al total de 552.000 millones de parámetros, y es precisamente esa condición la que permite que el modelo entre en el nivel Flash.
En los benchmarks recogidos en la documentación oficial: GPQA Diamond 90,9, HLE 36,8, Codeforces Rating 3471, MathArena Apex 65,6. Esas puntuaciones antes eran propias del nivel Pro, y ahora aparecen en el modelo más pequeño; desde el punto de vista del catálogo de productos, esto explica por qué la empresa se atreve a redirigir directamente el tráfico de Pro.
Uniendo los hitos de la línea Flash
A mediados de julio llegó la versión oficial de V4, junto con la facturación por horario punta/valle, y fue entonces cuando la línea Flash obtuvo por primera vez dos tarifas separadas, valle y punta. Hacia el 13 de agosto hubo una ronda de ajuste de precios. La noche del 8 de septiembre se abrió a pruebas internas una versión intermedia, válida por menos de 48 horas y con un límite de 20 conexiones simultáneas por cuenta, cuyo nombre de modelo llevaba escrita directamente la fecha de caducidad. El 10 de septiembre llegaron juntas la versión oficial y la nueva tarifa, con el cambio de ruta de Pro fijado para cuatro días después.
Cinco movimientos en dos meses, un ritmo más intenso que en cualquier etapa anterior de esta línea. Si la nueva arquitectura aguanta la carga real que hoy corresponde a Pro es algo que quienes llaman a la API empezarán a responder después del lunes.
Fuentes: registro de actualizaciones de la documentación de la API de DeepSeek, CocoLoop, página de modelos y precios de DeepSeek; se verificó en la página de precios cada tarifa, la longitud de contexto y la definición de horario punta de deepseek-flash y deepseek-v4-pro.