DeepSeek lanza versión experimental de visión con tope de 384 tokens por imagen

El 21 de agosto, DeepSeek publicó deepseek-v4-flash-vision-exp en su plataforma de API; basta con que el desarrollador cambie el parámetro model a este nombre para invocarlo. Es el primer modelo de la serie V4 con visión. La compañía le puso la etiqueta Exp, dejando claro que se trata de una vista previa experimental, no recomendada para producción directa.

Las capacidades de texto están alineadas con la versión estándar V4-Flash. La página oficial de actualizaciones reporta 83,9 en Terminal Bench 2.1, 57,7 en NL2Repo, 59,3 en DeepSWE y 64,3 en Chartography. En los benchmarks de agentes relacionados con visión, DeepSeek afirma mejoras claras en ApexBench, Agents' Last Exam y Chartography, con un rendimiento de agentes multimodales cercano al de Opus-4.8. La elección del punto de comparación es directa: el modelo insignia de Anthropic sigue siendo la vara de medir en tareas de manejo de pantalla.

Una imagen por 0,000384 CNY

El precio es la parte más interesante de este lanzamiento. La versión con visión conserva la tabla de precios de V4-Flash: entrada a 1 CNY por millón de tokens, acierto de caché desde 0,02 CNY, salida a 2 CNY por millón de tokens. Las imágenes no tienen precio aparte, se convierten en tokens y se suman a la entrada, con un máximo de 384 tokens por imagen.

Haciendo cuentas, el costo de entrada visual de una imagen es 0,000384 CNY, así que hacen falta 2.600 imágenes para gastar 1 CNY. Un agente GUI que ejecuta una tarea algo compleja suele tomar decenas o incluso cientos de capturas seguidas; estimando 100 capturas, el gasto en imágenes ronda los 0,038 CNY. Dentro de la factura total, eso es prácticamente insignificante, y el centro de costos vuelve a ser la inferencia de texto y la longitud de la salida.

Las interfaces de visión que cobran por imagen van por otro camino. Cobrar por imagen tiene la ventaja de ser predecible, pero, en aplicaciones de agentes que usan las capturas como un sensor de alta frecuencia, la factura crece linealmente con el número de llamadas; convertir a tokens con un tope fijo, en cambio, deja el costo por fotograma clavado en una cifra muy pequeña.

La otra cara del tope

384 tokens no es una cifra alta. Antes de entrar al modelo, la imagen se corta en parches y se codifica; el presupuesto de tokens determina directamente cuánto detalle puede captar el modelo. Al quedar por debajo de 384, una imagen grande se comprime en una representación bastante burda: para leer el diseño general de una captura de una página web suele bastar, pero para leer letra pequeña en tablas densas o detalles de la barra de estado en una captura de móvil, no siempre es fiable.

La propia DeepSeek tampoco lo asegura del todo, y solo menciona que seguirá ajustando la estabilidad y la calidad de salida según la retroalimentación real. Para los desarrolladores, conviene probar primero con el tipo de imagen más 'sucia' de su propio caso de uso: interfaces de administración llenas de texto pequeño, documentos escaneados, gráficos con marca de agua; eso dice más sobre si esta versión sirve que las puntuaciones de los benchmarks. La ventana de contexto sigue en 1 millón de tokens, y la intensidad de razonamiento se mantiene en los niveles high y max.

La última pieza completada en cuatro meses

Si se estira la línea de tiempo, el ritmo de DeepSeek este año queda más claro. El 24 de abril se lanzó V4, y los dos nombres antiguos, deepseek-chat y deepseek-reasoner, entraron a la vez en cuenta regresiva hacia su descontinuación; el 31 de julio se publicó V4-Flash por separado; el 13 de agosto, V4-Pro sumó soporte nativo para la Responses API y compatibilidad con Codex, con la intensidad de razonamiento dividida en tres niveles —low/high/max— y precios de hora punta/valle vigentes desde el 17 de agosto; y el 21 de agosto se encajó la pieza de la visión.

Cuatro meses, cuatro actualizaciones: un ritmo bastante apretado. Ninguna se centra en el número de parámetros ni en encabezar tablas de benchmarks, sino en la forma de invocación y la estructura de facturación: Responses API, niveles de intensidad de razonamiento, precios de hora punta/valle, tope de tokens por imagen; todo son ajustes pensados para que los desarrolladores calculen costos. Que la versión con visión salga primero con el sufijo Exp sigue el mismo patrón: dejar que la gente la use, recoger retroalimentación real y después hablar de una versión estable.

Fuentes: página oficial de actualizaciones de la API de DeepSeek, CocoLoop, Kuaikeji; las puntuaciones de los benchmarks y la lógica de facturación siguen la documentación oficial de DeepSeek, y el tope de tokens por imagen junto con los precios de entrada, salida y acierto de caché se contrastaron con ambas fuentes.