DeepSeek abre la API final de V4-Flash

DeepSeek abrió el 31 de julio la beta pública de la API final de V4-Flash. Los modelos de la web y la aplicación no cambiaron, tampoco la API de V4-Pro. La actualización se concentra en interfaces para desarrolladores, agentes de código y flujos de Codex.

La cifra principal es 82,7 en Terminal Bench 2.1. La tabla oficial sitúa a V4-Flash Preview en 61,8 y a V4-Pro Preview en 72,1. Frente al Flash anterior, la mejora es de 20,9 puntos, aproximadamente un 33,8% en términos relativos.

Posentrenamiento sin ampliar el modelo

“DeepSeek-V4-Flash-0731 conserva la misma arquitectura y tamaño que DeepSeek-V4-Flash-preview y solo recibió un nuevo posentrenamiento.”

El informe técnico y la ficha del modelo V4 indican 284.000 millones de parámetros totales y 13.000 millones activos por token, con un contexto de un millón de tokens. DeepSeek atribuye el avance al posentrenamiento, no a una red mayor.

Con esfuerzo máximo y el modo mínimo aún no publicado de DeepSeek Harness, la empresa informa 82,7 en Terminal Bench 2.1, 54,2 en NL2Repo, 76,7 en CyberGym, 54,4 en DeepSWE, 70,3 en Toolathlon-Verified, 68,7 en DSBench-FullStack y 59,6 en DSBench-Hard.

Anuncio de benchmarks de la API final de DeepSeek V4-Flash
Anuncio oficial y tabla comparativa de V4-Flash 0731.

Las condiciones forman parte del resultado. Las tareas públicas de Code Agent usaron top_p=0.95, temperature=1.0 y esfuerzo máximo. Los dos DSBench son internos. La clasificación pública de CyberGym todavía no muestra V4-Flash 0731, por lo que 76,7 sigue siendo una cifra del proveedor sin reproducción independiente.

CyberGym reúne 1.507 vulnerabilidades históricas de 188 grandes proyectos de código abierto. Mide si un agente genera un PoC funcional contra una base de código sin parchear. El framework y el número de intentos influyen en el resultado; publicar el harness será el primer punto de verificación.

El soporte de Codex empieza por el protocolo

V4-Flash acepta el formato Responses API en https://api.deepseek.com bajo el nombre deepseek-v4-flash. Los desarrolladores pueden usar la forma client.responses.create() del OpenAI SDK y configurar Codex para llamar a DeepSeek.

La API admite function tools, web search en el servidor, la herramienta personalizada apply_patch de Codex, streaming SSE, reasoning effort y salida JSON.

La compatibilidad de protocolo no traslada toda la plataforma Responses. previous_response_id, conversation, store, background y context management no están disponibles. File search, code interpreter, computer use y MCP se ignoran. La API no guarda estado y el cliente debe reenviar el contexto de varios turnos.

El precio se mantiene

V4-Flash cuesta 0,02 yuanes por millón de tokens de entrada en caché, 1 yuan sin caché y 2 yuanes de salida. Ofrece un millón de tokens de contexto, hasta 384.000 tokens de salida y un límite de concurrencia de 2.500 por cuenta. V4-Pro cuesta 0,025, 3 y 6 yuanes en esas categorías, con límite de 500.

Responses API solo funciona con V4-Flash por ahora; V4-Pro está previsto para comienzos de agosto. Los próximos controles son la publicación del harness, la reproducción independiente de 82,7 y 76,7 y el consumo de tokens y tasa de finalización en tareas reales.

Fuentes: registro de cambios de la API, documentación de Responses API y precios de DeepSeek; CocoLoop; informe técnico de V4 y ficha de Hugging Face para la estructura 284B/13B, contexto de 1M y referencias Preview; sitio oficial de CyberGym para la definición de la prueba y el estado de reproducción pública.