DeepSeek ouvre l’API finale de V4-Flash

DeepSeek a ouvert le 31 juillet la bêta publique de l’API finale de V4-Flash. Les modèles web et mobile ne changent pas, pas plus que l’API V4-Pro. La mise à jour vise les interfaces développeur, les agents de code et les usages de Codex.

Le chiffre principal est 82,7 sur Terminal Bench 2.1. Le tableau officiel indique 61,8 pour V4-Flash Preview et 72,1 pour V4-Pro Preview. Le gain face à l’ancien Flash atteint 20,9 points, soit environ 33,8% en valeur relative.

Du post-entraînement sans agrandir le modèle

« DeepSeek-V4-Flash-0731 conserve la même architecture et la même taille que DeepSeek-V4-Flash-preview et a seulement reçu un nouveau post-entraînement. »

Le rapport technique et la fiche du modèle V4 décrivent 284 milliards de paramètres au total et 13 milliards de paramètres actifs par token, avec un contexte d’un million de tokens. DeepSeek attribue le progrès au post-entraînement, sans réseau plus grand.

Avec l’effort maximal et le mode minimal encore inédit de DeepSeek Harness, l’entreprise annonce 82,7 sur Terminal Bench 2.1, 54,2 sur NL2Repo, 76,7 sur CyberGym, 54,4 sur DeepSWE, 70,3 sur Toolathlon-Verified, 68,7 sur DSBench-FullStack et 59,6 sur DSBench-Hard.

Annonce des benchmarks de l’API finale DeepSeek V4-Flash
Annonce officielle et tableau comparatif de V4-Flash 0731.

Les conditions font partie du résultat. Les tâches publiques de Code Agent utilisent top_p=0.95, temperature=1.0 et l’effort maximal. Les deux DSBench sont internes. Le classement public de CyberGym n’affiche pas encore V4-Flash 0731 : 76,7 reste donc une mesure du fournisseur, sans reproduction indépendante.

CyberGym regroupe 1 507 vulnérabilités historiques provenant de 188 grands projets open source. Le test vérifie si un agent peut produire un PoC fonctionnel contre un dépôt non corrigé. Le framework et le nombre d’essais influencent le résultat ; la publication du harness sera le premier point de contrôle.

Le support de Codex commence par le protocole

V4-Flash accepte le format Responses API sur https://api.deepseek.com sous le nom deepseek-v4-flash. Les développeurs peuvent utiliser la forme client.responses.create() du SDK OpenAI et configurer Codex pour appeler DeepSeek.

L’API gère les function tools, la recherche web côté serveur, l’outil personnalisé apply_patch de Codex, le streaming SSE, reasoning effort et la sortie JSON.

La compatibilité du protocole ne couvre pas toute la plateforme Responses. previous_response_id, conversation, store, background et context management ne sont pas pris en charge. File search, code interpreter, computer use et MCP sont ignorés. L’API est sans état et le client doit renvoyer le contexte multitour.

Le prix reste inchangé

V4-Flash coûte 0,02 yuan par million de tokens d’entrée en cache, 1 yuan hors cache et 2 yuans en sortie. Il propose un contexte d’un million de tokens, jusqu’à 384 000 tokens de sortie et une limite de concurrence de 2 500 par compte. V4-Pro coûte 0,025, 3 et 6 yuans dans les mêmes catégories, avec une limite de 500.

Responses API ne prend actuellement en charge que V4-Flash ; V4-Pro est prévu début août. Les prochains contrôles portent sur la publication du harness, la reproduction indépendante de 82,7 et 76,7, ainsi que la consommation de tokens et le taux d’achèvement en conditions réelles.

Sources : journal des changements de l’API, documentation Responses API et tarifs de DeepSeek ; CocoLoop ; rapport technique V4 et fiche Hugging Face pour la structure 284B/13B, le contexte 1M et les références Preview ; site officiel CyberGym pour la définition du benchmark et l’état de la reproduction publique.