DeepSeek hat am 31. Juli die öffentliche Beta der finalen V4-Flash-API gestartet. Web- und App-Modell bleiben unverändert, ebenso die V4-Pro-API. Das Update richtet sich an Entwicklerschnittstellen, Coding-Agenten und Codex-Abläufe.
Die auffälligste Zahl ist 82,7 in Terminal Bench 2.1. DeepSeeks Vergleich nennt 61,8 für V4-Flash Preview und 72,1 für V4-Pro Preview. Gegenüber der früheren Flash-Version entspricht das 20,9 Punkten absolut oder rund 33,8 Prozent relativ.
Post-Training statt eines größeren Modells
„DeepSeek-V4-Flash-0731 behält Architektur und Größe von DeepSeek-V4-Flash-preview bei und wurde lediglich erneut nachtrainiert.“
Technischer Bericht und Model Card nennen 284 Milliarden Gesamtparameter und 13 Milliarden aktive Parameter je Token sowie ein Kontextfenster von einer Million Token. DeepSeek führt den Zuwachs auf das Post-Training zurück, nicht auf ein größeres Netz.
Mit maximalem Reasoning-Aufwand und dem unveröffentlichten Minimalmodus des DeepSeek Harness meldet das Unternehmen 82,7 in Terminal Bench 2.1, 54,2 in NL2Repo, 76,7 in CyberGym, 54,4 in DeepSWE, 70,3 in Toolathlon-Verified, 68,7 in DSBench-FullStack und 59,6 in DSBench-Hard.

Die Testbedingungen gehören zur Aussage. Öffentliche Code-Agent-Aufgaben liefen mit top_p=0.95, temperature=1.0 und maximalem Aufwand. Beide DSBench-Werte stammen aus internen Tests. Auf der öffentlichen CyberGym-Rangliste fehlt V4-Flash 0731 bislang, daher ist 76,7 ein Herstellerwert und kein unabhängig reproduziertes Ranglistenergebnis.
CyberGym umfasst 1.507 historische Schwachstellen aus 188 großen Open-Source-Projekten. Gemessen wird, ob ein Agent für ungepatchten Code einen funktionierenden Proof of Concept erzeugt. Agenten-Framework und Zahl der Versuche beeinflussen das Resultat, weshalb die Veröffentlichung des DeepSeek Harness der erste Prüfpunkt ist.
Codex-Unterstützung beginnt beim Protokoll
V4-Flash akzeptiert das Responses-API-Format unter https://api.deepseek.com mit dem Modellnamen deepseek-v4-flash. Entwickler können die Form client.responses.create() des OpenAI SDK und eine Codex-Konfiguration verwenden.
Unterstützt werden Function Tools, serverseitige Websuche, das Codex-Werkzeug apply_patch, SSE-Streaming, Reasoning-Aufwand und JSON-Ausgabe.
Protokollkompatibilität umfasst nicht die gesamte Responses-Plattform. previous_response_id, Conversation, Store, Background und Context Management fehlen. File Search, Code Interpreter, Computer Use und MCP werden ignoriert. Die API ist zustandslos; mehrstufiger Kontext muss erneut gesendet werden.
Der Preis bleibt niedrig
V4-Flash kostet pro Million Token 0,02 Yuan für Cache-Treffer beim Input, 1 Yuan für ungecachten Input und 2 Yuan für Output. Angegeben sind eine Million Kontext-Token, bis zu 384.000 Output-Token und 2.500 gleichzeitige Anfragen pro Konto. V4-Pro kostet in denselben Kategorien 0,025, 3 und 6 Yuan bei einer Grenze von 500.
Die Responses API unterstützt derzeit nur V4-Flash; V4-Pro soll Anfang August folgen. Die nächsten Prüfpunkte sind das öffentliche Harness, unabhängige Reproduktionen von 82,7 und 76,7 sowie Token-Verbrauch und Abschlussquote in realen Aufgaben.
Quellen: DeepSeek API-Changelog, Responses-API- und Preisdokumentation; CocoLoop; technischer DeepSeek-V4-Bericht und Hugging-Face-Model-Card für 284B/13B, 1M Kontext und Preview-Basiswerte; offizielle CyberGym-Seite für Benchmark-Definition und öffentlichen Reproduktionsstatus.