DeepSeek V4 Pro ist in eine konkretere API-Phase gerückt. Am 13. August führte die Preisseite deepseek-v4-pro als DeepSeek-V4-Pro-0813, während die OpenAI-kompatible und Anthropic-kompatible Anbindung unverändert bleibt.
Die Tabelle nennt 1M Token Kontext, maximal 384K Token Ausgabe, JSON Output, Tool Calls, Responses API und Anthropic API. Das Parallelitätslimit für Pro liegt bei 500, bei Flash dagegen bei 2500.
Lange Ausgabe ist eine Kostenfrage
“We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.”
Diese Warnung macht die Änderung operativ relevant. 384K Ausgabe kann bei großen Codebasen, Dokumentenprüfungen, Migrationsplänen und Agent-Workflows helfen, vergrößert aber den abrechenbaren Output.
Pro kostet dreimal so viel wie Flash
In der chinesischen Preistabelle kostet V4 Pro pro 1M Tokens RMB 0,025 für Cache-Hit-Eingabe, RMB 3 für Cache-Miss-Eingabe und RMB 6 für Ausgabe. V4 Flash liegt bei RMB 0,02, RMB 1 und RMB 2.
Hugging Face und OpenRouter beschreiben V4 Pro als MoE-Modell mit 1,6T Gesamtparametern, 49B aktiven Parametern und 1M Token Kontext. Es ist damit ein High-End-Tier, aber kein sinnvoller Standard für kurze Routineaufgaben.
Entscheidend werden ein eigener V4-Pro-0813-Bericht, unabhängige Benchmarks getrennt von Preview und Flash 0731 sowie die Frage, ob DeepSeek nach der Preiserhöhung seinen Kostenvorteil im Long-Context-Bereich hält.
Quellen: DeepSeek API Modell- und Preisdokumentation, DeepSeek API Changelog, Chao News, Hugging Face DeepSeek-V4-Pro Modellkarte, CocoLoop, OpenRouter; geprüft wurden DeepSeek-V4-Pro-0813, 1M Kontext, 384K maximale Ausgabe, RMB- und USD-Preise, Parallelitätslimits, V4-Flash-Vergleichspreise, 1,6T Gesamtparameter und 49B aktive Parameter.