DeepSeek hat am 10. September offiziell DeepSeek-V4.1-Flash veröffentlicht. Der Modellname auf API-Seite lautet deepseek-flash, und am selben Tag um 12:00 Uhr mittags wechselte auch die Preisliste der Flash-Reihe auf eine neue Stufe. Die zwei Tage zuvor veröffentlichte Test-ID deepseek-v4.1-flash-expires-on-0910 lief entsprechend dem im Namen enthaltenen Datum ab.
Offiziell wird diese Version als "das kleinste Modell der komplett neuen Modellstruktur-Serie" positioniert, mit nativem multimodalem Bildverständnis. Die alten Modellnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp verschwinden nicht sofort, sondern werden vorübergehend auf V4.1 Flash umgeleitet - Aufrufer bekommen die neue Version, ohne ihren Code ändern zu müssen.
Wie die neue Preisliste aussieht
Laut offizieller Preisseite hat deepseek-flash eine Kontextlänge von 1 Million Token und eine maximale Ausgabe von 384.000 Token. Der Offpeak-Preis pro Million Token gliedert sich in drei Stufen: 0,02 Yuan bei Cache-Treffer, 1 Yuan bei Cache-Fehlschlag, 4 Yuan für die Ausgabe; zu Spitzenzeiten verdoppeln sich alle drei Werte auf 0,04, 2 und 8 Yuan.
Die Spitzenzeiten folgen dem Schema, das DeepSeek seit Juli verwendet: Peking-Zeit Montag bis Freitag 9:00-12:00 Uhr und 14:00-18:00 Uhr, zusammen sieben Stunden; die restliche Zeit gilt als Offpeak. Diese Einteilung orientiert sich an chinesischen Arbeitszeiten, sodass Aufrufer in anderen Zeitzonen im Schnitt einen niedrigeren Durchschnittspreis erhalten als Teams in China.
Das Unternehmen bezeichnet diese Änderung als "Senkung". Öffentlichen Berichten zufolge war der Offpeak-Cache-Treffer-Preis von Flash nach der Spitzen-/Offpeak-Preisanpassung im August zeitweise auf 0,05 Yuan gestiegen; die offizielle Preisseite zeigt jedoch nur den aktuell gültigen Preis und keine Historie, sodass sich diese Angabe nicht direkt anhand der offiziellen Seite überprüfen lässt. Gesichert sind lediglich die aktuellen Zahlen - und eine weitere Folge davon.
Für den Namen "Pro" gibt es vorübergehend kein passendes Modell
Ab 12:00 Uhr am 14. September werden alle an deepseek-v4-pro gerichteten Anfragen vollständig zu V4.1 Flash umgeleitet und nach dessen Tarif abgerechnet. Auf der Preisseite verweist deepseek-v4-pro weiterhin auf DeepSeek-V4-Pro-0813, dessen Offpeak-Werte bei 0,15, 4,5 und 13,5 Yuan liegen, die Spitzenwerte bei 0,30, 9 und 27 Yuan.
Stellt man beide Zahlenreihen nebeneinander, fällt bei gleichbleibendem Modellnamen der Ausgabepreis von 13,5 auf 4 Yuan, der Eingabepreis bei Cache-Fehlschlag von 4,5 auf 1 Yuan. Für Teams, die deepseek-v4-pro fest in ihrer Konfiguration verankert haben, sinkt die Rechnung ab Montag von selbst - nur steckt dahinter inzwischen ein anderes Modell.
Was die offizielle Ankündigung nicht verrät, ist der Zeitplan für V4.1 Pro. Die Formulierung der Routing-Regel lautet "bevor V4.1 Pro startet" - das legt eine Reihenfolge fest, aber kein Datum. Die Pro-Linie befindet sich damit in einer Lücke: Das alte Pro nimmt keine Anfragen mehr an, das neue Pro hat noch kein Veröffentlichungsfenster, und dazwischen springt ein Modell in Flash-Größe ein. Wie lange diese Lücke andauert, lässt sich derzeit nicht sagen.
Struktur und Benchmarks
Die Strukturdetails stammen aus der offiziellen Ankündigung: 552 Milliarden Parameter, eine Causal-Encoder-Decoder-Struktur, mit einer Aktivierung von 8 Milliarden bei der Eingabe und 16 Milliarden bei der Ausgabe. Dieser Aktivierungsanteil ist im Verhältnis zu den 552 Milliarden Gesamtparametern sehr gering - und genau das ist die Voraussetzung dafür, dass das Modell in die Flash-Stufe passt.
Die in der offiziellen Dokumentation genannten Benchmark-Werte: GPQA Diamond 90,9, HLE 36,8, Codeforces Rating 3471, MathArena Apex 65,6. Diese Werte lagen bisher im Bereich der Pro-Stufe und tauchen jetzt beim kleinsten Modell auf - aus Sicht der Produktpalette erklärt das, warum das Unternehmen es wagt, den Pro-Datenverkehr direkt umzuleiten.
Die Stationen der Flash-Linie im Überblick
Mitte Juli kam die offizielle V4-Version, gleichzeitig startete die Spitzen-/Offpeak-Abrechnung nach Zeit - damit bekam die Flash-Reihe erstmals zwei getrennte Preissätze für Offpeak und Spitzenzeiten. Um den 13. August herum folgte eine Preisanpassung. Am Abend des 8. September wurde eine Zwischenversion mit einer Gültigkeit von unter 48 Stunden und einem Limit von 20 gleichzeitigen Anfragen pro Konto zum Test geöffnet, deren Ablaufdatum direkt im Modellnamen stand. Am 10. September kamen die offizielle Version und die neue Preisliste gemeinsam, die Umleitung von Pro wurde vier Tage später angesetzt.
Fünf Schritte in zwei Monaten - ein dichteres Tempo als je zuvor bei dieser Produktlinie. Ob die neue Struktur die tatsächliche Last der Pro-Anfragen verkraftet, werden die Aufrufer nach Montag als Erste beantworten.
Quellen: DeepSeek-API-Dokumentations-Änderungsprotokoll, CocoLoop, DeepSeek-Modell- und Preisseite; die Preisseite wurde auf die einzelnen Tarife, Kontextlänge und Definition der Spitzenzeiten für deepseek-flash und deepseek-v4-pro geprüft.