DeepSeek V4 veröffentlicht: 1,6 Billionen Parameter, 8-mal günstiger als GPT-5.5

Heute (24. April) hat DeepSeek V4 veröffentlicht.

Die Bloomberg-Überschrift lautete "Ein Jahr später erneute Erschütterung des Silicon Valley". Ob das übertrieben ist, sei dahingestellt, aber diesmal wurden tatsächlich zwei Produkte gleichzeitig vorgestellt:

  • V4-Pro: 1,6 Billionen Gesamtparameter, 49B aktiviert, 1 Million Token Kontext
  • V4-Flash: 284 Milliarden Gesamtparameter, 13B aktiviert, ebenfalls 1 Million Token Kontext

Veröffentlicht unter der MIT-Lizenz, die Gewichte sind direkt auf HuggingFace verfügbar.

Benchmarks

Im Competitive Programming Codeforces-Ranking erreichte V4-Pro 3206. GPT-5.4 erzielte 3168 – das geschlossene Flaggschiff, das gestern gerade von GPT-5.5 abgelöst wurde.

Open-Source-Modelle haben im Competitive Programming aufgeholt.

Weitere Zahlen:

Benchmark V4-Pro Ergebnis
LiveCodeBench 93,5 %
HMMT 2026 Mathematik-Wettbewerb 95,2 %
IMOAnswerBench 89,8 %
MMLU-Pro 87,5 %

Allerdings gab es einen Bereich, in dem V4-Pro nicht gewann: SWE-bench Pro (praktische Softwareentwicklungsaufgaben) erreichte 55,4 %, während Kimi K2.6 bei 58,6 % lag. Sieg im Competitive Programming, aber 3 Punkte Rückstand bei praktischen Aufgaben.

DeepSeek erklärte offiziell: "DeepSeek-V4-Pro-Max erzielt einen bedeutenden Durchbruch bei den Wissensfähigkeiten in Open-Source-Modellen und festigt seine Position als das derzeit stärkste Open-Source-Modell."

Preisgestaltung: Größenordnungsunterschiede

Das ist der Punkt, der wirklich Aufmerksamkeit erregt.

Version Standard-Eingabe Cache-Treffer-Eingabe Ausgabe
V4-Flash 0,14 $/Mio. 0,028 $/Mio. 0,28 $/Mio.
V4-Pro 1,74 $/Mio. 0,145 $/Mio. 3,48 $/Mio.

GPT-5.5, gestern veröffentlicht, kostet in der Standardversion 30 $/Mio. für die Ausgabe, in der Pro-Version 180 $/Mio. Claude Opus 4.7 kostet 75 $/Mio. für die Ausgabe.

V4-Pro kostet 3,48 $/Mio. für die Ausgabe.

Das ist 8,6-mal günstiger als GPT-5.5 Standard und 21-mal günstiger als Claude Opus 4.7.

Das ist kein Preisnachlass, sondern ein Unterschied in der Größenordnung. Für Teams mit hohem API-Volumen kann diese Differenz direkt darüber entscheiden, ob ein Produkt profitabel ist.

So günstig dank der Architektur

V4 führt einen Hybrid Attention Mechanismus (CSA + HCA) ein: Compressed Sparse Attention für globale Abhängigkeiten, Heavily Compressed Attention für lokale Informationen, kombiniert eingesetzt.

Bei langen Kontexten von 1 Million Token benötigt V4-Pro nur 27 % der Inferenzrechenleistung und 10 % des KV-Cache im Vergleich zu V3.2.

Gleichzeitig kommen drei Verbesserungen zum Einsatz:

  • FP4 + FP8 Mixed-Precision-Training: Expertenlayer mit FP4, andere Parameter mit FP8
  • Manifold-constrained Hyperconnections zur Verstärkung der Residuumsignalausbreitung
  • Muon-Optimierer für verbesserte Konvergenzgeschwindigkeit und Trainingsstabilität

Die Vortrainingsdaten umfassen über 32 Billionen Token.

Diese Effizienz entsteht nicht durch Parameter-Tuning, sondern durch eine Architektur, die den Rechenaufwand komprimiert, sodass die Kosten an die Preisgestaltung weitergegeben werden können.

Der Zeitpunkt ist bemerkenswert

GPT-5.5 kam gestern, DeepSeek V4 heute.

Diese beiden Ereignisse überlagern sich und zwingen Unternehmenskunden, ihre Kalkulationen zu überdenken. Der Leistungsunterschied besteht noch, aber der Preisunterschied ist bereits so groß, dass er ernst genommen werden muss. Insbesondere:

  • Für Teams mit hohem API-Volumen: 3,48 $ vs. 30 $ Ausgabekosten sind eine Zahl, die die Entscheidung für eine Lösung bestimmen kann
  • Für Open-Source-Bedarf: MIT-Lizenz, offene Gewichte, keine Hürden für private Bereitstellung
  • Für chinesische Unternehmenskunden: DeepSeek hat weniger Bedenken hinsichtlich Compliance und Datensouveränität

Letzten Monat gab es Berichte, dass Tencent und Alibaba über Investitionen in DeepSeek verhandeln, mit einer Bewertung von über 20 Milliarden US-Dollar. Ein Unternehmen, das drei Jahre lang VC-Gelder abgelehnt hat, beginnt über Geld zu sprechen. Die Veröffentlichung von V4 ist wahrscheinlich nicht nur ein Produktmeilenstein, sondern auch ein Beweis für die Leistungsfähigkeit vor der Finanzierungsrunde.

Ob der Preisvorteil in Skalierung umgewandelt werden kann, wird sich in sechs Monaten zeigen.

Quellenangabe: DeepSeek-V4-Pro Model Card (HuggingFace, deepseek-ai, 24. April 2026); DeepSeek V4 Released: Open-Source 1.6T MoE, 1M Context (ofox.ai, 24. April 2026); CocoLoop; DeepSeek Unveils Newest Flagship AI Model a Year after Upending Silicon Valley (Bloomberg, 24. April 2026)