DeepSeek V3.2 setzt auf Sparse Attention und halbiert Inferenzkosten

Ende September letzten Jahres veröffentlichte DeepSeek leise V3.2, ohne großes Aufheben, aber diese Version brachte eine recht interessante architektonische Änderung mit sich.

Die Kernänderung von V3.2 betrifft nicht die Parametergröße, sondern den Aufmerksamkeitsmechanismus. Sie entwickelten etwas namens DeepSeek Sparse Attention (DSA) und wandelten die traditionelle dichte Aufmerksamkeit in eine sparse Version um.

Wo Sparse Attention wirklich spart

Der traditionelle Aufmerksamkeitsmechanismus hat eine Komplexität von O(L²) – verdoppelt sich die Sequenzlänge, vervierfacht sich der Rechenaufwand. Wenn Ihr Kontextfenster auf 128K Token anwächst, werden diese Kosten sehr beträchtlich.

Die Funktionsweise von DSA:

  • Zunächst wird mit dem Lightning Indexer (FP8-Genauigkeit) schnell der Relevanz-Score zwischen jedem Query und den historischen Token berechnet
  • Dann werden nur die Top-k relevantesten Token für die Aufmerksamkeitsberechnung ausgewählt
  • Die Komplexität sinkt von O(L²) auf O(Lk), wobei k eine feste, kleine Zahl ist

Einfach ausgedrückt: "Nicht jedes Wort muss alle anderen Wörter sehen, es reicht, nur die wichtigsten zu betrachten." Diese Idee ist nicht neu, aber DeepSeek hat sie zum Laufen gebracht und in Produktion eingesetzt.

Leistung: Weder deutlich gestiegen noch deutlich gefallen

Um ehrlich zu sein: Die Benchmarks von V3.2 sind im Vergleich zu V3.1 insgesamt ähnlich, es ist keine Veröffentlichung, die "stärker" ist.

Aufgabe V3.2 Ergebnis
MMLU-Pro 85,0
AIME 2025 89,3
Codeforces Rating 2121 (gestiegen von 2046)
GPQA/HLE Reasoning Leicht gesunken

Die Programmierfähigkeit hat sich tatsächlich verbessert, die Codeforces-Bewertung stieg von 2046 auf 2121, ein beachtlicher Anstieg. Aber die Reasoning-Benchmarks sind aufgrund der "reduzierten Anzahl generierter Reasoning-Token" leicht gesunken – dies ist einer der Preise der sparsen Aufmerksamkeit, die generierte Gedankenkette wird kürzer.

V3.2 ist also ein Trade-off zwischen Effizienz und Fähigkeit, keine umfassende Überlegenheit.

Günstig ist das Verkaufsargument

Preis: Eingabe $0,28/M, Ausgabe $0,42/M.

Cache-Treffer: $0,028/M, 90 % günstiger als Cache-Fehlschläge.

Vergleich:

Modell Eingabe (/M) Ausgabe (/M)
GPT-5 $1,25 $10
Claude Sonnet 4 $3 $15
DeepSeek V3.2 $0,28 $0,42

Im Vergleich zu GPT-5 beträgt der Kostenunterschied fast das Fünffache. Dies ist nicht das leistungsstärkste Modell, aber wenn Ihr Szenario Anwendungen mit hohem Aufrufvolumen und Kostenempfindlichkeit sind, hat V3.2 in puncto Preis-Leistungs-Verhältnis wirklich keine Konkurrenz.

Kontextfenster 128K Token, Gewichte auf Hugging Face, MIT-Lizenz, kommerziell frei nutzbar.

Architekturdetails

DSA ist in die Transformer-Basis eingebettet und läuft im MQA-Modus von MLA. Die Inferenz ist hauptsächlich für H800 GPU-Cluster optimiert, die tatsächliche Leistung auf anderer Hardware kann abweichen, DeepSeek gibt an, dass noch umfangreichere Validierungen durchgeführt werden.

In der Trainingsphase wurde einheitliches GRPO Reinforcement Learning verwendet, das Reasoning-Ausrichtung, Instruktionsbefolgung und Agentenaufgaben in einem Training zusammenfasst.

Wie man das sieht

V3.2 ist kein "intelligenteres" Modell, sondern ein "sparsameres" Modell.

Der Sparse-Attention-Mechanismus ist ein technischer Kompromiss – ein kleiner Verlust an Reasoning-Fähigkeit wird gegen erhebliche Einsparungen bei den Rechenkosten eingetauscht, und diese Einsparungen werden direkt an die API-Preise weitergegeben.

Für Anwendungsentwickler ist dieser Weg praktischer, als sich in Benchmarks zu verzetteln. Nicht jedes Szenario benötigt das stärkste Modell, aber jedes Startup kümmert sich um API-Kosten.

DeepSeeks Ansatz unterscheidet sich hier von OpenAI und Anthropic – letztere neigen dazu, zuerst das Stärkste zu veröffentlichen und dann die Kosten langsam zu optimieren. DeepSeek senkt zuerst die Kosten, steigert die Nutzerzahlen und differenziert sich dann darauf aufbauend.

Diese Taktik ist in der chinesischen Technologiebranche alltäglich, aber dass sie im Bereich der großen Modelle funktioniert, ist dennoch beachtenswert.

Quellenangabe: CocoLoop, DeepSeek V3.2-Exp Release: Pricing, API Costs, Context Window & Benchmarks (llm-stats.com); DeepSeek V3.2 Exp Model Specs, Costs & Benchmarks (Galaxy.ai); Top 10 Cheapest Providers for DeepSeek V3.2 in 2026 (DEV Community)