去年九月底,DeepSeek 悄悄放出了 V3.2,沒有大張旗鼓,但這個版本搞了一個挺有意思的架構變動。
V3.2 的核心改動不是參數規模,而是注意力機制。他們做了一個叫做 DeepSeek Sparse Attention(DSA) 的東西,把傳統的稠密注意力改成了稀疏版。
稀疏注意力到底省在哪裡
傳統注意力機制是 O(L²) 複雜度——序列長度翻倍,計算量翻四倍。當你的上下文視窗拉到 128K token 的時候,這個開銷就非常可觀了。
DSA 的做法是:
- 先用 Lightning Indexer(FP8 精度)快速算出每個 query 和歷史 token 之間的相關性分數
- 然後只選最相關的 Top-k 個 token 做注意力計算
- 複雜度從 O(L²) 降到 O(Lk),k 是固定的一個較小的數
簡單說就是「不是每個詞都需要看所有其他詞,只看最重要的那些就夠了」。這個思路不新鮮,但 DeepSeek 把它跑通了而且上了生產。
效能:沒特別漲,也沒特別降
這裡要說實話:V3.2 的 benchmark 跟 V3.1 比,整體上差不多,不是「更強」的發布。
| 任務 | V3.2 結果 |
|---|---|
| MMLU-Pro | 85.0 |
| AIME 2025 | 89.3 |
| Codeforces Rating | 2121(從 2046 提升) |
| GPQA/HLE 推理類 | 略有下降 |
程式能力確實有提升,Codeforces 評分從 2046 漲到 2121,這個幅度不小。但推理類 benchmark 因為「生成的推理 token 減少了」而略有下降——這是稀疏注意力的代價之一,生成的思維鏈變短了。
所以 V3.2 是一個 效率換能力的 trade-off,而不是全面超越。
便宜才是賣點
價格:輸入 $0.28/M,輸出 $0.42/M。
快取命中:$0.028/M,比快取未命中便宜 90%。
橫向對比:
| 模型 | 輸入(/M) | 輸出(/M) |
|---|---|---|
| GPT-5 | $1.25 | $10 |
| Claude Sonnet 4 | $3 | $15 |
| DeepSeek V3.2 | $0.28 | $0.42 |
跟 GPT-5 相比,成本差距接近 5 倍。這不是效能最強的模型,但如果你的場景是大批量呼叫、成本敏感的應用,V3.2 的性價比確實沒什麼對手。
上下文視窗 128K token,權重在 Hugging Face 上,MIT 協議,商用自由。
架構細節
DSA 嵌在 Transformer 底座裡,運行於 MLA 的 MQA 模式之下。推理主要針對 H800 GPU 叢集最佳化,其他硬體的实际效果可能有出入,DeepSeek 說還在做更大範圍的驗證。
訓練階段做了統一的 GRPO 強化學習,把推理對齊、指令跟隨和 agent 任務揉到了一起訓。
怎麼看這件事
V3.2 不是「更聰明」的模型,是「更省」的模型。
稀疏注意力機制是一個工程上的取捨——用一點推理能力的損失來換取大量的計算成本節省,然後把這個節省直接反映到 API 價格上。
對應用開發者來說,這條路線比死磕 benchmark 更實用。不是每個場景都需要最強的模型,但每個創業公司都在乎 API 成本。
DeepSeek 在這件事上的思路跟 OpenAI 和 Anthropic 不一樣——後者更傾向於先發最強的,再慢慢最佳化成本。DeepSeek 是先把成本打下來,把用戶量拉上來,再在上面做差異化。
這個打法在中國科技行業見慣了,但在大模型領域能跑通,還是挺值得關注的。
參考來源:CocoLoop、DeepSeek V3.2-Exp Release: Pricing, API Costs, Context Window & Benchmarks(llm-stats.com);DeepSeek V3.2 Exp Model Specs, Costs & Benchmarks(Galaxy.ai);Top 10 Cheapest Providers for DeepSeek V3.2 in 2026(DEV Community)