DeepSeek V3.2 改為稀疏注意力,推理成本砍半

去年九月底,DeepSeek 悄悄放出了 V3.2,沒有大張旗鼓,但這個版本搞了一個挺有意思的架構變動。

V3.2 的核心改動不是參數規模,而是注意力機制。他們做了一個叫做 DeepSeek Sparse Attention(DSA) 的東西,把傳統的稠密注意力改成了稀疏版。

稀疏注意力到底省在哪裡

傳統注意力機制是 O(L²) 複雜度——序列長度翻倍,計算量翻四倍。當你的上下文視窗拉到 128K token 的時候,這個開銷就非常可觀了。

DSA 的做法是:

  • 先用 Lightning Indexer(FP8 精度)快速算出每個 query 和歷史 token 之間的相關性分數
  • 然後只選最相關的 Top-k 個 token 做注意力計算
  • 複雜度從 O(L²) 降到 O(Lk),k 是固定的一個較小的數

簡單說就是「不是每個詞都需要看所有其他詞,只看最重要的那些就夠了」。這個思路不新鮮,但 DeepSeek 把它跑通了而且上了生產。

效能:沒特別漲,也沒特別降

這裡要說實話:V3.2 的 benchmark 跟 V3.1 比,整體上差不多,不是「更強」的發布。

任務V3.2 結果
MMLU-Pro85.0
AIME 202589.3
Codeforces Rating2121(從 2046 提升)
GPQA/HLE 推理類略有下降

程式能力確實有提升,Codeforces 評分從 2046 漲到 2121,這個幅度不小。但推理類 benchmark 因為「生成的推理 token 減少了」而略有下降——這是稀疏注意力的代價之一,生成的思維鏈變短了。

所以 V3.2 是一個 效率換能力的 trade-off,而不是全面超越。

便宜才是賣點

價格:輸入 $0.28/M,輸出 $0.42/M

快取命中:$0.028/M,比快取未命中便宜 90%。

橫向對比:

模型輸入(/M)輸出(/M)
GPT-5$1.25$10
Claude Sonnet 4$3$15
DeepSeek V3.2$0.28$0.42

跟 GPT-5 相比,成本差距接近 5 倍。這不是效能最強的模型,但如果你的場景是大批量呼叫、成本敏感的應用,V3.2 的性價比確實沒什麼對手。

上下文視窗 128K token,權重在 Hugging Face 上,MIT 協議,商用自由。

架構細節

DSA 嵌在 Transformer 底座裡,運行於 MLA 的 MQA 模式之下。推理主要針對 H800 GPU 叢集最佳化,其他硬體的实际效果可能有出入,DeepSeek 說還在做更大範圍的驗證。

訓練階段做了統一的 GRPO 強化學習,把推理對齊、指令跟隨和 agent 任務揉到了一起訓。

怎麼看這件事

V3.2 不是「更聰明」的模型,是「更省」的模型。

稀疏注意力機制是一個工程上的取捨——用一點推理能力的損失來換取大量的計算成本節省,然後把這個節省直接反映到 API 價格上。

對應用開發者來說,這條路線比死磕 benchmark 更實用。不是每個場景都需要最強的模型,但每個創業公司都在乎 API 成本。

DeepSeek 在這件事上的思路跟 OpenAI 和 Anthropic 不一樣——後者更傾向於先發最強的,再慢慢最佳化成本。DeepSeek 是先把成本打下來,把用戶量拉上來,再在上面做差異化。

這個打法在中國科技行業見慣了,但在大模型領域能跑通,還是挺值得關注的。

參考來源:CocoLoop、DeepSeek V3.2-Exp Release: Pricing, API Costs, Context Window & Benchmarks(llm-stats.com);DeepSeek V3.2 Exp Model Specs, Costs & Benchmarks(Galaxy.ai);Top 10 Cheapest Providers for DeepSeek V3.2 in 2026(DEV Community)