今天(4 月 24 日),DeepSeek 發佈了 V4。
Bloomberg 的標題是「一年後再次顛覆矽谷」。有沒有這麼誇張暫且不說,但這次確實是兩件事一起發:
- V4-Pro:1.6 萬億總參數,激活 49B,支援 100 萬 token 上下文
- V4-Flash:2840 億總參數,激活 13B,同樣支援 100 萬 token
MIT 協議開源,權重直接上了 HuggingFace。
先看跑分
競技編程 Codeforces 評分,V4-Pro 跑出了 3206。GPT-5.4 的成績是 3168——就是昨天剛被 GPT-5.5 接替的那個閉源旗艦。
開源模型在競技編程上追上了。
其他數字:
| 基準測試 | V4-Pro 成績 |
|---|---|
| LiveCodeBench | 93.5% |
| HMMT 2026 數學競賽 | 95.2% |
| IMOAnswerBench | 89.8% |
| MMLU-Pro | 87.5% |
但有一項沒贏:SWE-bench Pro(軟體工程實際任務)是 55.4%,Kimi K2.6 是 58.6%。競技編程贏了,工程實戰差了 3 個百分點。
DeepSeek 官方的說法是:「DeepSeek-V4-Pro-Max 在開源模型中取得知識能力的顯著突破,穩固確立了當今最強開源模型的地位。」
定價:數量級的差距
這才是讓人坐不住的地方。
| 版本 | 標準輸入 | 快取命中輸入 | 輸出 |
|---|---|---|---|
| V4-Flash | $0.14/M | $0.028/M | $0.28/M |
| V4-Pro | $1.74/M | $0.145/M | $3.48/M |
昨天 GPT-5.5 發佈,標準版輸出 $30/M,Pro 版 $180/M。Claude Opus 4.7 輸出 $75/M。
V4-Pro 輸出 $3.48/M。
比 GPT-5.5 標準版便宜 8.6 倍,比 Claude Opus 4.7 便宜 21 倍。
這不是價格優惠,是數量級差距。對調用量大的團隊來說,這個差距可以直接影響產品能不能盈利。
能這麼便宜,是因為架構
V4 引入了 混合注意力機制(CSA + HCA):Compressed Sparse Attention 處理全局依賴,Heavily Compressed Attention 處理局部資訊,組合使用。
在 100 萬 token 長上下文場景下,V4-Pro 只需要 V3.2 的 27% 推理算力和 10% 的 KV 快取。
同時用了三項改進:
- FP4 + FP8 混合精度訓練,專家層用 FP4,其他參數用 FP8
- Manifold-Constrained 超連接,強化殘差訊號傳播
- Muon 優化器,提升收斂速度和訓練穩定性
預訓練數據超過 32T tokens。
這種效率不是靠調參做出來的,是架構設計上壓縮了計算量,成本才能傳導到定價。
時間節點很有意思
GPT-5.5 昨天發,DeepSeek V4 今天發。
兩件事疊在一起,會迫使企業用戶重新算帳。性能差距還在,但價格差距已經大到需要認真對待了。特別是:
- 對調用量大的團隊:$3.48 vs $30 的輸出成本,是能決定方案選型的數字
- 對開源有需求的:MIT 協議,權重公開,私有部署沒障礙
- 對中國企業用戶:DeepSeek 在合規、數據主權方面的顧慮更少
上個月有消息說騰訊、阿里在談向 DeepSeek 投資,估值超過 200 億美元。一家拒絕 VC 三年的公司開始談錢了,V4 的發佈大概不只是產品里程碑,也是融資前的證明力動作。
接下來能不能把價格優勢轉化成規模,六個月後會有答案。
參考來源:DeepSeek-V4-Pro Model Card(HuggingFace,deepseek-ai,2026 年 4 月 24 日);DeepSeek V4 Released: Open-Source 1.6T MoE, 1M Context(ofox.ai,2026 年 4 月 24 日);CocoLoop、DeepSeek Unveils Newest Flagship AI Model a Year after Upending Silicon Valley(Bloomberg,2026 年 4 月 24 日)