DeepSeek V4 發佈,1.6 萬億參數比 GPT-5.5 便宜 8 倍

今天(4 月 24 日),DeepSeek 發佈了 V4。

Bloomberg 的標題是「一年後再次顛覆矽谷」。有沒有這麼誇張暫且不說,但這次確實是兩件事一起發:

  • V4-Pro:1.6 萬億總參數,激活 49B,支援 100 萬 token 上下文
  • V4-Flash:2840 億總參數,激活 13B,同樣支援 100 萬 token

MIT 協議開源,權重直接上了 HuggingFace。

先看跑分

競技編程 Codeforces 評分,V4-Pro 跑出了 3206。GPT-5.4 的成績是 3168——就是昨天剛被 GPT-5.5 接替的那個閉源旗艦。

開源模型在競技編程上追上了。

其他數字:

基準測試 V4-Pro 成績
LiveCodeBench 93.5%
HMMT 2026 數學競賽 95.2%
IMOAnswerBench 89.8%
MMLU-Pro 87.5%

但有一項沒贏:SWE-bench Pro(軟體工程實際任務)是 55.4%,Kimi K2.6 是 58.6%。競技編程贏了,工程實戰差了 3 個百分點。

DeepSeek 官方的說法是:「DeepSeek-V4-Pro-Max 在開源模型中取得知識能力的顯著突破,穩固確立了當今最強開源模型的地位。」

定價:數量級的差距

這才是讓人坐不住的地方。

版本 標準輸入 快取命中輸入 輸出
V4-Flash $0.14/M $0.028/M $0.28/M
V4-Pro $1.74/M $0.145/M $3.48/M

昨天 GPT-5.5 發佈,標準版輸出 $30/M,Pro 版 $180/M。Claude Opus 4.7 輸出 $75/M。

V4-Pro 輸出 $3.48/M

比 GPT-5.5 標準版便宜 8.6 倍,比 Claude Opus 4.7 便宜 21 倍。

這不是價格優惠,是數量級差距。對調用量大的團隊來說,這個差距可以直接影響產品能不能盈利。

能這麼便宜,是因為架構

V4 引入了 混合注意力機制(CSA + HCA):Compressed Sparse Attention 處理全局依賴,Heavily Compressed Attention 處理局部資訊,組合使用。

在 100 萬 token 長上下文場景下,V4-Pro 只需要 V3.2 的 27% 推理算力10% 的 KV 快取

同時用了三項改進:

  • FP4 + FP8 混合精度訓練,專家層用 FP4,其他參數用 FP8
  • Manifold-Constrained 超連接,強化殘差訊號傳播
  • Muon 優化器,提升收斂速度和訓練穩定性

預訓練數據超過 32T tokens。

這種效率不是靠調參做出來的,是架構設計上壓縮了計算量,成本才能傳導到定價。

時間節點很有意思

GPT-5.5 昨天發,DeepSeek V4 今天發。

兩件事疊在一起,會迫使企業用戶重新算帳。性能差距還在,但價格差距已經大到需要認真對待了。特別是:

  • 對調用量大的團隊:$3.48 vs $30 的輸出成本,是能決定方案選型的數字
  • 對開源有需求的:MIT 協議,權重公開,私有部署沒障礙
  • 對中國企業用戶:DeepSeek 在合規、數據主權方面的顧慮更少

上個月有消息說騰訊、阿里在談向 DeepSeek 投資,估值超過 200 億美元。一家拒絕 VC 三年的公司開始談錢了,V4 的發佈大概不只是產品里程碑,也是融資前的證明力動作。

接下來能不能把價格優勢轉化成規模,六個月後會有答案。

參考來源:DeepSeek-V4-Pro Model Card(HuggingFace,deepseek-ai,2026 年 4 月 24 日);DeepSeek V4 Released: Open-Source 1.6T MoE, 1M Context(ofox.ai,2026 年 4 月 24 日);CocoLoop、DeepSeek Unveils Newest Flagship AI Model a Year after Upending Silicon Valley(Bloomberg,2026 年 4 月 24 日)