DeepSeek V4 僅發預覽版,等華為 950PR 量產

DeepSeek V4 只發了個預覽版。

很多人沒注意到這件事。4 月 24 日 DeepSeek 端出 V4 Flash 和 V4 Pro,但兩個都是預覽版。正式版要等到下半年——而且不是因為模型還沒準備好,是因為華為的晶片還沒量產到位

4 月 26 日 Bloomberg 援引央視旗下「玉淵潭天」帳號披露了內幕,把 DeepSeek 過去幾個月做的事說清楚了。

不是模型慢了,是晶片沒到

DeepSeek 團隊過去幾個月沒怎麼發新功能,做的是把整個訓練框架從 NVIDIA 遷到華為 Ascend

這事比發新模型難得多。CUDA 生態在 AI 圈子裡盤根錯節十幾年,把一個萬億參數模型的訓練流程從 CUDA 遷到華為的 CANN(Compute Architecture for Neural Networks),要重寫:

  • 算子庫(matmul、attention、layernorm 等等幾百個內核)
  • 分布式調度(NCCL 換成 HCCL)
  • 混合精度訓練(FP8、BF16 在新晶片上的行為)
  • 檢查點與容錯

這種遷移工作,不是半年能搞定的。DeepSeek 做完了,但硬體這頭還在等

Ascend 950PR 是什麼,為什麼非要等它

DeepSeek 自己坦白說了:V4 在 2026 上半年有「throughput issues」——意思是模型能跑,但跑得不夠快、不夠穩。

要等的,是華為的 Ascend 950PR supernodes 量產到規模。950PR 和 950DT 是華為今年年底前會出貨的下一代 AI 晶片,主打SuperNode 架構——把一堆晶片用高速互連堆成一個超級節點,性能向 NVIDIA NVLink 那個量級看齊。

只有 950PR 上規模,DeepSeek V4 正式版才能真正放出來跑全量 inference。所以你現在看到的 V4 Flash 和 V4 Pro 預覽版,本質上是為 950PR 做的產品宣發預熱——先把模型能力的故事講出去,等下半年硬體到位,立刻把正式版扔進市場。

華為方面也給了一個對應的承諾:完整 Ascend SuperNode 產品線對 DeepSeek V4 實現了「全適配」,inference 性能「顯著提升」。CANN 這套軟體棧在過去幾個月專門為 V4 做了適配。兩邊的協同節奏卡得很死。

中國 AI 的「雙軌敘事」,第一次被明牌

這件事最有趣的,不是技術細節,是敘事。

過去半年,中國 AI 圈有個心照不宣的雙軌:

  • 對外:開源模型卷價格、卷 benchmark、強調「獨立」
  • 對內:實際硬體和訓練資源還在 NVIDIA 上跑

DeepSeek 這次的做法,等於把雙軌合一。它把 V4 的發布節奏完全綁定到華為晶片產能上。這是過去任何一家中國 AI 公司都沒敢做過的事——風險擺在那:

  • 如果華為 950PR 量產延期,DeepSeek V4 正式版就跟著推遲
  • 如果 Ascend 的性能不及預期,DeepSeek 要承受「模型跑不動」的口碑代價
  • 如果有客戶要用 V4 正式版,他們必須接受「晶片綁定」

但收益也明確:中國 AI 從此有了不依賴 NVIDIA 的完整訓練-推理-部署閉環

一面鏡子的兩邊

這和 Anthropic 剛簽下 Google 400 億的故事,剛好是一面鏡子。

算力主權這件事,全球各家正在用不同的姿勢搶鎖——美國玩家靠蓋雲廠房、簽長期合約,中國玩家靠綁國產晶片、把發布節奏配合產能曲線,最終都是要把「我下半年能跑多少 tokens」這件事寫進資產負債表。

CCTV 系帳號這次主動揭底,時機也挺巧。下半年還沒到,市場預期已經被提前定好了——華為晶片量產順利,DeepSeek V4 成為標杆產品;不順利,整個國產 AI 敘事都要打個折扣。

賭局已經開了。下半年見結果。

參考來源:DeepSeek V4 Launch Postponed as Company Prioritizes Domestic Chip Integration(Bloomberg);CocoLoop、Huawei, DeepSeek strengthen China's AI self-reliance with collaboration on V4 model(South China Morning Post);DeepSeek delays V4 launch to tune for Huawei Ascend chips(Newsbytes)