DeepSeek 即將發布 V4,但這次最值得關注的不是模型參數有多大,而是它跑在什麼晶片上。
根據《The Information》報導,DeepSeek V4 將運行在華為的 Ascend 950PR 晶片上。這是第一個專門為中國本土晶片架構構建的前沿 AI 模型。
先看模型本身
V4 的規格很猛:
| 參數 | 數值 |
|---|---|
| 總參數量 | 約 1 兆(MoE 架構) |
| 推理時激活參數 | 約 370 億 |
| 上下文窗口 | 100 萬 token |
| SWE-bench 得分 | 81% |
用 MoE 架構的邏輯跟 V3 一樣:1 兆參數存在那,每次推理只激活 370 億。實際運行成本更接近 370 億的密集模型,但能力可以摸到兆級參數的邊。訓練完成後的 API 定價是 0.30 美元/百萬 token,比 GPT 系列便宜一個數量級。
多模態也做出來了:V4 支援文字、圖片和影片生成的原生處理。
華為晶片這件事為什麼重要?
DeepSeek 之前的模型,包括 V3 和 R1,都是用 NVIDIA A100/H100 訓練的(或者至少用了 CUDA 生態)。V4 是第一次從頭到尾基於華為 CANN 架構來做。
Ascend 950PR 的硬體規格:
- 算力:FP8 1 PFLOPS / FP4 2 PFLOPS
- 互聯頻寬:2 TB/s
- 製造工藝:中芯國際 N+3 工藝(性能接近 5nm 級別)
- 搭載在華為 Atlas 350 加速卡上
DeepSeek 為了讓 V4 跑通這套晶片,跟華為和寒武紀聯合改寫了大量底層程式碼,目標是完全繞開 NVIDIA 的 CUDA 生態。
TrendForce 的分析認為,如果這次順利,DeepSeek 的開發管線在一到兩年內可以實現對 CUDA 的實質性獨立。
阿里、字節、騰訊都在搶華為晶片
市場的反應很直接:阿里巴巴、字節跳動、騰訊已經向華為下了合計 數十萬張 Ascend 晶片訂單。需求猛增,華為的晶片價格已經漲了約 20%。
華為計劃 2026 年生產約 60 萬張 Ascend 910C,比 2025 年翻倍,總 Ascend 產能達到 160 萬張。
換個角度想:如果 DeepSeek V4 在華為晶片上跑起來效果不錯,國內 AI 廠商就有了一個現實可行的替代路徑——不再完全依賴 NVIDIA。這對整個產業鏈的意義比 V4 本身還大。
但華為晶片到底行不行?
說實話,這還是個懸念。
Ascend 950PR 的理論算力數字看起來不錯,但實際分散式訓練和推理的效率,跟 NVIDIA H100 生態比起來還沒有大規模驗證數據。V4-Lite 目前在 API 節點上有內測,開發者反映推理速度提升了 30%,上下文召回也有明顯改善——但這是在專門優化過的環境裡。
真正的考驗在:V4 正式版上線後,性能表現會不會像宣傳的那樣穩定?
如果跑通了,這是中國 AI 硬體獨立路線的一個真實證明。如果跑不好,只能說明獨立的方向是對的,但時間還不夠。
預計 V4 正式版 4 月中旬發布,等著看結果。
參考來源:CocoLoop、DeepSeek's V4 model will run on Huawei chips, The Information reports(WHBL);Decoding DeepSeek V4: How Huawei's Ascend 950PR Is Powering China's Push to Break CUDA Dependence(TrendForce);DeepSeek V4 points to growing use of Huawei chips in AI models(TechWire Asia);DeepSeek V4 And Tencent's New Hunyuan Model To Launch In April(Dataconomy)