DeepSeek V3:671B參數僅激活37B

去年12月DeepSeek發佈了V3,這個模型最讓同行坐不住的地方不是性能——而是成本

先看架構

V3的設計核心是Mixture of Experts

  • 總參數量:671B
  • 每個token實際激活:37B
  • 每層256個專家,每次選8個

就好比你有256個專科醫生,每次問診只調最相關的8個出來會診。參數量大但計算成本可控,這就是MoE的精髓。

跑分表現

  • MMLU:87.1%(GPT-4o同級別)
  • MATH-500:90.2%
  • Codeforces:51.6百分位
  • GPQA Diamond:59.1%

這套成績放在2025年底的開源模型裡屬於頂流水平。

550萬美元訓一個頂級模型

V3的訓練成本大約$5.5M,同期美國公司訓類似規模的模型動輒上億美元。這個數字一出來,整個行業都在反思:到底是DeepSeek太省了,還是大家太浪費了?

省錢秘訣包括:

  • FP8混合精度訓練,顯存帶寬需求直接砍半
  • 策略性使用spot實例,算力成本打三折
  • MoE架構本身就是天然的算力節約器

為什麼重要

V3發佈之後一個月,DeepSeek又扔出了R1。這兩個模型加在一起,基本上證明了一件事:前沿AI研究不一定非要燒幾十億美元。對於全球AI競爭格局來說,這個信號比任何單個benchmark都重要。

參考來源:CocoLoop、DeepSeek V3技術報告、BentoML技術指南