去年12月DeepSeek發佈了V3,這個模型最讓同行坐不住的地方不是性能——而是成本。
先看架構
V3的設計核心是Mixture of Experts:
- 總參數量:671B
- 每個token實際激活:37B
- 每層256個專家,每次選8個
就好比你有256個專科醫生,每次問診只調最相關的8個出來會診。參數量大但計算成本可控,這就是MoE的精髓。
跑分表現
- MMLU:87.1%(GPT-4o同級別)
- MATH-500:90.2%
- Codeforces:51.6百分位
- GPQA Diamond:59.1%
這套成績放在2025年底的開源模型裡屬於頂流水平。
550萬美元訓一個頂級模型
V3的訓練成本大約$5.5M,同期美國公司訓類似規模的模型動輒上億美元。這個數字一出來,整個行業都在反思:到底是DeepSeek太省了,還是大家太浪費了?
省錢秘訣包括:
- FP8混合精度訓練,顯存帶寬需求直接砍半
- 策略性使用spot實例,算力成本打三折
- MoE架構本身就是天然的算力節約器
為什麼重要
V3發佈之後一個月,DeepSeek又扔出了R1。這兩個模型加在一起,基本上證明了一件事:前沿AI研究不一定非要燒幾十億美元。對於全球AI競爭格局來說,這個信號比任何單個benchmark都重要。
參考來源:CocoLoop、DeepSeek V3技術報告、BentoML技術指南