DeepSeek在成本控制上的水準已經成了行業傳說級別的存在:
- V3訓練成本:約$550萬
- R1 GPU使用費:約$29.4萬
同期美國公司訓練類似規模模型的預算是$1億到$10億。差了至少一個數量級。
省錢秘訣
1. FP8混合精度訓練
把訓練精度從FP32/FP16降到FP8,顯存帶寬需求直接砍半。大部分算力瓶頸就卡在顯存帶寬上,這一刀砍得非常準。
2. 策略性使用Spot實例
算力成本打三折。Spot實例隨時可能被回收,但DeepSeek的訓練框架做了足夠的checkpoint和容錯設計來應對這個問題。
3. MoE架構天然省算力
671B參數的模型,每次推理只激活37B。參數量保證了容量和能力,稀疏激活保證了成本可控。
新技術:mHC
今年1月DeepSeek又公開了一個新方法——Manifold-Constrained Hyper-Connections(mHC),核心論文由創始人梁文鋒共同署名。
這個方法做的事情是:在模型內部創建多條信息流,每個混合步驟都有嚴格的數學約束保證總信息量守恆。測試結果顯示,在3B到27B參數規模上mHC都能穩定訓練,而不加約束的版本經常不穩定。訓練開銷只增加6-7%,對大模型來說幾乎可以忽略。
有分析師稱mHC論文是"驚人的突破",可能會成為DeepSeek下一代主力模型的基礎技術。
OpenAI的CEO自己都承認過:DeepSeek的R1運行成本比OpenAI的同級模型便宜20到50倍。
參考來源:CocoLoop、Computerworld報導、南華早報分析