DeepSeek低成本訓練大模型解析

DeepSeek在成本控制上的水準已經成了行業傳說級別的存在:

  • V3訓練成本:約$550萬
  • R1 GPU使用費:約$29.4萬

同期美國公司訓練類似規模模型的預算是$1億到$10億。差了至少一個數量級。

省錢秘訣

1. FP8混合精度訓練

把訓練精度從FP32/FP16降到FP8,顯存帶寬需求直接砍半。大部分算力瓶頸就卡在顯存帶寬上,這一刀砍得非常準。

2. 策略性使用Spot實例

算力成本打三折。Spot實例隨時可能被回收,但DeepSeek的訓練框架做了足夠的checkpoint和容錯設計來應對這個問題。

3. MoE架構天然省算力

671B參數的模型,每次推理只激活37B。參數量保證了容量和能力,稀疏激活保證了成本可控。

新技術:mHC

今年1月DeepSeek又公開了一個新方法——Manifold-Constrained Hyper-Connections(mHC),核心論文由創始人梁文鋒共同署名。

這個方法做的事情是:在模型內部創建多條信息流,每個混合步驟都有嚴格的數學約束保證總信息量守恆。測試結果顯示,在3B到27B參數規模上mHC都能穩定訓練,而不加約束的版本經常不穩定。訓練開銷只增加6-7%,對大模型來說幾乎可以忽略。

有分析師稱mHC論文是"驚人的突破",可能會成為DeepSeek下一代主力模型的基礎技術。

OpenAI的CEO自己都承認過:DeepSeek的R1運行成本比OpenAI的同級模型便宜20到50倍

參考來源:CocoLoop、Computerworld報導、南華早報分析