DeepSeekのコスト管理能力は業界で伝説的な存在となっている:
- V3 訓練コスト:約550万ドル
- R1 GPU使用料:約29.4万ドル
同期間に米国企業が同規模のモデル訓練に充てた予算は1億~10億ドル。少なくとも一桁の差がある。
コスト削減の秘訣
1. FP8混合精度訓練
訓練精度をFP32/FP16からFP8に下げることで、メモリ帯域幅の要件を半減。ほとんどの計算ボトルネックはメモリ帯域幅に起因するため、これは非常に的確な施策である。
2. Spotインスタンスの戦略的活用
計算コストを70%削減。Spotインスタンスはいつでも回収される可能性があるが、DeepSeekの訓練フレームワークは十分なチェックポイントとフォールトトレランス設計でこれに対応している。
3. MoEアーキテクチャによる自然な計算節約
671Bパラメータのモデルは、推論ごとに37Bパラメータのみを活性化。パラメータ数で容量と能力を確保し、スパース活性化でコストを管理可能にしている。
新技術:mHC
今年1月、DeepSeekは新たな手法——Manifold-Constrained Hyper-Connections(mHC)を公開。基盤論文には創業者の梁文鋒が共同著者として名を連ねている。
この手法の内容:モデル内部に複数の情報ストリームを作成し、各混合ステップで厳密な数学的制約により総情報量の保存を保証。テスト結果では、3Bから27Bのパラメータ規模でmHCが安定した訓練を可能にする一方、制約のないバージョンはしばしば不安定になる。訓練オーバーヘッドの増加はわずか6-7%で、大規模モデルにとってはほぼ無視できる。
一部のアナリストはmHC論文を「驚くべきブレークスルー」と評し、DeepSeekの次世代主力モデルの基盤技術になる可能性があると述べている。
OpenAIのCEO自身も、DeepSeekのR1の運用コストはOpenAIの同等モデルより20~50倍安いと認めている。
出典:CocoLoop、Computerworld報道、南華早報分析