昨年12月、DeepSeekはV3をリリースした。このモデルで競合他社が最も気にしたのは性能ではなく、コストだった。
まずはアーキテクチャ
V3の設計の中核はMixture of Expertsである:
- 総パラメーター数:671B
- トークンあたりの実際の活性化:37B
- 各層256のエキスパート、毎回8つを選択
256人の専門医がいて、診察ごとに最も関連性の高い8人だけを呼び出すようなものだ。パラメーター数は多いが計算コストは抑えられる——これがMoEの本質である。
ベンチマークスコア
- MMLU:87.1%(GPT-4oと同等)
- MATH-500:90.2%
- Codeforces:51.6パーセンタイル
- GPQA Diamond:59.1%
これらの結果は、2025年末時点のオープンソースモデルの中でトップクラスに位置する。
トップモデルのトレーニングに550万ドル
V3のトレーニングコストは約550万ドルだった。同期間に米国企業は同規模のモデルをトレーニングするために数十億ドルを費やしていた。この数字が出たとき、業界全体が考え直し始めた:DeepSeekが極端に節約しているのか、それとも他の企業が無駄遣いしすぎているのか?
コスト削減の秘訣は以下の通り:
- FP8混合精度トレーニングでメモリ帯域幅要件を半減
- スポットインスタンスの戦略的活用で計算コストを70%削減
- MoEアーキテクチャ自体が自然な計算節約装置
なぜ重要なのか
V3のリリースから1ヶ月後、DeepSeekはR1を発表した。この2つのモデルは合わせて、一つのことを証明した:最先端のAI研究に必ずしも数十億ドルを費やす必要はない。世界のAI競争の構図にとって、このシグナルはどの単一のベンチマークよりも重要である。
出典:CocoLoop、DeepSeek V3技術報告書、BentoML技術ガイド