DeepSeek V3:671Bパラメーター、活性化はわずか37B

昨年12月、DeepSeekはV3をリリースした。このモデルで競合他社が最も気にしたのは性能ではなく、コストだった。

まずはアーキテクチャ

V3の設計の中核はMixture of Expertsである:

  • 総パラメーター数:671B
  • トークンあたりの実際の活性化:37B
  • 各層256のエキスパート、毎回8つを選択

256人の専門医がいて、診察ごとに最も関連性の高い8人だけを呼び出すようなものだ。パラメーター数は多いが計算コストは抑えられる——これがMoEの本質である。

ベンチマークスコア

  • MMLU:87.1%(GPT-4oと同等)
  • MATH-500:90.2%
  • Codeforces:51.6パーセンタイル
  • GPQA Diamond:59.1%

これらの結果は、2025年末時点のオープンソースモデルの中でトップクラスに位置する。

トップモデルのトレーニングに550万ドル

V3のトレーニングコストは約550万ドルだった。同期間に米国企業は同規模のモデルをトレーニングするために数十億ドルを費やしていた。この数字が出たとき、業界全体が考え直し始めた:DeepSeekが極端に節約しているのか、それとも他の企業が無駄遣いしすぎているのか?

コスト削減の秘訣は以下の通り:

  • FP8混合精度トレーニングでメモリ帯域幅要件を半減
  • スポットインスタンスの戦略的活用で計算コストを70%削減
  • MoEアーキテクチャ自体が自然な計算節約装置

なぜ重要なのか

V3のリリースから1ヶ月後、DeepSeekはR1を発表した。この2つのモデルは合わせて、一つのことを証明した:最先端のAI研究に必ずしも数十億ドルを費やす必要はない。世界のAI競争の構図にとって、このシグナルはどの単一のベンチマークよりも重要である。

出典:CocoLoop、DeepSeek V3技術報告書、BentoML技術ガイド