DeepSeek V3: 671B Parameter, Hanya 37B yang Diaktifkan

Bulan Desember lalu, DeepSeek merilis V3. Yang paling membuat pesaing tidak nyaman dari model ini bukanlah performanya—melainkan biayanya.

Arsitektur Terlebih Dahulu

Inti desain V3 adalah Mixture of Experts:

  • Total parameter: 671B
  • Aktivasi aktual per token: 37B
  • 256 ahli per lapisan, 8 dipilih setiap kali

Ini seperti memiliki 256 dokter spesialis, tetapi untuk setiap konsultasi Anda hanya memanggil 8 yang paling relevan. Jumlah parameter besar tetapi biaya komputasi terkendali—itulah esensi MoE.

Skor Benchmark

  • MMLU: 87,1% (setara GPT-4o)
  • MATH-500: 90,2%
  • Codeforces: Persentil 51,6
  • GPQA Diamond: 59,1%

Hasil ini menempatkannya di jajaran model open-source teratas pada akhir 2025.

$5,5 Juta untuk Melatih Model Kelas Atas

Biaya pelatihan V3 sekitar $5,5M. Pada periode yang sama, perusahaan AS menghabiskan ratusan juta dolar untuk melatih model dengan skala serupa. Ketika angka ini keluar, seluruh industri mulai merenung: apakah DeepSeek terlalu hemat, ataukah yang lain terlalu boros?

Rahasia penghematan biaya meliputi:

  • Pelatihan presisi campuran FP8, memotong kebutuhan bandwidth memori hingga setengahnya
  • Penggunaan strategis spot instance, menekan biaya komputasi hingga 70%
  • Arsitektur MoE sendiri adalah penghemat komputasi alami

Mengapa Ini Penting

Satu bulan setelah perilisan V3, DeepSeek meluncurkan R1. Kedua model ini bersama-sama membuktikan satu hal: penelitian AI mutakhir tidak harus menghabiskan miliaran dolar. Bagi lanskap persaingan AI global, sinyal ini lebih penting daripada tolok ukur tunggal mana pun.

Sumber: CocoLoop, laporan teknis DeepSeek V3, panduan teknis BentoML