DeepSeek V3.2 Beralih ke Sparse Attention, Biaya Inferensi Terpotong Setengah

Akhir September tahun lalu, DeepSeek diam-diam merilis V3.2 tanpa banyak gembar-gembor, tetapi versi ini membawa perubahan arsitektur yang cukup menarik.

Perubahan inti di V3.2 bukanlah skala parameter, melainkan mekanisme attention. Mereka membangun sesuatu yang disebut DeepSeek Sparse Attention (DSA), mengubah attention padat tradisional menjadi versi sparse.

Di Mana Sparse Attention Benar-Benar Hemat

Mekanisme attention tradisional memiliki kompleksitas O(L²) — ketika panjang sekuens berlipat ganda, komputasi meningkat empat kali lipat. Ketika jendela konteks Anda mencapai 128K token, overhead ini menjadi sangat signifikan.

Cara kerja DSA:

  • Pertama, gunakan Lightning Indexer (presisi FP8) untuk menghitung skor relevansi antara setiap query dan token historis dengan cepat
  • Kemudian, pilih hanya Top-k token yang paling relevan untuk komputasi attention
  • Kompleksitas turun dari O(L²) menjadi O(Lk), di mana k adalah angka kecil yang tetap

Sederhananya, "tidak setiap kata perlu melihat semua kata lain — lihat saja yang paling penting." Ide ini bukan hal baru, tetapi DeepSeek berhasil membuatnya bekerja dan menerapkannya di produksi.

Performa: Tidak Naik Signifikan, Tidak Turun Signifikan

Terus terang: benchmark V3.2 secara keseluruhan setara dengan V3.1. Ini bukan rilis yang "lebih kuat".

TugasHasil V3.2
MMLU-Pro85,0
AIME 202589,3
Peringkat Codeforces2121 (naik dari 2046)
Penalaran GPQA/HLESedikit menurun

Kemampuan coding memang meningkat, dengan peringkat Codeforces naik dari 2046 menjadi 2121 — lompatan yang cukup signifikan. Namun, benchmark penalaran sedikit menurun karena "token penalaran yang dihasilkan berkurang" — ini adalah salah satu konsekuensi dari sparse attention, di mana rantai pemikiran yang dihasilkan menjadi lebih pendek.

Jadi V3.2 adalah trade-off efisiensi untuk kemampuan, bukan peningkatan menyeluruh.

Harga Murah Adalah Daya Tarik Utama

Harga: Input $0,28/M, output $0,42/M.

Cache hit: $0,028/M, 90% lebih murah dari cache miss.

Perbandingan:

ModelInput (/M)Output (/M)
GPT-5$1,25$10
Claude Sonnet 4$3$15
DeepSeek V3.2$0,28$0,42

Dibandingkan dengan GPT-5, selisih biaya hampir 5 kali lipat. Ini bukan model paling kuat, tetapi jika skenario Anda adalah panggilan volume tinggi dan aplikasi yang sensitif terhadap biaya, nilai ekonomis V3.2 sulit ditandingi.

Jendela konteks 128K token. Bobot tersedia di Hugging Face dengan lisensi MIT, bebas digunakan untuk komersial.

Detail Arsitektur

DSA tertanam di basis Transformer, berjalan di bawah mode MQA dari MLA. Inferensi terutama dioptimalkan untuk klaster GPU H800; performa aktual pada perangkat keras lain mungkin berbeda, dan DeepSeek mengatakan validasi yang lebih luas masih berlangsung.

Pelatihan menggunakan pembelajaran penguatan GRPO terpadu, menggabungkan penyelarasan penalaran, pengikutan instruksi, dan tugas agen ke dalam satu proses pelatihan.

Perspektif

V3.2 bukan model yang "lebih pintar" — ini adalah model yang "lebih hemat".

Mekanisme sparse attention adalah trade-off rekayasa: mengorbankan sedikit kemampuan penalaran untuk penghematan biaya komputasi yang substansial, kemudian meneruskan penghematan itu langsung ke harga API.

Bagi pengembang aplikasi, pendekatan ini lebih praktis daripada terobsesi dengan benchmark. Tidak semua skenario membutuhkan model terkuat, tetapi setiap startup peduli dengan biaya API.

Pendekatan DeepSeek di sini berbeda dari OpenAI dan Anthropic — yang cenderung merilis model terkuat terlebih dahulu, lalu mengoptimalkan biaya kemudian. DeepSeek menurunkan biaya terlebih dahulu, meningkatkan jumlah pengguna, lalu melakukan diferensiasi di atasnya.

Pola ini sudah biasa di industri teknologi China, tetapi melihatnya berhasil di bidang model besar masih layak untuk diperhatikan.

Sumber referensi: CocoLoop, DeepSeek V3.2-Exp Release: Pricing, API Costs, Context Window & Benchmarks (llm-stats.com); DeepSeek V3.2 Exp Model Specs, Costs & Benchmarks (Galaxy.ai); Top 10 Cheapest Providers for DeepSeek V3.2 in 2026 (DEV Community)