DeepSeek Rilis V4.1 Flash, Permintaan Pro Dialihkan Senin

DeepSeek resmi merilis DeepSeek-V4.1-Flash pada 10 September. Nama model di sisi API adalah deepseek-flash, dan pada hari yang sama pukul 12:00 siang, daftar harga seluruh lini Flash juga berubah ke tarif baru. ID versi uji internal yang muncul dua hari sebelumnya, deepseek-v4.1-flash-expires-on-0910, kedaluwarsa sesuai tanggal yang tertulis di namanya sendiri.

Pihak resmi memosisikan versi ini sebagai "model berukuran terkecil dalam rangkaian arsitektur model yang benar-benar baru", dengan kemampuan pemahaman visual multimodal native. Dua nama model lama, deepseek-v4-flash dan deepseek-v4-flash-vision-exp, tidak langsung hilang — keduanya untuk sementara dialihkan ke V4.1 Flash, sehingga pemanggil API bisa memakai versi baru tanpa mengubah kode.

Seperti apa daftar harga barunya

Menurut halaman harga resmi, deepseek-flash memiliki panjang konteks 1 juta token dan output maksimum 384.000 token. Di luar jam sibuk, harga per juta token terbagi tiga tingkat: 0,02 yuan untuk cache hit pada input, 1 yuan untuk cache miss, dan 4 yuan untuk output. Pada jam sibuk semua tarif itu digandakan, menjadi 0,04 yuan, 2 yuan, dan 8 yuan.

Definisi jam sibuk mengikuti skema yang sudah dipakai DeepSeek sejak Juli: waktu Beijing Senin–Jumat pukul 9:00–12:00 dan 14:00–18:00, total tujuh jam, sisanya dihitung sebagai luar jam sibuk. Pembagian ini mengikuti jam kerja di Tiongkok, sehingga pemanggil dari zona waktu lain akan mendapat harga rata-rata efektif yang lebih rendah dibanding tim yang berbasis di Tiongkok.

Perusahaan menyebut perubahan ini sebagai "penurunan harga". Laporan publik menyebutkan bahwa setelah penyesuaian tarif jam sibuk/luar sibuk pada Agustus, harga cache hit Flash di luar jam sibuk sempat naik hingga 0,05 yuan. Namun halaman harga resmi hanya menampilkan tarif yang berlaku saat ini dan tidak menyimpan riwayat, sehingga angka itu tidak bisa diverifikasi langsung dari halaman resmi. Yang bisa dipastikan hanyalah angka-angka saat ini, dan satu perubahan lain yang menyertainya.

Nama "Pro" untuk sementara tidak punya model yang sesuai

Mulai pukul 12:00 tanggal 14 September, semua permintaan yang dikirim ke deepseek-v4-pro akan dialihkan secara menyeluruh ke V4.1 Flash dan ditagih sesuai tarif Flash. Di halaman harga, deepseek-v4-pro masih mengarah ke DeepSeek-V4-Pro-0813, dengan tiga angka luar jam sibuk 0,15 yuan, 4,5 yuan, 13,5 yuan, dan tarif jam sibuk 0,30 yuan, 9 yuan, 27 yuan.

Jika kedua kelompok angka dibandingkan, nama model yang sama kini punya harga output yang turun dari 13,5 yuan menjadi 4 yuan, dan harga input cache miss turun dari 4,5 yuan menjadi 1 yuan. Bagi tim yang sudah menuliskan deepseek-v4-pro secara tetap di konfigurasi mereka, tagihan akan otomatis turun setelah hari Senin — tetapi model yang sebenarnya merespons sudah berganti.

Yang tidak dijelaskan dalam pengumuman resmi adalah jadwal peluncuran V4.1 Pro. Aturan pengalihan hanya menyebutkan "sebelum V4.1 Pro diluncurkan", yang menunjukkan urutan tetapi tidak memberi tanggal. Dengan kata lain, lini Pro saat ini berada di celah kosong: Pro lama berhenti menerima permintaan, Pro baru belum punya jendela peluncuran, dan di antara keduanya diisi sementara oleh model berukuran Flash. Berapa lama celah ini akan berlangsung belum bisa dipastikan.

Arsitektur dan skor benchmark

Detail arsitektur model berasal dari pengumuman resmi: 552 miliar parameter, menggunakan struktur Causal-Encoder-Decoder, dengan parameter aktif input dan output masing-masing 8 miliar dan 16 miliar. Rasio aktivasi ini sangat rendah dibanding total parameter sebesar 552 miliar, dan itulah prasyarat yang memungkinkan model ini berada di tingkat Flash.

Dalam hasil evaluasi yang dicantumkan dokumentasi resmi, model ini mencetak skor GPQA Diamond 90,9, HLE 36,8, peringkat Codeforces 3471, dan MathArena Apex 65,6. Angka-angka ini sebelumnya berada di rentang skor tingkat Pro; kini muncul pada model berukuran terkecil — dari sudut pandang penataan produk, hal ini menjelaskan mengapa perusahaan cukup percaya diri untuk mengalihkan langsung trafik Pro ke model ini.

Merangkai beberapa titik penting dalam lini Flash

Pertengahan Juli, V4 versi resmi dirilis, penagihan berbasis jam sibuk/luar sibuk diluncurkan bersamaan, dan lini Flash mulai memiliki dua tingkat harga: luar jam sibuk dan jam sibuk. Sekitar 13 Agustus terjadi satu putaran penyesuaian harga. Pada malam 8 September, versi antara dengan masa berlaku kurang dari 48 jam dan batas 20 permintaan bersamaan per akun dibuka untuk uji internal, dengan tanggal kedaluwarsa langsung tertulis di nama modelnya. Pada 10 September, versi resmi dan tarif baru hadir bersamaan, dengan perubahan pengalihan Pro dijadwalkan empat hari kemudian.

Lima langkah dalam dua bulan — ritme yang lebih padat dibanding periode mana pun sebelumnya di lini ini. Apakah arsitektur baru ini mampu menahan beban trafik Pro dalam kondisi nyata, para pemanggil API sendiri yang akan mulai memberi jawabannya setelah hari Senin.

Sumber: catatan pembaruan dokumentasi API DeepSeek, CocoLoop, halaman model dan harga DeepSeek — diverifikasi lewat halaman harga untuk tarif tiap tingkat, panjang konteks, dan definisi jam sibuk pada deepseek-flash dan deepseek-v4-pro.