DeepSeek Buka API Final V4-Flash

DeepSeek membuka beta publik API final V4-Flash pada 31 Juli. Model di web dan aplikasi tidak berubah, begitu pula API V4-Pro. Pembaruan ini diarahkan ke antarmuka pengembang, agen coding, dan alur kerja Codex.

Angka utamanya adalah 82,7 pada Terminal Bench 2.1. Tabel resmi mencatat 61,8 untuk V4-Flash Preview dan 72,1 untuk V4-Pro Preview. Dibanding versi Flash sebelumnya, kenaikannya 20,9 poin atau sekitar 33,8% secara relatif.

Post-training tanpa memperbesar model

“DeepSeek-V4-Flash-0731 mempertahankan arsitektur dan ukuran yang sama dengan DeepSeek-V4-Flash-preview, lalu hanya menjalani post-training ulang.”

Laporan teknis dan kartu model V4 menyebut Flash memiliki 284 miliar parameter total dan 13 miliar parameter aktif per token, dengan konteks satu juta token. DeepSeek mengaitkan peningkatan ini dengan post-training, bukan jaringan yang lebih besar.

Dengan max effort dan mode minimal DeepSeek Harness yang belum dirilis, perusahaan melaporkan Terminal Bench 2.1 82,7, NL2Repo 54,2, CyberGym 76,7, DeepSWE 54,4, Toolathlon-Verified 70,3, DSBench-FullStack 68,7, dan DSBench-Hard 59,6.

Pengumuman benchmark API final DeepSeek V4-Flash
Pengumuman dan tabel pembanding V4-Flash 0731 dari DeepSeek.

Kondisi pengujian perlu ikut dibaca. Tugas Code Agent publik memakai top_p=0.95, temperature=1.0, dan max effort. Dua DSBench adalah pengujian internal. Papan peringkat publik CyberGym belum memuat V4-Flash 0731, sehingga 76,7 masih berupa klaim vendor, bukan hasil reproduksi independen.

CyberGym berisi 1.507 kasus kerentanan historis dari 188 proyek sumber terbuka besar. Tolok ukur ini menguji apakah agen dapat membuat PoC yang berfungsi pada basis kode sebelum ditambal. Kerangka agen dan jumlah percobaan dapat mengubah hasil, sehingga rilis harness DeepSeek menjadi titik verifikasi pertama.

Dukungan Codex dimulai dari protokol

V4-Flash menerima format Responses API di https://api.deepseek.com dengan nama model deepseek-v4-flash. Pengembang dapat memakai pola client.responses.create() dari OpenAI SDK dan mengarahkannya melalui konfigurasi Codex.

DeepSeek mendukung function, web search di server, alat kustom apply_patch untuk Codex, SSE streaming, reasoning effort, dan keluaran JSON.

Kompatibilitas format belum mencakup seluruh fitur platform Responses. previous_response_id, conversation, store, background, dan context management tidak didukung. File search, code interpreter, computer use, serta MCP diabaikan. API ini stateless sehingga klien harus mengirim ulang konteks multigilir.

Harga tetap rendah

Harga V4-Flash per satu juta token adalah RMB 0,02 untuk input cache hit, RMB 1 untuk input tanpa cache, dan RMB 2 untuk output. Model ini menawarkan konteks satu juta token, output hingga 384.000 token, dan batas konkurensi akun 2.500. V4-Pro tercantum RMB 0,025, RMB 3, dan RMB 6, dengan konkurensi 500.

Responses API saat ini hanya mendukung V4-Flash. Dukungan V4-Pro dijadwalkan awal Agustus. Pengujian berikutnya adalah rilis harness, reproduksi independen atas 82,7 dan 76,7, serta konsumsi token dan tingkat penyelesaian pada beban kerja nyata.

Sumber: catatan perubahan API, dokumentasi Responses API dan harga DeepSeek; CocoLoop; laporan teknis V4 dan kartu model Hugging Face untuk arsitektur 284B/13B, konteks 1M, dan baseline Preview; situs resmi CyberGym untuk definisi benchmark dan status reproduksi publik.