Fireworks AI merilis sekumpulan data benchmark untuk DeepSeek-V4.1-Flash, dan kesimpulannya bisa diringkas dalam satu kalimat: pada tugas coding agentic, model ini berada di kisaran akurasi yang sama dengan GPT-6 Astra, namun biaya per tugasnya 15 kali lebih murah.
Mulai dari skor. Pada metrik pass@1 DeepSWE, DeepSeek-V4.1-Flash mencatat 74.34%, GPT-6 Astra 74.12%, Gemini 3.8 Flash 73.83%, dan Claude Opus 5 73.65%. Keempat model berkumpul dalam rentang 0.69 poin persentase, sehingga tidak banyak gunanya memperdebatkan siapa yang benar-benar unggul. Di Terminal-Bench 2.1, DeepSeek mencetak 86.5% berbanding 87.5% milik Astra — Astra sedikit lebih unggul di sini.
Hitung-hitungan biayanya begini
Angka biaya per tugas dari Fireworks: DeepSeek-V4.1-Flash 0.430 dolar AS, Gemini 3.8 Flash 2.362 dolar AS, GPT-6 Astra 6.524 dolar AS, dan Claude Opus 5 11.838 dolar AS. Dengan DeepSeek sebagai patokan, ketiga model lainnya masing-masing 5.5 kali, 15 kali, dan 28 kali lebih mahal.
Coba terapkan kelipatan ini ke anggaran nyata. Misalkan tim engineering beranggotakan sepuluh orang, masing-masing menjalankan 20 tugas coding agentic per hari, dengan 22 hari kerja per bulan — totalnya 4.400 tugas. Menjalankannya dengan DeepSeek menghabiskan sekitar 1.892 dolar AS sebulan, sementara dengan Astra sekitar 28.706 dolar AS. Selisihnya sekitar 26.800 dolar AS per bulan, atau sekitar 320.000 dolar AS per tahun. Ini perkiraan kasar — distribusi token pada tugas nyata tidak akan persis sama dengan benchmark — tapi urutan besarannya kira-kira di angka ini.
Celah yang berbalik arah di HLE
Dalam kumpulan data yang sama, ada celah yang berbalik arah. Pada Humanity's Last Exam, DeepSeek-V4.1-Flash meraih 34.52%, sedangkan GPT-6 Astra 50.40% — selisih 15.88 poin persentase. Kesetaraan pada tugas coding tidak berlaku untuk jenis penalaran umum bertingkat kesulitan tinggi ini.
Fireworks juga menyertakan angka Oracle Router: menggabungkan kedua model secara teoretis menghasilkan skor 54.80%. Ini adalah nilai batas atas, dengan asumsi setiap soal bisa ditentukan sebelumnya harus diserahkan ke model mana. Sistem routing yang sebenarnya tidak memiliki informasi semacam itu — angka ini lebih menunjukkan bahwa titik lemah kedua model tidak saling tumpang tindih, bukan sebuah skema yang bisa langsung dipakai.
Dari sisi arsitektur
Model ini sendiri adalah MoE dengan 552B parameter, dengan aktivasi input dan output yang dipisahkan: 8B teraktivasi di sisi input, 16B di sisi output. Perubahan pada KV cache lebih langsung terasa — penggunaan HBM turun menjadi seperempat dari generasi sebelumnya, dan penggunaan SSD turun menjadi seperdelapan.
Di sinilah sumber keunggulan biayanya bertemu. Tugas coding agentic punya konteks panjang dan banyak putaran, sehingga porsi biaya KV cache jauh lebih besar dibanding tanya-jawab sekali jalan. Dengan menekan penggunaan memori dan disk cache menjadi seperempat dan seperdelapan, penyedia layanan bisa menampung lebih banyak permintaan bersamaan pada perangkat keras yang sama — dan itulah yang membuat angka 0.43 dolar AS bisa tercapai, bukan semata-mata hasil strategi harga.
Asal-usul angka-angka ini
Perlu ditegaskan bahwa benchmark ini dipublikasikan oleh Fireworks AI sendiri, sementara DeepSeek-V4.1-Flash dijual di platform mereka sendiri — pihak yang menguji dan pihak yang menjual adalah perusahaan yang sama. DeepSeek belum mengonfirmasi angka-angka ini, dan sejauh ini belum ada pihak ketiga independen yang mereproduksinya.
Pemilihan benchmark juga memengaruhi kesimpulan. DeepSWE dan Terminal-Bench 2.1 sama-sama condong ke tugas coding bergaya rekayasa yang cukup relevan dengan pekerjaan pengembangan sehari-hari, tetapi jika benchmark atau distribusi tugasnya diganti, tidak ada jaminan keempat model akan tetap berada dalam rentang 0.69 poin itu. Rasio biaya ini layak dijadikan acuan, tapi menjadikannya peringkat final kemampuan model adalah hal lain.
Sumber: blog teknis Fireworks AI, CocoLoop; skor DeepSWE, Terminal-Bench 2.1, dan HLE, biaya per tugas, serta parameter arsitektur model telah dicocokkan satu per satu dengan tulisan blog aslinya; pengeluaran bulanan tim sepuluh orang merupakan perkiraan kasar.