Qwen3.8-Max Puncaki Peringkat Coding, Harga Seperempat Pesaing

Tim Tongyi Qianwen milik Alibaba memperbarui model andalannya, Qwen3.8-Max, ke versi 0902, dengan tambahan satu putaran post-training yang difokuskan pada tugas coding dan pekerjaan kantor profesional. Di papan peringkat coding frontend Code Arena, versi baru ini meraih skor 1691 dan menduduki posisi pertama, unggul 22 poin dari versi sebelumnya.

Alibaba juga merilis angka lain yang lebih menjelaskan posisi yang ingin diincarnya: harga rata-rata gabungan versi baru ini sekitar 5 dolar AS per juta token, sementara model di peringkat kedua dan ketiga masing-masing dibanderol 20 dolar AS dan 12 dolar AS.

22 Poin dan 15 Dolar AS

Selisih skor di papan atas sudah sangat tipis. Jarak 22 poin antara 1691 dan skor versi sebelumnya adalah jenis selisih yang biasanya bisa dikejar pesaing dalam satu-dua minggu lewat penilaian buta oleh manusia. Yang benar-benar membuat jarak adalah kolom di sebelah kanan: untuk tugas frontend yang sama, beralih ke model peringkat kedua membuat tagihan langsung naik empat kali lipat.

Menurut laporan yang beredar, harga API versi baru ini adalah 2 dolar AS per juta token input dan 6 dolar AS per juta token output. Jika kedua angka ini dihitung mundur terhadap harga rata-rata gabungan resmi sebesar 5 dolar AS (perhitungan kasar), token output perlu menyumbang sekitar tiga perempat dari total penggunaan agar bisa menghasilkan angka 5 tersebut. Rasio ini bukan hal aneh untuk tugas coding frontend: prompt biasanya hanya berisi beberapa ratus baris konteks, sementara yang dikeluarkan model adalah kode komponen satu halaman penuh — sisi output secara alami menyerap porsi terbesar dari penggunaan. Harga rata-rata 5 dolar ini dihitung berdasarkan pola penggunaan nyata untuk "menulis kode"; untuk pekerjaan yang input-nya berat dan output-nya ringan, seperti meringkas dokumen panjang, harga satuan sebenarnya bisa lebih rendah lagi.

Bagi tim-tim di Tiongkok, patokan harga ini cukup jelas. Selama setahun terakhir, perusahaan yang memasukkan coding berbasis agent ke dalam produksi seringkali terhambat di tahap keuangan: apakah model menulis kode dengan benar sudah lama bukan lagi masalah utama, yang jadi penentu adalah apakah tagihan untuk jutaan token pemakaian per hari bisa disetujui. Kombinasi skor yang menyamai papan atas sekaligus harga yang dipotong hingga tinggal seperempat ini lebih mengubah keputusan pengadaan dibanding sekadar tambahan 22 poin.

2,4 Triliun Parameter, 95 Miliar yang Bekerja

Di balik versi 0902 ini ada model dasar bernama Qwen3.8-2.4T-A95B. Total parameternya 2,4 triliun, tapi setiap forward pass hanya mengaktifkan sekitar 95 miliar — arsitektur sparse MoE (mixture of experts) yang khas. Dari 512 expert yang tersedia, 11 di antaranya diaktifkan untuk setiap token, dengan 10 dipilih lewat routing dan 1 merupakan shared expert.

Pilihan arsitekturnya juga condong ke tugas-tugas berdurasi panjang. Model ini punya 23 layer, dengan Gated DeltaNet dan Gated Attention yang disusun bergantian. Panjang konteks native-nya 262.144 token, dan bisa diperluas hingga sekitar 1,01 juta token. Mencampur linear attention dengan gated attention adalah arah yang selama enam bulan terakhir banyak diambil tim-tim di Tiongkok yang mengembangkan konteks panjang, dengan tujuan yang jelas: menekan beban memori dan biaya inferensi dari konteks panjang ke level yang layak secara komersial — kalau tidak, konteks satu juta token cuma jadi angka yang terlihat bagus di lembar spesifikasi.

Rasio aktivasi ini juga menjelaskan dari mana angka 5 dolar itu berasal. Total parameter 2,4 triliun menentukan kapasitas pengetahuan model, sementara jumlah parameter aktif 95 miliar menentukan berapa banyak "biaya listrik" yang harus dibayar untuk setiap pemanggilan. Ketika sparsity ditarik sejauh ini, biaya inferensi per unit secara alami jauh lebih rendah dibanding model dense berskala setara.

API Sudah Merambah ke Seluruh Lini Produk Alibaba

Versi baru ini kini bisa dipanggil langsung lewat layanan API di platform AI Qwen, dan juga sudah terintegrasi ke Qwen Office, Qoder, serta aplikasi Qwen. Tiga jalur — pelanggan korporat, developer, dan pengguna umum — dibuka sekaligus, tanpa masa rilis bertahap.

Alibaba memposisikan versi ini sebagai model yang "lebih cocok untuk tugas kompleks nyata di perusahaan, riset ilmiah, serta tugas berjangka panjang", dan mengklaim model ini "memperbarui batas atas baru model global" dalam hal penalaran multi-langkah, pemanggilan tool, dan pembuatan aplikasi end-to-end. Bagian kedua dari klaim ini jelas merupakan framing dari vendor sendiri, tapi bagian pertama soal "tugas berjangka panjang" memang selaras dengan dua pilihan teknis di baliknya: konteks 1,01 juta token dan aktivasi sparse. Kemampuan menampung seluruh codebase sekaligus tanpa membuat biaya membengkak, itulah yang sebenarnya dibutuhkan agar model bisa bekerja terus-menerus selama berjam-jam.

Cara penamaannya juga mengungkap ritme yang diambil Alibaba. Qwen3.8-Max memakai tanggal sebagai nomor sub-versi, menunjukkan bahwa di lini Max yang closed-source, Alibaba mengambil ritme iterasi langkah kecil tapi cepat — generasi model tetap, sementara kemampuannya terus bertambah. Sejak 3.6-Max beralih ke closed-source, seri Max sudah membagi peran dengan seri Flash yang open-source: satu bertugas merebut posisi puncak papan peringkat dan anggaran korporat, satu lagi memperluas ekosistem developer. Dengan versi 0902 ini menekan harga hingga seperempat dari papan atas, pembagian peran antara dua lini itu pun semakin dipertegas.

Sumber: pengumuman resmi Alibaba Tongyi Qianwen, CocoLoop, halaman papan peringkat coding frontend Code Arena, ITHome, model card Hugging Face; skor 1691 dan kenaikan 22 poin, harga rata-rata gabungan 5/20/12 dolar AS per juta token, serta angka total parameter 2,4 triliun dan parameter aktif 95 miliar masing-masing telah diverifikasi.