ModelScope memasang halaman teaser untuk Qwen3.8-Flash-Next, dengan hitung mundur yang mengarah ke pukul 23:00 (UTC+8) tanggal 26 Agustus. Versi standar dan versi FP8 akan dibuka untuk diunduh secara bersamaan. Di Hugging Face, deskripsi repository dengan nama yang sama hanya berisi satu kalimat: "A Preview of the Qwen4 Architecture."
Konfigurasi parameter yang bocor dari halaman teaser: 125B parameter utama, ditambah embedding N-gram sebesar 51B, dengan 6B parameter aktif per token. Model ini diposisikan sebagai MoE multimodal, dan menurut keterangan resmi model ini dibangun di atas arsitektur generasi berikutnya, Qwen4, dengan perkembangan arsitekturnya di-open-source-kan lebih awal untuk membantu komunitas bersiap menyambut seri Qwen4.
Rasio Aktivasi Ditekan di Bawah 5%
Dari 125B parameter, yang aktif hanya 6B, sehingga rasio aktivasinya kira-kira di bawah 5%. Sebagai perbandingan, MoE jarang (sparse) yang umum di industri dalam dua tahun terakhir kebanyakan berada di kisaran 5% sampai 10% — Flash-Next menekan tingkat sparsity itu lebih rendah lagi.
Ini jelas konfigurasi yang mengarah ke efisiensi biaya inferensi. Penggunaan VRAM pada MoE ditentukan oleh total parameter, sementara beban komputasi ditentukan oleh parameter yang aktif — bobot 125B tetap harus masuk ke VRAM, tapi setiap forward pass hanya melewati jalur 6B. Dari sisi deployment, artinya: ambang kapasitas GPU tidak turun, tapi ambang komputasi dan latensi turun drastis. Dipadukan dengan versi FP8, penggunaan bobot bisa dipangkas lagi sekitar separuhnya. Kata "Flash" dalam namanya kemungkinan besar merujuk pada hal ini.
Yang cukup jarang terlihat di tabel parameter adalah embedding N-gram sebesar 51B yang dicantumkan terpisah dari parameter utama. Struktur bertipe embedding biasanya berbasis lookup table dan tidak ikut dalam operasi matriks per-layer. Jika Flash-Next memakai pendekatan yang sama, 51B ini lebih terlihat sebagai investasi menukar VRAM dengan performa, bukan beban komputasi — implementasi persisnya baru bisa dipastikan setelah model card dan file konfigurasi dirilis malam ini.
Kenapa "3.8" Tapi Memakai Arsitektur Qwen4
Penamaannya terasa janggal, tapi logikanya masuk akal. Ini bukan pertama kalinya Qwen merilis versi preview Next menjelang akhir seri 3.x, dan polanya sama: menjalankan metode routing, varian attention, serta training stack generasi berikutnya pada model berukuran menengah, meng-open-source-kannya, membiarkan komunitas menyiapkan toolchain lebih dulu, baru kemudian merilis versi major resminya.
Manfaatnya nyata. Apakah model open source bisa langsung diadopsi oleh framework seperti vLLM, SGLang, dan llama.cpp pada hari rilisnya sangat menentukan kurva adopsinya dalam dua minggu pertama. Begitu arsitektur punya operator baru atau metode routing baru, proses adaptasinya sering butuh waktu berminggu-minggu. Unsloth sudah mengumumkan sedang menyiapkan dukungan day-zero, mengikuti jalur yang sama persis — memindahkan biaya waktu adaptasi arsitektur dari hari rilis Qwen4 ke hari ini.
Repository yang sama di Hugging Face sudah diklik oleh 1.299 orang untuk mendapat notifikasi, bahkan sebelum dibuka. Angka ini terbilang tidak sedikit untuk repository kosong yang bahkan belum punya model card.
Yang Perlu Dipantau Setelah Malam Ini
Informasi di halaman teaser hanya sampai jumlah parameter — beberapa indikator kunci belum diungkap sama sekali: panjang konteks, modalitas apa saja yang dicakup kemampuan multimodalnya, apakah lisensinya tetap Apache 2.0, dan yang paling penting: hasil benchmark.
Selama setahun terakhir, strategi open source Alibaba memperlakukan bobot model sebagai pintu masuk ke ekosistemnya, sampai bobot model kelas Max pun dirilis. Flash-Next semakin memajukan garis waktu ini: merilis arsitektur lebih dulu sebelum modelnya sendiri matang. Bagi tim di China yang menangani deployment inferensi dan fine-tuning, 48 jam setelah pukul 23:00 malam ini kemungkinan akan cukup sibuk.
Sumber: halaman model ModelScope, repository Hugging Face, CocoLoop, Decrypt, diskusi komunitas Hacker News; konfigurasi parameter dan waktu rilis mengikuti informasi yang ditampilkan di halaman model, sementara rasio aktivasi merupakan perkiraan kasar berdasarkan parameter publik.