Model 27B Alibaba Sejajar dengan Model 397B Milik Sendiri dalam Tolok Ukur

Pada 22 April, tim Qwen merilis model baru di Hugging Face. Model ini memiliki 27B parameter, arsitektur Dense, lisensi Apache 2.0, dan diberi nama Qwen3.6-27B.

Dalam postingan blog rilis, mereka mencantumkan skor tolok ukur. SWE-bench Verified: 77,2. Sebagai perbandingan, mereka juga menyertakan skor Qwen3.5-397B-A17B: 76,2.

Sebuah model Dense 27B mengalahkan model unggulan MoE 397B miliknya sendiri dalam tolok ukur pengkodean.

Ini bukan kebetulan. Ada alasan spesifik di baliknya.

Di Mana MoE Mulai Bocor

Arsitektur MoE (Mixture of Experts) telah menjadi solusi utama untuk memperbesar model besar selama dua tahun terakhir. Logikanya sederhana: jumlah total parameter besar, tetapi hanya sebagian kecil "pakar" yang diaktifkan per inferensi, sehingga komputasi aktual relatif terkendali.

Qwen3.5-397B memiliki total 397B parameter dan mengaktifkan 17B per inferensi. Qwen3.6-27B mengaktifkan seluruh 27B per inferensi—biaya komputasinya serupa, tetapi pendekatannya sangat berbeda.

Inferensi dengan arsitektur Dense lebih konsisten dan dapat diprediksi. MoE memiliki beberapa keacakan dalam perutean: input yang berbeda dapat memicu kombinasi pakar yang berbeda, yang dapat mengakumulasi penyimpangan dalam tugas rantai panjang.

Stabilitas sangat penting untuk tugas seperti pembuatan kode. Anda menginginkan "benar di setiap langkah," bukan "rata-rata bagus tetapi terkadang melenceng."

Pada Terminal-Bench 2.0, model 27B mencetak 59,3, sementara model 397B hanya mencetak 52,5. Kesenjangan lebih besar pada SkillsBench: 48,2 berbanding 30,0.

Model Skala Parameter SWE-bench Terminal-Bench SkillsBench
Qwen3.6-27B 27B Dense 77,2 59,3 48,2
Qwen3.5-397B-A17B 397B MoE 76,2 52,5 30,0

Model 27B memenangkan ketiga pengujian.

Apa itu Thinking Preservation

Qwen3.6-27B menyertakan mekanisme yang disebut "Thinking Preservation" yang perlu disebutkan secara terpisah.

Dalam percakapan multi-putaran, model menyimpan ringkasan proses penalaran sebelumnya. Pada putaran berikutnya, model tidak perlu memulai penalaran dari awal—model melanjutkan langsung dari hasil pemikiran sebelumnya.

Ini sangat berguna dalam alur kerja agen. Jika agen perlu menyelesaikan tugas sepuluh langkah, analisis dari tiga langkah pertama tidak boleh hilang pada langkah keempat; analisis tersebut harus bertahan sebagai konteks. Ini mengurangi pembuatan token berulang dan menurunkan "penyimpangan karena lupa" dalam tugas panjang.

Desain ini bergerak ke arah yang berlawanan dari mekanisme perutean MoE: MoE menskalakan parameter secara horizontal, sementara Thinking Preservation mengoptimalkan transfer status secara vertikal. Kedua pendekatan memecahkan masalah pada tingkat yang berbeda.

Berjalan di Perangkat Keras Konsumen

Ini adalah nilai praktis lain dari model ini.

Versi lengkap Qwen3.5-397B membutuhkan 807 GB penyimpanan. Bahkan versi terkuantisasi membutuhkan ratusan GB, memerlukan server multi-GPU untuk dijalankan, yang di luar jangkauan sebagian besar pengembang individu.

Qwen3.6-27B:

  • Versi lengkap: 55,6 GB
  • Versi GGUF terkuantisasi: 16,8 GB
  • Berjalan pada satu RTX 4090 dengan kecepatan sekitar 25 token/detik
  • Berfungsi di M4 Max MacBook tanpa masalah

Jendela konteks default adalah 262.144 token, dapat diperluas hingga 1 juta. Lisensi Apache 2.0 memungkinkan penggunaan komersial tanpa batasan.

Ini secara signifikan menurunkan hambatan untuk penerapan lokal. Tim teknisi yang ingin menyebarkan agen pengkodean di jaringan internal mereka tanpa mengirim kode ke API cloud sebelumnya harus memilih antara model sumber terbuka yang buruk atau server GPU yang mahal. Sekarang ada satu opsi.

Apa Artinya Ini bagi MoE

Waktu perilisan Alibaba ini menarik. Qwen3.6-27B menyusul beberapa hari setelah Qwen3.6-Max (versi sumber tertutup unggulan)—satu menunjukkan kemampuan puncak untuk menarik klien komersial, yang lain melayani komunitas pengembang. Dua kaki, melayani audiens yang berbeda.

Tapi pertanyaan yang lebih besar adalah: Jika model Dense 27B sudah bisa bersaing dengan Claude Opus 4.5 dalam pengkodean agen, pada dimensi apa kompetisi berikutnya akan dipertaruhkan?

Pada Terminal-Bench, model 27B seri dengan Claude Opus 4.5, sementara harga API Opus 4.5 lebih dari $15 per juta token. Qwen3.6-27B bersifat sumber terbuka dan dapat digunakan sendiri.

Keuntungan inkremental pada tolok ukur semakin mengecil. Pengguna semakin peduli dengan latensi, biaya, dan kemungkinan penerapan lokal.

Tren ini menguntungkan model sumber terbuka dan memberi tekanan pada layanan API sumber tertutup.

Langkah selanjutnya adalah melihat bagaimana Kimi, DeepSeek, dan MiniMax merespons.

Sumber referensi: CocoLoop, Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model (Simon Willison's Blog); Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks (AI Daily Post); Qwen3.6-27B (Hacker News)