Pada 16 April, tim Qwen Alibaba merilis Qwen3.6-35B-A3B sebagai sumber terbuka di bawah lisensi Apache 2.0, tanpa batasan komersial.
Model ini menarik: memiliki 35B parameter total tetapi hanya mengaktifkan 3B saat inferensi. Model ini menggunakan arsitektur mixture-of-experts (MoE) dengan rasio sparsity komputasi 12:1 — memberikan performa mendekati model 35B besar namun dengan biaya operasi setara model 3B.
Pada SWE-bench Verified (tes perbaikan Issue GitHub nyata), model ini mencetak 73,4%. Sebagai perbandingan, Gemma 4-31B sumber terbuka milik Google hanya mencapai 52,0%, selisih 21 poin persentase.
Mengapa arsitektur ini penting
Pertama, logika desain di balik MoE.
Pada model dense biasa, setiap token diproses dengan melibatkan seluruh parameter. Model dengan 35B parameter membutuhkan komputasi 35B per token.
MoE berbeda. Model ini membagi parameter menjadi banyak "expert" dan hanya mengaktifkan sebagian untuk setiap token. Mekanisme routing Qwen3.6-35B-A3B hanya memanggil grup expert dengan 3B parameter untuk memproses setiap token, namun model secara keseluruhan tetap memiliki kapasitas pengetahuan dari 35B parameter.
Hasilnya: kecepatan inferensi dan penggunaan memori setara model 3B, sementara kemampuan pemecahan masalah setara model 35B.
Di RTX 4090, kecepatannya mencapai lebih dari 120 token per detik. MacBook Pro M4/M5 dengan RAM 64GB dapat menjalankannya secara langsung. Setelah kuantisasi Q4_K_M, ukurannya sekitar 21GB — cukup untuk satu GPU konsumen kelas atas.
Ini berdampak besar pada deployment lokal. Sebelumnya, menjalankan model coding sumber terbuka kelas atas membutuhkan setidaknya A100 atau beberapa GPU 4090. Sekarang satu GPU konsumen sudah cukup.
Perbandingan benchmark dengan model lain
vs. Google Gemma 4-31B:
| Benchmark | Qwen3.6-35B | Gemma 4-31B |
|---|---|---|
| SWE-bench Verified | 73,4% | 52,0% |
| Terminal-Bench 2.0 | 51,5% | 42,9% |
| MCPMark (pemanggilan alat) | 37,0% | 18,1% |
| GPQA (penalaran umum) | 86,0% | 84,3% |
| AIME26 (kompetisi matematika) | 92,7% | 89,2% |
Pada pemanggilan alat (MCPMark), Qwen3.6 mencetak lebih dari dua kali lipat Gemma 4. Benchmark ini secara langsung berkorelasi dengan performa pada tugas agen nyata, bahkan lebih relevan daripada SWE-bench.
Pada QwenWebBench (tugas web), model ini meraih 1397 ELO, meningkat 43% dibandingkan generasi sebelumnya.
vs. Claude Sonnet 4.5:
Menurut evaluasi The Decoder, pada benchmark coding murni kedua model hampir seimbang, dengan perbedaan dalam margin kesalahan pengukuran. Claude masih unggul dalam percakapan bergaya asisten dan obrolan umum.
Detail sumber terbuka dan ketersediaan
Bobot model tersedia di Hugging Face (Qwen/Qwen3.6-35B-A3B) dan ModelScope, kompatibel dengan Transformers, vLLM (>=0.19.0), SGLang (>=0.5.10), dan KTransformers.
Dua mode didukung:
- Mode Thinking: Mirip model penalaran, melakukan pemikiran mendalam multi-langkah, mempertahankan proses penalaran untuk diwariskan ke dialog berikutnya.
- Mode Fast: Output langsung, cocok untuk percakapan dan tugas ringan.
Jendela konteks asli 262.144 token, dapat diperluas hingga lebih dari 1 juta dengan YaRN.
API juga tersedia melalui Alibaba Cloud Model Studio (dengan nama "Qwen3.6 Flash"), atau dapat di-deploy sendiri.
Bagaimana melihatnya
Ini adalah langkah ketiga Alibaba dalam arah sumber terbuka. Pertama, versi dasar Qwen3 dirilis sebagai sumber terbuka (lisensi Apache), kemudian versi enterprise tertutup Qwen3.6-Plus dirilis, dan sekarang versi khusus coding berperforma tinggi Qwen3.6-35B-A3B dirilis sebagai sumber terbuka.
Setiap langkah memiliki ritme yang jelas: pertama membangun basis komunitas dan pengembang, kemudian memonetisasi dengan versi tertutup, lalu memperdalam ekosistem dengan versi sumber terbuka.
Di mana posisi skor SWE-bench 73,4% Qwen3.6-35B-A3B di antara model sumber terbuka? Saat ini, hanya DeepSeek V4 dan model ini yang menonjol di ranah sumber terbuka. Di ranah tertutup, Claude Sonnet 4.5 juga berada di kisaran ini. Sebuah model MoE yang dapat dijalankan secara lokal mencapai skor ini benar-benar mengubah keadaan.
Tentu saja, skor tinggi di SWE-bench tidak menjamin kinerja produksi yang baik. Performa agen coding yang sebenarnya juga bergantung pada manajemen konteks, pemulihan kesalahan, dan stabilitas alur panjang — semua ini tidak tercakup dalam benchmark. Namun titik awal ini layak untuk diuji secara serius.
Sumber: CocoLoop, Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks (The Decoder); Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally (Build Fast with AI); Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model (DEV Community)