Qwen3.6-27B Dirilis sebagai Open Source, Kalahkan 397B MoE

Mari kita mulai dengan angka ini: SWE-bench Pro 53,5 vs 50,9.

Angka pertama adalah Qwen3.6-27B, model dengan 27 miliar parameter yang dirilis sebagai open source pada 22 April di bawah lisensi Apache 2.0. Angka kedua adalah Qwen3.5-397B, model dengan 397 miliar parameter arsitektur Mixture-of-Experts (MoE) yang sebelumnya menjadi andalan Alibaba.

Model kecil dengan 27 miliar parameter mengalahkan model besar dengan hampir 40 miliar parameter aktif pada tolok ukur rekayasa perangkat lunak bukanlah hal sepele.

Thinking Preservation: Inilah Kuncinya

Sejujurnya, cerita tentang model yang lebih kecil namun lebih kuat sudah beberapa kali terjadi di bidang ini. Yang membuat pencapaian Qwen3.6-27B menonjol bukanlah arsitekturnya, melainkan fitur baru: Thinking Preservation (Pelestarian Pemikiran).

Ada masalah yang terabaikan dalam LLM open source: ketika agen menjalankan tugas multi-putaran, proses penalaran dari setiap putaran dibuang. Model harus menyimpulkan ulang dari konteks setiap kali, alih-alih menggunakan kembali rantai kognitif yang sudah dibangun sebelumnya.

Pendekatan Qwen3.6-27B adalah menyimpan "jejak pemikiran" dari pesan historis sebagai konteks persisten:

"menyimpan dan memanfaatkan jejak pemikiran dari pesan historis di seluruh percakapan, bukan membuang penalaran sebelumnya, sehingga meningkatkan efisiensi dalam alur kerja agen multi-putaran"

Dalam bahasa sederhana: model mengingat bagaimana ia berpikir sebelumnya, bukan memulai dari nol setiap kali.

Pada tugas pengkodean agen, perbedaan ini sangat signifikan. Saat menangani repositori kode yang sama, kesenjangan kinerja antara model yang mengingat kesimpulan penalaran sebelumnya dan yang tidak sangat besar. Karena SWE-bench Pro menguji tugas basis kode nyata, keunggulan ini semakin diperkuat.

Ikhtisar Tolok Ukur

Kinerja Qwen3.6-27B tidak terbatas pada SWE-bench:

Tolok UkurQwen3.6-27BPerbandingan
SWE-bench Pro53,5vs Qwen3.5-397B MoE: 50,9
Terminal-Bench 2.059,3Setara dengan Claude Opus flagship
AIME26 (Kompetisi Matematika)94,1vs Qwen3.5-27B: 92,6
QwenWebBench1487vs Qwen3.5-27B: 1068 (+39%)
SkillsBench Rata-rata48,2Peningkatan 77% dibanding model ukuran sama generasi sebelumnya
GPQA Diamond87,8vs Qwen3.5-27B: 85,5

Peningkatan 77% pada SkillsBench layak disebut secara khusus. Tolok ukur ini mengukur kemampuan umum lintas domain. Lompatan dari Qwen3.5-27B ke Qwen3.6-27B bukanlah penyesuaian kecil, melainkan rekonstruksi tingkat sistem.

Jendela Konteks

Dukungan native untuk 262.144 token (sekitar 200.000 karakter Mandarin), dapat diskalakan hingga 1.010.000 token menggunakan YaRN.

Untuk skenario yang memerlukan penanganan repositori kode panjang atau dokumen panjang, konteks ini sudah memadai.

Apa Arti Open Source

Lisensi Apache 2.0, penggunaan komersial tanpa batasan.

Ini lebih praktis bagi perusahaan daripada sekadar angka kinerja: model 27 miliar parameter jauh lebih murah untuk diterapkan secara lokal dibandingkan model 397 miliar parameter, namun mencapai skor lebih tinggi pada tugas inti — kombinasi yang sangat menarik bagi perusahaan yang ingin membangun kemampuan AI sendiri. Pertimbangkan bahwa satu GPU kelas konsumen dapat menjalankan 27B, sementara 397B membutuhkan setidaknya beberapa mesin kelas atas.

Ini juga mengapa angka 77% pada SkillsBench sangat penting: bukan hanya lebih kuat dalam kode, tetapi kemampuan umum telah meningkat secara komprehensif. Itulah prasyarat nyata untuk menggantikan model besar.

Lanskap Pekan Ini

Pekan ini, OpenAI merilis GPT-5.5 dan Alibaba merilis Qwen3.6-27B.

Melihat keduanya secara bersamaan: flagship sumber tertutup mengejar "lebih cepat dan lebih hemat token," sementara model kecil open source mengejar "hasil lebih baik dengan parameter lebih sedikit." Arahnya berbeda, tetapi keduanya saling menekan ruang satu sama lain.

Hal berikutnya yang mungkin terganggu bukanlah perusahaan tertentu, melainkan asumsi bahwa "Anda memerlukan model besar untuk menjalankan kode dengan baik."

Sumber: CocoLoop, Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks (MarkTechPost)