Mari kita mulai dengan angka ini: SWE-bench Pro 53,5 vs 50,9.
Angka pertama adalah Qwen3.6-27B, model dengan 27 miliar parameter yang dirilis sebagai open source pada 22 April di bawah lisensi Apache 2.0. Angka kedua adalah Qwen3.5-397B, model dengan 397 miliar parameter arsitektur Mixture-of-Experts (MoE) yang sebelumnya menjadi andalan Alibaba.
Model kecil dengan 27 miliar parameter mengalahkan model besar dengan hampir 40 miliar parameter aktif pada tolok ukur rekayasa perangkat lunak bukanlah hal sepele.
Thinking Preservation: Inilah Kuncinya
Sejujurnya, cerita tentang model yang lebih kecil namun lebih kuat sudah beberapa kali terjadi di bidang ini. Yang membuat pencapaian Qwen3.6-27B menonjol bukanlah arsitekturnya, melainkan fitur baru: Thinking Preservation (Pelestarian Pemikiran).
Ada masalah yang terabaikan dalam LLM open source: ketika agen menjalankan tugas multi-putaran, proses penalaran dari setiap putaran dibuang. Model harus menyimpulkan ulang dari konteks setiap kali, alih-alih menggunakan kembali rantai kognitif yang sudah dibangun sebelumnya.
Pendekatan Qwen3.6-27B adalah menyimpan "jejak pemikiran" dari pesan historis sebagai konteks persisten:
"menyimpan dan memanfaatkan jejak pemikiran dari pesan historis di seluruh percakapan, bukan membuang penalaran sebelumnya, sehingga meningkatkan efisiensi dalam alur kerja agen multi-putaran"
Dalam bahasa sederhana: model mengingat bagaimana ia berpikir sebelumnya, bukan memulai dari nol setiap kali.
Pada tugas pengkodean agen, perbedaan ini sangat signifikan. Saat menangani repositori kode yang sama, kesenjangan kinerja antara model yang mengingat kesimpulan penalaran sebelumnya dan yang tidak sangat besar. Karena SWE-bench Pro menguji tugas basis kode nyata, keunggulan ini semakin diperkuat.
Ikhtisar Tolok Ukur
Kinerja Qwen3.6-27B tidak terbatas pada SWE-bench:
| Tolok Ukur | Qwen3.6-27B | Perbandingan |
|---|---|---|
| SWE-bench Pro | 53,5 | vs Qwen3.5-397B MoE: 50,9 |
| Terminal-Bench 2.0 | 59,3 | Setara dengan Claude Opus flagship |
| AIME26 (Kompetisi Matematika) | 94,1 | vs Qwen3.5-27B: 92,6 |
| QwenWebBench | 1487 | vs Qwen3.5-27B: 1068 (+39%) |
| SkillsBench Rata-rata | 48,2 | Peningkatan 77% dibanding model ukuran sama generasi sebelumnya |
| GPQA Diamond | 87,8 | vs Qwen3.5-27B: 85,5 |
Peningkatan 77% pada SkillsBench layak disebut secara khusus. Tolok ukur ini mengukur kemampuan umum lintas domain. Lompatan dari Qwen3.5-27B ke Qwen3.6-27B bukanlah penyesuaian kecil, melainkan rekonstruksi tingkat sistem.
Jendela Konteks
Dukungan native untuk 262.144 token (sekitar 200.000 karakter Mandarin), dapat diskalakan hingga 1.010.000 token menggunakan YaRN.
Untuk skenario yang memerlukan penanganan repositori kode panjang atau dokumen panjang, konteks ini sudah memadai.
Apa Arti Open Source
Lisensi Apache 2.0, penggunaan komersial tanpa batasan.
Ini lebih praktis bagi perusahaan daripada sekadar angka kinerja: model 27 miliar parameter jauh lebih murah untuk diterapkan secara lokal dibandingkan model 397 miliar parameter, namun mencapai skor lebih tinggi pada tugas inti — kombinasi yang sangat menarik bagi perusahaan yang ingin membangun kemampuan AI sendiri. Pertimbangkan bahwa satu GPU kelas konsumen dapat menjalankan 27B, sementara 397B membutuhkan setidaknya beberapa mesin kelas atas.
Ini juga mengapa angka 77% pada SkillsBench sangat penting: bukan hanya lebih kuat dalam kode, tetapi kemampuan umum telah meningkat secara komprehensif. Itulah prasyarat nyata untuk menggantikan model besar.
Lanskap Pekan Ini
Pekan ini, OpenAI merilis GPT-5.5 dan Alibaba merilis Qwen3.6-27B.
Melihat keduanya secara bersamaan: flagship sumber tertutup mengejar "lebih cepat dan lebih hemat token," sementara model kecil open source mengejar "hasil lebih baik dengan parameter lebih sedikit." Arahnya berbeda, tetapi keduanya saling menekan ruang satu sama lain.
Hal berikutnya yang mungkin terganggu bukanlah perusahaan tertentu, melainkan asumsi bahwa "Anda memerlukan model besar untuk menjalankan kode dengan baik."
Sumber: CocoLoop, Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks (MarkTechPost)