JetBrains rilis open source Mellum2.1, model kecil untuk agen coding

JetBrains merilis sekaligus membuka kode Mellum2.1, sebuah model kecil yang dirancang khusus untuk agen coding lokal. Model ini mempertahankan arsitektur mixture-of-experts milik Mellum2, dengan total parameter 12B dan parameter aktif 2,5B. Lisensinya Apache 2.0, bobotnya tersedia di Hugging Face, dan model card menandainya sebagai "model berpikir".

Blog resmi menggambarkan tujuannya dengan lugas: model bisa berkeliling di dalam basis kode, mengubah file, lalu memeriksa sendiri perubahannya. Generasi sebelumnya belum sanggup melakukan itu. Dalam tulisannya, JetBrains mengakui bahwa kemampuan Mellum2 bekerja di dalam repositori belum mencapai level yang mereka inginkan.

Arsitektur tetap, yang berubah adalah pelatihannya

Mellum2.1 memakai kerangka yang sama dengan Mellum2: 28 lapisan, 8 dari 64 pakar diaktifkan setiap kali, atensi memakai GQA, dan 3 dari setiap 4 lapisan menggunakan sliding window sepanjang 1024, dengan panjang konteks 131.072. Seluruh perubahan ada pada tahap pasca-pelatihan.

Menurut JetBrains, reinforcement learning berubah dari tahap singkat di akhir pelatihan menjadi bagian utama pelatihan. Tugasnya mencakup matematika, pemrograman kompetitif, sains, pemanggilan alat, dan rekayasa perangkat lunak. Datanya memadukan dataset reinforcement learning publik dengan tugas yang dibuat sendiri oleh tim, dan setiap sumber disaring sebelum masuk ke pelatihan, karena data publik sering berisi tes yang salah tulis, jawaban yang tidak bisa diverifikasi, dan soal dengan tingkat kesulitan yang tidak sesuai.

Bagian rekayasa perangkat lunak dilatih di repositori kode sungguhan: model diberi shell dan alat penyunting file, dan hadiah baru diberikan jika tes lolos. Tim membangun infrastruktur sendiri untuk keperluan ini. Dalam kata-kata blognya, selama pelatihan dijalankan "millions of sandboxed runs across thousands of environments", yaitu jutaan eksekusi dalam sandbox di ribuan lingkungan.

Di mana skornya naik

Model card menyertakan tabel perbandingan hasil pengukuran sendiri, dengan pembanding generasi sebelumnya Mellum2 Thinking, Gemma 4 E4B, dan Qwen3.5 9B. Kenaikan terbesar ada pada tugas-tugas agentik:

Tolok ukurMellum2.1Mellum2Qwen3.5 9B
SWE-bench Verified47,02,050,0
SWE-bench Pro28,00,038,0
Terminal-Bench 2.117,40,621,7
LiveCodeBench v682,069,475,4
BFCL v462,349,658,5

Evaluasi agentik seluruhnya memakai Pi v0.73.1 yang open source sebagai kerangka eksekusi, dilengkapi alat shell dan file, dengan konteks 114K dan maksimal 16K token per giliran. Semua skor dijalankan sendiri oleh JetBrains, dan sejauh ini belum ada replikasi dari pihak ketiga.

Dibandingkan dengan Qwen3.5 9B

Dibandingkan dengan Qwen3.5 9B, model yang paling sering dijadikan pembanding di kelas ukuran ini, kelebihan dan kekurangan Mellum2.1 terlihat jelas.

Untuk menulis satu fungsi, mengerjakan soal kompetisi, dan memanggil alat, Mellum2.1 unggul: LiveCodeBench lebih tinggi 6,6 poin, MBPP+ lebih tinggi hampir 10 poin, dan BFCL lebih tinggi sekitar 4 poin. Untuk bekerja terus-menerus di dalam repositori, ia masih tertinggal: SWE-bench Verified selisih 3 poin, SWE-bench Pro selisih 10 poin, dan Terminal-Bench selisih lebih dari 4 poin. Selisih pada penalaran umum lebih besar, dengan GPQA Diamond 64,6 berbanding 77,8 dan AIME 83,3 berbanding 86,7. Pada XSTest, tes penolakan terkait keamanan, skornya 88,8 juga lebih rendah daripada Qwen dan Gemma.

Yang dipertaruhkan JetBrains adalah kecepatan. Blognya menyebut, dalam uji beban tinggi di H200, Mellum2.1 adalah yang tercepat di antara model yang dibandingkan, melayani token per satuan waktu sekitar dua kali lipat Qwen3.5 9B; pada skenario satu permintaan, prediksi multi-token dapat menambah percepatan sekitar 1,6 kali lagi. Alasannya tidak sulit ditebak: model dense 9B menghitung seluruh parameternya untuk setiap token, sedangkan Mellum2.1 hanya menggerakkan 2,5B setiap kali. Perkiraan kasar menunjukkan komputasi per tokennya sekitar tiga puluh persen dari model dense tersebut, dengan konsekuensi seluruh bobot 12B harus dimuat ke memori GPU, kira-kira 24GB dalam bfloat16.

Hal ini menentukan posisi yang cocok baginya: berjalan di mesin developer sendiri atau di jaringan internal perusahaan, menangani banyak perubahan kecil yang berulang dan pemanggilan alat, sementara refactoring kompleks lintas file tetap lebih baik diserahkan kepada model yang lebih besar. JetBrains juga menekankan di blognya bahwa deployment lokal membuat kode dan data sepenuhnya tetap berada di tangan sendiri.

Cara memakainya sekarang

Model card menyediakan perintah deployment untuk vLLM, dan Transformers serta SGLang juga bisa dipakai. Versi GGUF untuk llama.cpp, Ollama, dan LM Studio, serta kepala MTP untuk speculative decoding di vLLM, ditulis resmi sebagai "segera hadir" tanpa tanggal. Bagi kebanyakan orang yang ingin mencobanya di laptop, praktisnya perlu menunggu rilis GGUF.

Sumber: blog resmi JetBrains, model card Hugging Face (untuk memeriksa parameter arsitektur dan skor tiap evaluasi), CocoLoop; laporan teknis Mellum2 (untuk memeriksa arsitektur generasi sebelumnya).