JetBrains vừa phát hành và mở mã nguồn Mellum2.1, một mô hình nhỏ dành riêng cho các agent lập trình chạy cục bộ. Mô hình giữ kiến trúc hỗn hợp chuyên gia (MoE) của Mellum2, với tổng 12B tham số và 2,5B tham số kích hoạt, giấy phép Apache 2.0, trọng số đăng trên Hugging Face và model card ghi đây là “mô hình tư duy”.
Blog chính thức mô tả khá thẳng: mô hình có thể lần qua cả codebase, sửa tệp rồi tự kiểm tra thay đổi của mình. Thế hệ trước chưa làm được bước này, và JetBrains thừa nhận trong bài rằng Mellum2 làm việc trong kho mã chưa đạt mức họ mong muốn.
Kiến trúc giữ nguyên, thay đổi nằm ở khâu huấn luyện
Mellum2.1 và Mellum2 dùng chung một bộ khung: 28 lớp, 64 chuyên gia với 8 chuyên gia được kích hoạt mỗi lần, attention dạng GQA, cứ 4 lớp thì có 3 lớp dùng cửa sổ trượt độ dài 1024, độ dài ngữ cảnh 131072. Mọi thay đổi nằm ở giai đoạn hậu huấn luyện.
Theo JetBrains, học tăng cường từ một giai đoạn ngắn ở cuối quá trình huấn luyện trước đây đã trở thành phần chính của huấn luyện. Các tác vụ bao gồm toán, lập trình thi đấu, khoa học, gọi công cụ và kỹ thuật phần mềm. Dữ liệu trộn giữa các tập học tăng cường công khai và tác vụ do nhóm tự xây dựng; mỗi nguồn đều được lọc trước khi đưa vào huấn luyện, vì dữ liệu công khai thường có bài kiểm thử viết sai, đáp án không thể xác minh và độ khó không phù hợp.
Phần kỹ thuật phần mềm được luyện trên các kho mã thật: mô hình được cấp shell và công cụ chỉnh sửa tệp, chỉ khi kiểm thử chạy qua mới nhận phần thưởng. Nhóm đã tự xây một hạ tầng riêng cho việc này; nguyên văn trong blog là quá trình huấn luyện đã chạy “millions of sandboxed runs across thousands of environments”, tức hàng triệu lượt chạy trong sandbox trên hàng nghìn môi trường.
Điểm số tăng ở đâu
Model card đưa ra một bảng so sánh do chính nhóm đo, với các đối thủ là Mellum2 Thinking thế hệ trước, Gemma 4 E4B và Qwen3.5 9B. Mức tăng lớn nhất nằm ở các tác vụ dạng agent:
| Benchmark | Mellum2.1 | Mellum2 | Qwen3.5 9B |
|---|---|---|---|
| SWE-bench Verified | 47,0 | 2,0 | 50,0 |
| SWE-bench Pro | 28,0 | 0,0 | 38,0 |
| Terminal-Bench 2.1 | 17,4 | 0,6 | 21,7 |
| LiveCodeBench v6 | 82,0 | 69,4 | 75,4 |
| BFCL v4 | 62,3 | 49,6 | 58,5 |
Các bài đánh giá dạng agent đều dùng khung thực thi mã nguồn mở Pi v0.73.1, kèm shell và công cụ tệp, ngữ cảnh 114K, tối đa 16K token mỗi lượt. Toàn bộ điểm số do JetBrains tự chạy, hiện chưa có bên thứ ba tái lập.
Đặt cạnh Qwen3.5 9B
So với Qwen3.5 9B, đối thủ cùng tầm cỡ hay được đem ra so nhất, điểm mạnh và điểm yếu của Mellum2.1 khá rõ ràng.
Viết một hàm đơn lẻ, giải đề thi đấu, gọi công cụ thì Mellum2.1 dẫn trước: LiveCodeBench cao hơn 6,6 điểm, MBPP+ cao hơn gần 10 điểm, BFCL cao hơn khoảng 4 điểm. Làm việc liên tục trong kho mã thì nó vẫn thua: SWE-bench Verified kém 3 điểm, SWE-bench Pro kém 10 điểm, Terminal-Bench kém hơn 4 điểm. Khoảng cách về suy luận tổng quát còn lớn hơn: GPQA Diamond là 64,6 so với 77,8, AIME là 83,3 so với 86,7. Ở bài kiểm tra từ chối an toàn XSTest, mức 88,8 điểm của nó cũng thấp hơn Qwen và Gemma.
JetBrains đặt cược vào tốc độ. Blog cho biết trong bài kiểm tra tải cao trên H200, Mellum2.1 là mô hình nhanh nhất trong nhóm, số token phục vụ được trong một đơn vị thời gian xấp xỉ gấp đôi Qwen3.5 9B; với tình huống một yêu cầu đơn lẻ, dự đoán nhiều token cùng lúc có thể tăng tốc thêm khoảng 1,6 lần. Lý do không khó đoán: mô hình dày 9B phải tính toàn bộ tham số cho mỗi token, còn Mellum2.1 mỗi lần chỉ động đến 2,5B. Ước tính thô, khối lượng tính toán mỗi token của nó chỉ bằng khoảng ba phần mười mô hình kia, đổi lại toàn bộ 12B trọng số phải nằm trong VRAM, khoảng 24GB nếu tính theo bfloat16.
Điều này quyết định vị trí phù hợp của nó: chạy trên máy của lập trình viên hoặc trong mạng nội bộ công ty, đảm nhận lượng lớn các chỉnh sửa nhỏ lặp đi lặp lại và việc gọi công cụ, còn những đợt tái cấu trúc phức tạp xuyên nhiều tệp vẫn nên giao cho mô hình lớn hơn. Trong blog, JetBrains cũng nhấn mạnh rằng triển khai cục bộ giúp mã nguồn và dữ liệu hoàn toàn nằm trong tay người dùng.
Cách dùng hiện nay
Model card cung cấp lệnh triển khai bằng vLLM; Transformers và SGLang cũng chạy được. Phiên bản GGUF dành cho llama.cpp, Ollama, LM Studio, cùng đầu MTP dùng cho giải mã suy đoán trong vLLM, theo phía chính thức là “sắp ra mắt” và chưa có ngày cụ thể. Với đa số người muốn thử trên laptop, phải chờ bản GGUF xuất hiện mới thuận tiện.
Nguồn tham khảo: blog chính thức của JetBrains, model card trên Hugging Face (đối chiếu thông số kiến trúc và các điểm đánh giá), CocoLoop; báo cáo kỹ thuật Mellum2 (đối chiếu kiến trúc thế hệ trước).