JetBrains 發表並開源了 Mellum2.1,這是一款專為本地端程式設計代理打造的小模型。它沿用 Mellum2 的混合專家架構,總參數 12B、啟用參數 2.5B,授權為 Apache 2.0,權重放在 Hugging Face,模型卡標示為「思考型模型」。
官方部落格對它的描述很直接:能在程式庫裡四處查看、修改檔案,再檢查自己的改動。上一代做不到這一步,JetBrains 在文中承認 Mellum2 在儲存庫裡的作業表現沒有達到他們期望的水準。
架構沒變,改的是訓練
Mellum2.1 與 Mellum2 使用同一套骨架:28 層,64 個專家每次啟用 8 個,注意力採用 GQA,每 4 層中有 3 層使用 1024 長度的滑動視窗,上下文長度為 131072。所有變動都在後訓練階段。
依 JetBrains 的說法,強化學習從過去訓練尾端的一個短階段,變成了訓練的主體。任務涵蓋數學、競賽程式設計、科學、工具呼叫與軟體工程,資料混合了公開的強化學習資料集與團隊自建的任務,每個來源在進入訓練前都經過過濾,因為公開資料裡常有寫錯的測試、無法驗證的答案和難度不合適的題目。
軟體工程的部分是在真實程式碼儲存庫裡練出來的:模型拿到 shell 和檔案編輯工具,測試跑通才給獎勵。團隊為此自建了一套基礎設施,部落格的原話是訓練期間執行了「millions of sandboxed runs across thousands of environments」,也就是在數千個環境裡啟動了數百萬次沙盒執行。
分數漲在哪裡
模型卡提供了一張自行測試的對照表,對手是上一代 Mellum2 Thinking、Gemma 4 E4B 和 Qwen3.5 9B。漲幅最大的是代理類任務:
| 基準測試 | Mellum2.1 | Mellum2 | Qwen3.5 9B |
|---|---|---|---|
| SWE-bench Verified | 47.0 | 2.0 | 50.0 |
| SWE-bench Pro | 28.0 | 0.0 | 38.0 |
| Terminal-Bench 2.1 | 17.4 | 0.6 | 21.7 |
| LiveCodeBench v6 | 82.0 | 69.4 | 75.4 |
| BFCL v4 | 62.3 | 49.6 | 58.5 |
代理類評測統一使用開源的 Pi v0.73.1 作為執行框架,搭配 shell 與檔案工具,上下文設為 114K,每輪最多 16K token。所有分數都是 JetBrains 自己跑出來的,目前沒有第三方重現。
和 Qwen3.5 9B 放在一起看
拿同量級中最常被拿來比較的 Qwen3.5 9B 對照,Mellum2.1 的長處與短處都很清楚。
撰寫單一函式、解競賽題、呼叫工具,Mellum2.1 領先:LiveCodeBench 高 6.6 分,MBPP+ 高近 10 分,BFCL 高約 4 分。在儲存庫裡連續作業,它還落後:SWE-bench Verified 差 3 分,SWE-bench Pro 差 10 分,Terminal-Bench 差 4 分多。通用推理的差距更大,GPQA Diamond 是 64.6 對 77.8,AIME 是 83.3 對 86.7。在安全拒答類測試 XSTest 上,它的 88.8 分也低於 Qwen 和 Gemma。
JetBrains 押注的是速度。部落格稱,在 H200 上的高負載測試中,Mellum2.1 是這組模型裡最快的,單位時間能服務的 token 大約是 Qwen3.5 9B 的兩倍;單一請求情境下,多 token 預測還能再提速約 1.6 倍。原因不難推想:9B 稠密模型每個 token 都要運算全部參數,Mellum2.1 每次只動用 2.5B。粗略估算,它每個 token 的運算量約為前者的三成,代價是 12B 權重都得放進顯示記憶體,以 bfloat16 估算約 24GB。
這決定了它適合的位置:在開發者自己的電腦或公司內網裡,負責大量重複的小改動與工具呼叫,複雜的跨檔案重構還是交給更大的模型。JetBrains 在部落格中也強調,本地端部署能讓程式碼與資料完全留在自己手裡。
現在可以怎麼用
模型卡提供了 vLLM 的部署指令,Transformers 和 SGLang 也能執行。供 llama.cpp、Ollama、LM Studio 使用的 GGUF 版本,以及 vLLM 中用於推測式解碼的 MTP 頭,官方寫的是「即將推出」,目前沒有日期。對多數想在筆電上試用的人來說,要等 GGUF 推出才方便。
參考來源:JetBrains 官方部落格、Hugging Face 模型卡(核對架構參數與各項評測分數)、CocoLoop;Mellum2 技術報告(核對上一代架構)。