Mellum2.1 開源,小模型學會改程式庫

JetBrains 發表並開源了 Mellum2.1,這是一款專為本地端程式設計代理打造的小模型。它沿用 Mellum2 的混合專家架構,總參數 12B、啟用參數 2.5B,授權為 Apache 2.0,權重放在 Hugging Face,模型卡標示為「思考型模型」。

官方部落格對它的描述很直接:能在程式庫裡四處查看、修改檔案,再檢查自己的改動。上一代做不到這一步,JetBrains 在文中承認 Mellum2 在儲存庫裡的作業表現沒有達到他們期望的水準。

架構沒變,改的是訓練

Mellum2.1 與 Mellum2 使用同一套骨架:28 層,64 個專家每次啟用 8 個,注意力採用 GQA,每 4 層中有 3 層使用 1024 長度的滑動視窗,上下文長度為 131072。所有變動都在後訓練階段。

依 JetBrains 的說法,強化學習從過去訓練尾端的一個短階段,變成了訓練的主體。任務涵蓋數學、競賽程式設計、科學、工具呼叫與軟體工程,資料混合了公開的強化學習資料集與團隊自建的任務,每個來源在進入訓練前都經過過濾,因為公開資料裡常有寫錯的測試、無法驗證的答案和難度不合適的題目。

軟體工程的部分是在真實程式碼儲存庫裡練出來的:模型拿到 shell 和檔案編輯工具,測試跑通才給獎勵。團隊為此自建了一套基礎設施,部落格的原話是訓練期間執行了「millions of sandboxed runs across thousands of environments」,也就是在數千個環境裡啟動了數百萬次沙盒執行。

分數漲在哪裡

模型卡提供了一張自行測試的對照表,對手是上一代 Mellum2 Thinking、Gemma 4 E4B 和 Qwen3.5 9B。漲幅最大的是代理類任務:

基準測試Mellum2.1Mellum2Qwen3.5 9B
SWE-bench Verified47.02.050.0
SWE-bench Pro28.00.038.0
Terminal-Bench 2.117.40.621.7
LiveCodeBench v682.069.475.4
BFCL v462.349.658.5

代理類評測統一使用開源的 Pi v0.73.1 作為執行框架,搭配 shell 與檔案工具,上下文設為 114K,每輪最多 16K token。所有分數都是 JetBrains 自己跑出來的,目前沒有第三方重現。

和 Qwen3.5 9B 放在一起看

拿同量級中最常被拿來比較的 Qwen3.5 9B 對照,Mellum2.1 的長處與短處都很清楚。

撰寫單一函式、解競賽題、呼叫工具,Mellum2.1 領先:LiveCodeBench 高 6.6 分,MBPP+ 高近 10 分,BFCL 高約 4 分。在儲存庫裡連續作業,它還落後:SWE-bench Verified 差 3 分,SWE-bench Pro 差 10 分,Terminal-Bench 差 4 分多。通用推理的差距更大,GPQA Diamond 是 64.6 對 77.8,AIME 是 83.3 對 86.7。在安全拒答類測試 XSTest 上,它的 88.8 分也低於 Qwen 和 Gemma。

JetBrains 押注的是速度。部落格稱,在 H200 上的高負載測試中,Mellum2.1 是這組模型裡最快的,單位時間能服務的 token 大約是 Qwen3.5 9B 的兩倍;單一請求情境下,多 token 預測還能再提速約 1.6 倍。原因不難推想:9B 稠密模型每個 token 都要運算全部參數,Mellum2.1 每次只動用 2.5B。粗略估算,它每個 token 的運算量約為前者的三成,代價是 12B 權重都得放進顯示記憶體,以 bfloat16 估算約 24GB。

這決定了它適合的位置:在開發者自己的電腦或公司內網裡,負責大量重複的小改動與工具呼叫,複雜的跨檔案重構還是交給更大的模型。JetBrains 在部落格中也強調,本地端部署能讓程式碼與資料完全留在自己手裡。

現在可以怎麼用

模型卡提供了 vLLM 的部署指令,Transformers 和 SGLang 也能執行。供 llama.cpp、Ollama、LM Studio 使用的 GGUF 版本,以及 vLLM 中用於推測式解碼的 MTP 頭,官方寫的是「即將推出」,目前沒有日期。對多數想在筆電上試用的人來說,要等 GGUF 推出才方便。

參考來源:JetBrains 官方部落格、Hugging Face 模型卡(核對架構參數與各項評測分數)、CocoLoop;Mellum2 技術報告(核對上一代架構)。