JetBrainsは、ローカルで動くコーディングエージェント向けの小型モデルMellum2.1を公開し、オープンソース化した。Mellum2から続くMixture of Experts(MoE)アーキテクチャを採用し、総パラメータ数は12B、アクティブパラメータ数は2.5B。ライセンスはApache 2.0で、重みはHugging Faceに置かれ、モデルカードでは「思考型モデル」と記されている。
公式ブログによる位置づけは明快だ。コードベースの中を動き回り、ファイルを書き換え、自分の変更を検証できること。前世代にはそれができなかった。JetBrainsはブログの中で、Mellum2はリポジトリ内での作業において目標とする水準に届かなかったと認めている。
アーキテクチャは据え置き、変わったのは学習
Mellum2.1の骨格はMellum2と同じだ。28層、64のエキスパートのうち毎回8つを活性化し、アテンションにはGQAを使い、4層のうち3層で長さ1,024のスライディングウィンドウを採用、コンテキスト長は131,072。変更はすべてポストトレーニングにある。
JetBrainsによると、強化学習は、従来の学習末尾の短い段階から、学習の主体へと変わった。対象タスクは数学、競技プログラミング、科学、ツール呼び出し、ソフトウェアエンジニアリングにわたる。データは公開の強化学習データセットとチーム自作のタスクを混ぜたもので、どの出典も学習に入れる前にフィルタリングしている。公開データには、誤ったテスト、検証できない解答、難易度の合わない問題が多いためだという。
ソフトウェアエンジニアリングの部分は実際のコードリポジトリで鍛えられた。モデルにはシェルとファイル編集ツールが与えられ、テストが通ったときだけ報酬が出る。チームはこのために専用のインフラを構築した。ブログの原文では、学習期間中に「millions of sandboxed runs across thousands of environments」を実行したとされる。つまり、数千の環境で数百万回のサンドボックス実行を行ったということだ。
スコアはどこで伸びたか
モデルカードには自社測定の比較表があり、比較対象は前世代のMellum2 Thinking、Gemma 4 E4B、Qwen3.5 9Bだ。伸びが最も大きいのはエージェント系のタスクである。
| ベンチマーク | Mellum2.1 | Mellum2 | Qwen3.5 9B |
|---|---|---|---|
| SWE-bench Verified | 47.0 | 2.0 | 50.0 |
| SWE-bench Pro | 28.0 | 0.0 | 38.0 |
| Terminal-Bench 2.1 | 17.4 | 0.6 | 21.7 |
| LiveCodeBench v6 | 82.0 | 69.4 | 75.4 |
| BFCL v4 | 62.3 | 49.6 | 58.5 |
エージェント系の評価では、実行フレームワークにオープンソースのPi v0.73.1を共通で使い、シェルとファイルツールを組み合わせ、コンテキストは114K、1ターンあたり最大16Kトークンとしている。スコアはすべてJetBrains自身が測定したもので、現時点で第三者による再現は出ていない。
Qwen3.5 9Bと並べて見る
同クラスで最も比較対象にされやすいQwen3.5 9Bと比べると、Mellum2.1の得意と不得意ははっきりしている。
単一の関数の記述、競技問題、ツール呼び出しではMellum2.1が上回る。LiveCodeBenchは6.6ポイント、MBPP+は10ポイント近く、BFCLは約4ポイント高い。リポジトリ内で連続して作業する場面ではまだ後れを取る。SWE-bench Verifiedで3ポイント、SWE-bench Proで10ポイント、Terminal-Benchで4ポイント強の差がある。一般的な推論力の差はさらに大きく、GPQA Diamondは64.6対77.8、AIMEは83.3対86.7だ。安全面の拒否応答を測るXSTestでも、88.8というスコアはQwenとGemmaの両方より低い。
JetBrainsが賭けているのは速度だ。ブログによると、H200での高負荷テストでMellum2.1は比較したモデルの中で最速で、単位時間あたりに処理できるトークン数はQwen3.5 9Bのおよそ2倍。単一リクエストでは、マルチトークン予測によってさらに約1.6倍の高速化が見込める。理由は難しくない。9Bの密モデルはトークンごとに全パラメータを計算するが、Mellum2.1は毎回2.5Bしか動かさない。概算では、1トークンあたりの計算量は前者の約3割にとどまる。代わりに12B分の重みをすべてVRAMに載せる必要があり、bfloat16では約24GBと見積もられる。
このことが適した使いどころを決める。開発者自身のマシンや社内ネットワークで、繰り返しの多い小さな修正やツール呼び出しを大量にこなす役割だ。複数ファイルにまたがる複雑なリファクタリングは、依然としてより大きなモデルに任せるほうがよい。JetBrainsもブログで、ローカル展開ならコードとデータを完全に手元に置けると強調している。
今すぐ使うには
モデルカードにはvLLMのデプロイコマンドが載っており、TransformersとSGLangでも動かせる。llama.cpp、Ollama、LM Studio向けのGGUF版と、vLLMで投機的デコーディングに使うMTPヘッドは、公式では「近日公開」とされているが、日付は示されていない。ノートPCで試したい人の多くにとっては、GGUF版の公開を待つのが現実的だ。
参考資料:JetBrains公式ブログ、Hugging Faceモデルカード(アーキテクチャのパラメータと各ベンチマークのスコアを確認)、CocoLoop、Mellum2技術レポート(前世代のアーキテクチャを確認)。