JetBrains hat Mellum2.1 veröffentlicht und als Open Source freigegeben, ein kleines Modell speziell für lokal laufende Coding-Agenten. Es übernimmt die Mixture-of-Experts-Architektur von Mellum2 mit insgesamt 12B und 2,5B aktiven Parametern. Die Lizenz ist Apache 2.0, die Gewichte liegen auf Hugging Face, und die Model Card führt es als „Denkmodell“ (Thinking Model).
Der offizielle Blog beschreibt den Anspruch ziemlich offen: Das Modell soll sich in einer Codebasis umsehen, Dateien ändern und die eigenen Änderungen anschließend prüfen können. Der Vorgänger konnte das nicht, und JetBrains räumt in dem Beitrag ein, dass Mellum2 bei der Arbeit in Repositories nicht das gewünschte Niveau erreichte.
Architektur unverändert, geändert hat sich das Training
Mellum2.1 und Mellum2 teilen sich dasselbe Grundgerüst: 28 Schichten, 64 Experten, von denen jeweils 8 aktiviert werden, GQA-Attention, wobei in 3 von 4 Schichten ein Sliding Window von 1024 Tokens genutzt wird, und eine Kontextlänge von 131072. Alle Änderungen liegen im Post-Training.
Laut JetBrains ist Reinforcement Learning von einer kurzen Phase am Ende des Trainings zum Hauptbestandteil geworden. Die Aufgaben decken Mathematik, Wettbewerbsprogrammierung, Naturwissenschaften, Tool-Aufrufe und Softwareentwicklung ab. Die Daten mischen öffentliche Reinforcement-Learning-Datensätze mit selbst erstellten Aufgaben des Teams. Jede Quelle wurde vor dem Training gefiltert, weil öffentliche Daten häufig fehlerhafte Tests, nicht überprüfbare Antworten und unpassende Schwierigkeitsgrade enthalten.
Der Teil zur Softwareentwicklung wurde in echten Code-Repositories trainiert: Das Modell erhält eine Shell und Werkzeuge zum Bearbeiten von Dateien und bekommt nur dann eine Belohnung, wenn die Tests durchlaufen. Dafür hat das Team eine eigene Infrastruktur aufgebaut. Im Blog heißt es wörtlich, im Training seien „millions of sandboxed runs across thousands of environments“ gelaufen, also Millionen von Sandbox-Läufen in Tausenden von Umgebungen.
Wo die Werte zulegen
Die Model Card enthält eine selbst erhobene Vergleichstabelle mit dem Vorgänger Mellum2 Thinking, Gemma 4 E4B und Qwen3.5 9B als Gegenspielern. Den größten Sprung gibt es bei Agenten-Aufgaben:
| Benchmark | Mellum2.1 | Mellum2 | Qwen3.5 9B |
|---|---|---|---|
| SWE-bench Verified | 47,0 | 2,0 | 50,0 |
| SWE-bench Pro | 28,0 | 0,0 | 38,0 |
| Terminal-Bench 2.1 | 17,4 | 0,6 | 21,7 |
| LiveCodeBench v6 | 82,0 | 69,4 | 75,4 |
| BFCL v4 | 62,3 | 49,6 | 58,5 |
Alle Agenten-Tests nutzen das quelloffene Framework Pi v0.73.1 als Ausführungsumgebung, ausgestattet mit Shell- und Dateiwerkzeugen, 114K Kontext und höchstens 16K Token pro Runde. Sämtliche Werte hat JetBrains selbst ermittelt; unabhängige Reproduktionen gibt es bislang nicht.
Im Vergleich mit Qwen3.5 9B
Stellt man Mellum2.1 neben Qwen3.5 9B, das in dieser Größenklasse am häufigsten als Vergleich herangezogen wird, sind Stärken und Schwächen klar erkennbar.
Bei einzelnen Funktionen, Wettbewerbsaufgaben und Tool-Aufrufen liegt Mellum2.1 vorn: 6,6 Punkte mehr bei LiveCodeBench, knapp 10 Punkte mehr bei MBPP+, rund 4 Punkte mehr bei BFCL. Bei durchgehender Arbeit im Repository liegt es noch zurück: 3 Punkte weniger bei SWE-bench Verified, 10 Punkte weniger bei SWE-bench Pro, gut 4 Punkte weniger bei Terminal-Bench. Beim allgemeinen Schlussfolgern ist der Abstand größer: GPQA Diamond 64,6 gegenüber 77,8, AIME 83,3 gegenüber 86,7. Auch beim Sicherheitstest XSTest zur Verweigerung liegt es mit 88,8 Punkten unter Qwen und Gemma.
JetBrains setzt auf Geschwindigkeit. Laut Blog war Mellum2.1 in einem Hochlasttest auf der H200 das schnellste Modell der Gruppe und bediente pro Zeiteinheit etwa doppelt so viele Token wie Qwen3.5 9B. Bei Einzelanfragen soll Multi-Token-Prediction die Geschwindigkeit um etwa das 1,6-Fache erhöhen. Der Grund ist leicht nachvollziehbar: Ein dichtes 9B-Modell rechnet für jedes Token mit allen Parametern, Mellum2.1 berührt jeweils nur 2,5B. Grob geschätzt liegt der Rechenaufwand pro Token bei etwa drei Zehnteln. Der Preis dafür ist, dass alle 12B Gewichte im Grafikspeicher liegen müssen, bei bfloat16 geschätzt rund 24GB.
Das bestimmt seinen Einsatzort: auf dem eigenen Rechner des Entwicklers oder im Firmennetz, wo es viele wiederkehrende kleine Änderungen und Tool-Aufrufe übernimmt, während komplexe Refactorings über mehrere Dateien hinweg weiter größeren Modellen überlassen bleiben. JetBrains betont im Blog zudem, dass Code und Daten bei lokalem Betrieb vollständig in der eigenen Hand bleiben.
So lässt es sich derzeit nutzen
Die Model Card liefert einen Deployment-Befehl für vLLM; auch mit Transformers und SGLang läuft das Modell. GGUF-Versionen für llama.cpp, Ollama und LM Studio sowie die MTP-Köpfe für spekulatives Decoding in vLLM sind laut offizieller Angabe „bald verfügbar“, ein Termin steht noch nicht fest. Für die meisten, die es auf dem Notebook ausprobieren wollen, ist es erst mit den GGUF-Dateien wirklich praktikabel.
Quellen: Offizieller JetBrains-Blog, Hugging-Face-Model-Card zum Abgleich der Architekturparameter und aller Benchmark-Werte, CocoLoop; technischer Bericht zu Mellum2 zum Abgleich der Vorgängerarchitektur.