JetBrains ha lanzado y liberado en código abierto Mellum2.1, un modelo pequeño pensado para agentes de programación que se ejecutan en local. Conserva la arquitectura de mezcla de expertos (MoE) de Mellum2, con 12B de parámetros totales y 2,5B activos, licencia Apache 2.0, pesos en Hugging Face y, según la ficha del modelo, la etiqueta de “modelo de razonamiento” (thinking model).
El blog oficial lo describe sin rodeos: puede moverse por un repositorio de código, modificar archivos y comprobar después sus propios cambios. La generación anterior no llegaba a tanto, y JetBrains admite en el texto que Mellum2 no alcanzó el nivel que buscaban al trabajar dentro de repositorios.
La arquitectura no cambia, lo que cambia es el entrenamiento
Mellum2.1 y Mellum2 comparten el mismo esqueleto: 28 capas, 64 expertos con 8 activados cada vez, atención GQA, ventana deslizante de 1024 en 3 de cada 4 capas y una longitud de contexto de 131072. Todo el cambio está en el posentrenamiento.
Según JetBrains, el aprendizaje por refuerzo ha pasado de ser una fase breve al final del entrenamiento a ser su parte principal. Las tareas abarcan matemáticas, programación competitiva, ciencia, llamadas a herramientas e ingeniería de software. Los datos mezclan conjuntos públicos de aprendizaje por refuerzo con tareas creadas por el propio equipo, y cada fuente se filtró antes de entrar en el entrenamiento, porque los datos públicos suelen traer pruebas mal escritas, respuestas imposibles de verificar y una dificultad inadecuada.
La parte de ingeniería de software se entrenó en repositorios de código reales: el modelo recibe una shell y herramientas de edición de archivos, y solo obtiene recompensa si las pruebas pasan. El equipo montó una infraestructura propia para ello; en palabras literales del blog, durante el entrenamiento se ejecutaron “millions of sandboxed runs across thousands of environments”, es decir, millones de ejecuciones en sandbox repartidas en miles de entornos.
Dónde suben las puntuaciones
La ficha del modelo ofrece una tabla comparativa medida por el propio equipo, con la generación anterior Mellum2 Thinking, Gemma 4 E4B y Qwen3.5 9B como rivales. El mayor avance está en las tareas de agente:
| Benchmark | Mellum2.1 | Mellum2 | Qwen3.5 9B |
|---|---|---|---|
| SWE-bench Verified | 47,0 | 2,0 | 50,0 |
| SWE-bench Pro | 28,0 | 0,0 | 38,0 |
| Terminal-Bench 2.1 | 17,4 | 0,6 | 21,7 |
| LiveCodeBench v6 | 82,0 | 69,4 | 75,4 |
| BFCL v4 | 62,3 | 49,6 | 58,5 |
Las evaluaciones de agente usan de forma homogénea el marco de ejecución de código abierto Pi v0.73.1, con herramientas de shell y de archivos, 114K de contexto y un máximo de 16K tokens por turno. Todas las puntuaciones las obtuvo JetBrains por su cuenta y, por ahora, no hay reproducciones de terceros.
Frente a Qwen3.5 9B
Si se compara con Qwen3.5 9B, el modelo del mismo tamaño que más se usa como referencia, los puntos fuertes y débiles de Mellum2.1 quedan muy claros.
Escribir una función suelta, resolver problemas de competición y llamar a herramientas: aquí Mellum2.1 va por delante, con 6,6 puntos más en LiveCodeBench, casi 10 más en MBPP+ y unos 4 más en BFCL. Trabajar de forma continuada dentro de un repositorio: aquí todavía queda atrás, con 3 puntos menos en SWE-bench Verified, 10 menos en SWE-bench Pro y algo más de 4 menos en Terminal-Bench. La brecha en razonamiento general es mayor: 64,6 frente a 77,8 en GPQA Diamond y 83,3 frente a 86,7 en AIME. En XSTest, la prueba de rechazo por seguridad, sus 88,8 puntos también quedan por debajo de Qwen y Gemma.
JetBrains apuesta por la velocidad. El blog afirma que, en una prueba de alta carga sobre H200, Mellum2.1 fue el más rápido del grupo, con un caudal de tokens por unidad de tiempo de aproximadamente el doble que Qwen3.5 9B; en el caso de una única petición, la predicción de varios tokens puede acelerarlo otro 1,6 veces aproximadamente. La razón no es difícil de intuir: un modelo denso de 9B calcula todos sus parámetros para cada token, mientras que Mellum2.1 solo mueve 2,5B cada vez. En un cálculo aproximado, su cómputo por token ronda el treinta por ciento del otro, a cambio de que los 12B de pesos deban caber en la memoria de vídeo, unos 24GB estimados en bfloat16.
Eso define su lugar: en la máquina del propio desarrollador o en la red interna de la empresa, encargándose de un gran volumen de pequeños cambios repetitivos y de llamadas a herramientas, mientras que las refactorizaciones complejas entre varios archivos se dejan a modelos más grandes. JetBrains también subraya en el blog que el despliegue local permite que el código y los datos queden por completo en manos del usuario.
Cómo usarlo ahora
La ficha del modelo incluye el comando de despliegue con vLLM, y también funciona con Transformers y SGLang. Las versiones GGUF para llama.cpp, Ollama y LM Studio, así como los cabezales MTP para decodificación especulativa en vLLM, figuran oficialmente como “próximamente”, sin fecha por ahora. Para la mayoría de quienes quieran probarlo en un portátil, habrá que esperar a que salga el GGUF para que resulte cómodo.
Fuentes: blog oficial de JetBrains, ficha del modelo en Hugging Face (contraste de parámetros de arquitectura y puntuaciones), CocoLoop; informe técnico de Mellum2 (contraste de la arquitectura de la generación anterior).