JetBrains, 소형 모델 Mellum2.1 오픈소스 공개

JetBrains가 로컬 코딩 에이전트 전용 소형 모델 Mellum2.1을 공개하고 오픈소스로 풀었다. Mellum2의 혼합 전문가(MoE) 아키텍처를 그대로 쓰며, 총 파라미터는 12B, 활성 파라미터는 2.5B다. 라이선스는 Apache 2.0이고 가중치는 Hugging Face에 올라 있으며, 모델 카드에는 '사고형 모델'로 표기돼 있다.

공식 블로그의 설명은 간단명료하다. 코드베이스 안을 돌아다니고, 파일을 고치고, 자기가 바꾼 내용을 다시 점검할 수 있다는 것이다. 이전 세대는 여기까지 하지 못했다. JetBrains는 글에서 Mellum2가 저장소 안에서 일하는 수준이 목표에 미치지 못했다고 인정했다.

아키텍처는 그대로, 바뀐 것은 학습

Mellum2.1은 Mellum2와 같은 골격을 쓴다. 28개 레이어에 64개 전문가 중 매번 8개를 활성화하고, 어텐션은 GQA를 쓰며, 4개 레이어 중 3개는 길이 1,024의 슬라이딩 윈도를 적용한다. 컨텍스트 길이는 131,072다. 달라진 것은 모두 사후 학습에 있다.

JetBrains에 따르면 강화학습은 예전에는 학습 끝부분의 짧은 단계였지만 이제 학습의 중심이 됐다. 과제는 수학, 경쟁 프로그래밍, 과학, 도구 호출, 소프트웨어 엔지니어링을 아우른다. 데이터는 공개된 강화학습 데이터셋과 팀이 직접 만든 과제를 섞었고, 모든 출처는 학습에 들어가기 전에 필터링을 거쳤다. 공개 데이터에는 잘못 작성된 테스트, 검증할 수 없는 정답, 난이도가 맞지 않는 문제가 많기 때문이다.

소프트웨어 엔지니어링 부분은 실제 코드 저장소에서 훈련했다. 모델에 셸과 파일 편집 도구를 주고, 테스트가 통과해야만 보상을 준다. 팀은 이를 위해 자체 인프라를 구축했다. 블로그의 표현으로는 학습 기간 동안 'millions of sandboxed runs across thousands of environments'를 실행했다. 수천 개의 환경에서 수백만 번의 샌드박스 실행을 돌렸다는 뜻이다.

점수는 어디서 올랐나

모델 카드에는 자체 측정 비교표가 실려 있으며, 비교 대상은 이전 세대인 Mellum2 Thinking, Gemma 4 E4B, Qwen3.5 9B다. 상승 폭이 가장 큰 쪽은 에이전트형 과제다.

벤치마크Mellum2.1Mellum2Qwen3.5 9B
SWE-bench Verified47.02.050.0
SWE-bench Pro28.00.038.0
Terminal-Bench 2.117.40.621.7
LiveCodeBench v682.069.475.4
BFCL v462.349.658.5

에이전트형 평가는 모두 오픈소스인 Pi v0.73.1을 실행 프레임워크로 쓰고, 셸과 파일 도구를 붙였으며, 컨텍스트는 114K, 한 턴당 최대 16K 토큰으로 설정했다. 모든 점수는 JetBrains가 직접 측정한 것이며, 아직 제3자가 재현한 결과는 없다.

Qwen3.5 9B와 나란히 놓고 보면

같은 규모에서 가장 자주 비교 대상이 되는 Qwen3.5 9B와 견주면 Mellum2.1의 강점과 약점이 뚜렷하다.

함수 하나 작성, 경쟁 문제 풀이, 도구 호출에서는 Mellum2.1이 앞선다. LiveCodeBench는 6.6점, MBPP+는 10점 가까이, BFCL은 약 4점 높다. 저장소 안에서 연속으로 작업하는 능력에서는 아직 뒤진다. SWE-bench Verified는 3점, SWE-bench Pro는 10점, Terminal-Bench는 4점 남짓 낮다. 일반 추론 격차는 더 커서 GPQA Diamond는 64.6 대 77.8, AIME는 83.3 대 86.7이다. 안전 거부 응답을 보는 XSTest에서도 88.8점으로 Qwen과 Gemma보다 낮다.

JetBrains가 건 것은 속도다. 블로그에 따르면 H200의 고부하 테스트에서 Mellum2.1은 비교한 모델 중 가장 빨랐고, 단위 시간당 처리하는 토큰 수는 Qwen3.5 9B의 약 두 배였다. 단일 요청 상황에서는 멀티 토큰 예측으로 약 1.6배 더 빨라진다. 이유는 어렵지 않다. 9B 덴스 모델은 토큰마다 전체 파라미터를 계산하지만, Mellum2.1은 매번 2.5B만 움직인다. 대략 계산하면 토큰당 연산량은 전자의 약 30% 수준이며, 그 대가로 12B 가중치 전체를 GPU 메모리에 올려야 한다. bfloat16 기준으로 약 24GB로 추산된다.

이 특성이 적합한 자리를 정한다. 개발자 본인의 컴퓨터나 회사 내부망에서 반복적인 작은 수정과 도구 호출을 대량으로 맡는 역할이다. 여러 파일에 걸친 복잡한 리팩터링은 여전히 더 큰 모델에 맡기는 편이 낫다. JetBrains도 블로그에서 로컬 배포를 하면 코드와 데이터를 완전히 자기 손에 둘 수 있다고 강조했다.

지금 쓰는 방법

모델 카드에는 vLLM 배포 명령이 있고, Transformers와 SGLang으로도 실행할 수 있다. llama.cpp, Ollama, LM Studio용 GGUF 버전과 vLLM에서 추측 디코딩에 쓰는 MTP 헤드는 공식적으로 '곧 공개'라고만 적혀 있고 날짜는 없다. 노트북에서 시험해 보려는 대부분의 사용자는 GGUF 버전이 나올 때까지 기다려야 편하다.

참고 출처: JetBrains 공식 블로그, Hugging Face 모델 카드(아키텍처 파라미터와 각 벤치마크 점수 확인), CocoLoop, Mellum2 기술 보고서(이전 세대 아키텍처 확인).