3월 16일, Mistral이 Small 4를 발표했습니다. 평범해 보이는 이름 뒤에는 실용적인 제품 아이디어가 숨어 있습니다. MoE 아키텍처를 활용해 기존의 세 가지 독립 모델을 하나로 통합, 단일 배포로 모든 시나리오를 처리할 수 있게 한 것입니다.
하나의 모델, 세 가지 용도
Mistral은 이전에 각각 다른 역할을 하는 세 가지 모델을 보유하고 있었습니다:
- Magistral: 추론이 필요한 복잡한 작업 전용
- Pixtral: 멀티모달 이미지 이해 담당
- Devstral: 코드 생성 및 개발 전용
이 세 모델을 모두 사용하려면 세 가지 배포, 세 가지 스케줄링 로직, 세 배의 운영 비용이 필요했습니다. Small 4는 이들을 직접 통합했습니다.
하나의 모델이 텍스트 추론, 이미지 이해, 코드 생성, 함수 호출, JSON 출력을 동시에 지원하며, 256K 컨텍스트 윈도우를 제공합니다.
MoE의 핵심 로직: 크지만 비싸지 않다
Small 4의 파라미터 구성은 매우 대표적입니다:
| 지표 | 값 |
|---|---|
| 총 파라미터 수 | 119B |
| 전문가(Expert) 수 | 128개 |
| 추론당 활성화되는 전문가 수 | 4개 |
| 실제 활성화 파라미터 수 | 6.5B |
| 컨텍스트 윈도우 | 256K |
119B는 겉보기에 압도적이지만, 각 추론에서 실제로 사용되는 파라미터는 6.5B에 불과합니다. 이것이 MoE 아키텍처의 핵심 가치입니다: 모델은 더 많은 것을 알고 있지만, 계산할 때는 극히 일부만 사용합니다. 추론 비용은 6.5B 밀집(dense) 모델에 가깝지만, 능력 범위는 훨씬 더 넓습니다.
Small 3와 비교하면 엔드투엔드 지연 시간이 40% 감소했고, 초당 처리 가능한 요청 수는 3배 증가했습니다.
이 로직은 DeepSeek V3 및 Qwen3와 같은 방식을 따릅니다: 더 큰 전체 파라미터로 놀라게 하는 것이 아니라, 희소 활성화를 통해 효율성과 능력 사이의 균형을 찾는 것입니다.
reasoning_effort: 주문형 추론 능력
이번 제품 디자인의 실용적인 포인트입니다.
이전에는 빠른 응답 모델과 느린 추론 모델 사이에서 선택해야 했고, 종종 두 개의 다른 모델을 배포하여 구현했습니다. Small 4는 API 요청 수준에서 직접 제어할 수 있는 파라미터를 추가했습니다: 이번 요청에서 추론 능력을 사용할지, 얼마나 사용할지 지정할 수 있습니다.
간단한 질문에는 빠른 답변을, 복잡한 질문에는 더 많은 사고 시간을 제공합니다—동일한 모델, 동일한 API, 전환 불필요. 이 디자인은 엔지니어링 팀의 많은 수고를 덜어줄 수 있습니다.
오픈소스 라이선스 및 이용 가능 채널
Mistral은 이번에도 Apache 2.0 라이선스로 출시했으며, 상업적 사용에 제한이 없고 가중치를 다운로드하여 자체 배포할 수 있습니다.
현재 이용 가능한 곳:
- Mistral API 및 AI Studio
- Hugging Face (전체 가중치 다운로드)
- NVIDIA build.nvidia.com (무료 프로토타입 테스트)
- NVIDIA NIM 컨테이너 (프로덕션 배포)
Apache 2.0은 기업에게 가장 깨끗한 라이선스입니다—사용 제한이 없고, 수정도 가능하며, 배포에도 문제가 없습니다.
오픈소스 대형 모델 트렌드 속에서
지난 2년간 오픈소스 대형 모델의 경쟁 구도는 빠르게 변화했습니다. DeepSeek V3는 MoE와 저비용 학습으로 클로즈드소스 모델의 해자를 허물었고, 알리바바의 Qwen3는 Apache 라이선스로局面을 열었으며, Meta의 Llama 4도 4월에 MoE 버전을 출시했습니다.
Mistral의 Small 4도 비슷한 경로를 따릅니다: 119B 총량, 6.5B 활성화, Apache 라이선스, 추론, 멀티모달, 코드를 모두 하나의 배포 유닛에 패키징. 2년 전만 해도 이 구성은 최고급 클로즈드소스 모델에만 있었지만, 지금은 무료로 다운로드할 수 있습니다.
프로덕션 환경에서 AI 기능을 자체 구축하려는 팀에게 오픈소스 모델의 선택은 '임시방편'에서 '진지한 고려'로 바뀌고 있습니다. Small 4가 이 옵션 풀에 추가되는 주요 가치는 배포 복잡성을 줄이는 것입니다—세 가지 모델을 동시에 유지할 필요 없이 하나면 충분합니다.
특정 시나리오에 적합한지 여부는 벤치마크를 실행하여 확인해야 합니다. Mistral은 공식적으로 중국어 지원이 영어만큼 강력하지 않다고 밝히고 있으며, 국내 팀은 이를 별도로 평가해야 합니다.
참고 출처: CocoLoop, 119B Parameters, 6.5B Activated: Mistral Small 4 Collapses Three Open Models Into One (BaristaLabs Blog); Mistral AI Releases Mistral Small 4 (MarkTechPost)