프랑스 AI 기업 Mistral이 10월 6일 Mistral Large 4의 리서치 프리뷰 버전을 공개했다. 회사는 이 모델에 "le Chonk(덩치 큰 녀석)"라는 애칭을 붙였다. 네이티브 멀티모달 구조의 MoE(혼합 전문가) 모델로, 총 파라미터는 1조 개, 토큰당 활성화 파라미터는 약 490억 개, 컨텍스트 윈도우는 512K다. 텍스트와 이미지 입력, 텍스트 출력을 지원한다.
프리뷰 버전은 현재 Mistral API를 통해 제공되며, 개발자와 보안 담당자, 정부 기관에 우선 개방된다. 회사는 이달 말 접근 범위를 넓히고 10월 말 오픈 웨이트를 공개할 계획이다.
학습과 포지셔닝
Mistral 공식 블로그에 따르면 Large 4는 유럽에 있는 자체 데이터센터에서 처음부터 학습됐으며, 약 3800개의 Nvidia Grace Blackwell GPU가 사용됐다. CNBC 보도에 따르면 학습 기간은 약 2개월이었다. Mistral은 이 모델의 강점으로 사이버보안, 코딩, 제조, 금융, 멀티모달 작업을 꼽았다.
Mistral은 Large 4가 "중국을 제외하면 가장 강력한 오픈 웨이트 모델이며, 그 격차도 크다"고 주장한다. 반면 CNBC 보도에 따르면 Mistral은 코딩 등 일부 영역에서는 여전히 최상위 클로즈드 모델에 못 미친다는 점을 인정했다.
API에는 none과 high 두 가지 추론 모드가 있다. 개발자 Simon Willison이 직접 테스트한 결과, high 모드가 오히려 토큰을 더 적게 생성했다. 평균 2717개로, none 모드의 3275개보다 적었고 결과물의 품질도 high 모드가 더 나았다. 그의 종합적인 평가는 Large 4가 최전선보다 대략 반년 정도 뒤처져 있다는 것이다.
제3자 평가
독립 평가기관 Artificial Analysis가 매긴 Intelligence Index는 38점이다. 나란히 놓고 보면:
| 모델 | Intelligence Index |
|---|---|
| DeepSeek V4.1 Flash | 39 |
| Mistral Large 4 | 38 |
| GPT-6 Luna(max) | 38 |
| Mistral Large 3 | 9 |
두 세대 사이의 점수 차는 29점에 달하며, 이전 모델 Large 3의 9점은 이 표에서 눈에 띄게 낮은 자리를 차지한다. Artificial Analysis는 이를 근거로 Large 4를 "미국과 중국을 제외하면 가장 지능이 높은 모델"이라고 평가했다. 같은 기관의 사이버보안 지수에서는 50점을 받았지만, 문서 추론 테스트(GDP.pdf) 통과율은 19%에 불과해 이 부분은 뚜렷한 약점으로 꼽힌다.
비용 계산
프리뷰 버전 API 가격은 입력 토큰 100만 개당 1.36달러, 출력은 4.18달러이며, 캐시 적중 입력은 100만 개당 0.14달러다. 출시 후 첫 2주는 50% 할인된다. Artificial Analysis가 자체 작업 세트로 환산한 결과 작업당 비용은 1.13달러, 할인 기간에는 0.57달러다.
흔한 시나리오로 대략 계산해보면, 100만 토큰 분량의 코드베이스나 문서를 입력하고 20만 토큰의 결과물을 받는 경우 정가 기준 약 2.2달러, 할인 기간에는 약 1.1달러가 든다. 출력 단가는 입력의 약 3배이므로 출력이 긴 에이전트 작업일수록 비용이 더 높아진다.
활성화 비율도 짚어볼 만하다. 총 파라미터 1조 개 중 활성화 파라미터 490억 개는 약 4.9%로, 하루 앞서 발표된 Reflection Beam(총 파라미터 5010억 개 중 활성화 230억 개, 약 4.6%)과 비슷한 수준이다. 추론 비용은 주로 활성화 파라미터 규모에 좌우되기 때문에 두 회사 모두 "효율"을 강조하고 있다.
배포 장벽은 별개의 문제다. 8비트 정밀도로 추산하면 1조 개 파라미터의 가중치를 저장하는 데만 약 1TB의 VRAM이 필요하고, 4비트 양자화를 거쳐도 약 500GB 수준이다. 오픈 웨이트를 손에 넣더라도 대부분의 팀은 결국 클라우드 업체의 호스팅에 의존하거나 커뮤니티의 경량화(distillation) 버전을 기다려야 할 가능성이 크다.
유럽이라는 카드
Mistral은 9월 삼성이 주도한 30억 유로 규모의 투자를 유치했다. Large 4는 이 자금이 들어온 뒤 내놓은 첫 플래그십 모델로, 자체 인프라와 유럽 현지 학습이라는 두 가지 포인트를 회사가 거듭 강조하고 있다. 홍보 방향을 보면 유럽 정부와 규제 산업 수요를 겨냥하고 있는 것으로 보인다.
오픈 웨이트의 라이선스 조건과 구체적인 공개 일정은 Mistral이 아직 발표하지 않았다. 지금까지 나온 모든 점수도 자사와 일부 평가기관의 데이터에 불과해, 커뮤니티가 실제로 가중치를 손에 넣은 뒤 얼마나 재현해낼 수 있을지는 이달 말에야 드러날 전망이다.
참고 출처: Mistral 공식 블로그, Artificial Analysis, CocoLoop, CNBC, Simon Willison 블로그. Intelligence Index와 작업당 비용은 Artificial Analysis가 공개한 데이터를 기준으로 했으며, API 가격은 Mistral의 프리뷰 가격을 기준으로 했다. VRAM 요구량은 파라미터 수에 따른 대략적인 추산치다.