Mistral은 3월 26일 첫 번째 음성 모델인 Voxtral TTS를 출시했다.
4B 파라미터, 오픈 웨이트, 인간 평가에서 ElevenLabs Flash v2.5를 능가하는 자연스러움, API 가격 1,000자당 0.016달러, 자체 서버에서 직접 실행 가능——이것이 이 제품의 핵심 판매 포인트다.
4B 파라미터 구성 방식
Voxtral TTS의 아키텍처는 세 가지 모듈로 구성된다:
| 구성 요소 | 파라미터 수 | 기능 |
|---|---|---|
| 트랜스포머 디코더 백본 | 3.4B | Ministral 3B 기반, 언어 이해 및 텍스트 처리 담당 |
| 음향 트랜스포머 | 390M | flow-matching 아키텍처, 오디오 특징 생성 처리 |
| 신경 오디오 코덱 | 300M | 대칭 코덱 설계, 오디오 압축 및 복원 |
지연 시간: 500자 텍스트와 10초 기준 오디오를 입력하면 첫 번째 오디오 프레임이 70밀리초 이내에 출력된다. 실시간 계수는 약 9.7배로, 1초 음성 생성에 약 0.1초의 계산 시간만 필요하다.
ElevenLabs와의 비교 수준
Mistral의 발표에 따르면: 인간 평가에서 Voxtral TTS의 음성 자연스러움은 ElevenLabs Flash v2.5를 능가하고 ElevenLabs v3 품질과 동등하다.
ElevenLabs는 현재 음성 AI 분야의 선두 주자이며, v3는 이들의 플래그십 제품이다. "플래그십과 동등, 서브 플래그십을 능가"라는 포지셔닝은 4B 오픈 웨이트 모델로서는 상당히 대담한 주장이다.
음성 복제의 경우 3초 기준 오디오면 충분하다. 단순한 음색 복사가 아니라 억양, 말투의 오르내림, 멈춤 습관, 심지어 "어, 음"과 같은 언어적 습관의 리듬까지 포착한다. 또한 제로샷 교차 언어 전이를 지원——동일한 음성 설정으로 다른 언어를 읽을 때 이론적으로 억양 일관성을 유지할 수 있다.
지원 언어
영어, 프랑스어, 독일어, 스페인어, 네덜란드어, 포르투갈어, 이탈리아어, 힌디어, 아랍어 등 총 9개 언어.
중국어는 목록에 없다——중국 사용자에게는 큰 단점이며, 현재로서는 이 모델을 고려 대상에서 제외해도 좋다.
오픈성에 대한 명확한 설명
주목할 만한 세부 사항이 있다: Voxtral TTS의 웨이트 라이선스는 CC BY NC 4.0이며 Apache 2.0이 아니다.
"NC"는 Non-Commercial(비상업적)을 의미한다——비상업적 용도로는 자유롭게 다운로드, 수정, 배포할 수 있지만 상업적 용도는 API를 통해야 한다. 학술 연구, 개인 프로젝트, 콘텐츠 데모의 경우 Hugging Face에서 직접 웨이트를 다운로드할 수 있으며 사용 제한이 없다. 상업 제품에 통합하려면 API를 사용한다: 1,000자당 0.016달러.
경쟁사 가격 참고: ElevenLabs Flash v2.5는 약 1,000자당 0.066달러다. Voxtral API는 그 약 4분의 1로 가격 우위가 뚜렷하다.
이 제품의 영향을 받을 대상
음성 AI 분야는 최근 몇 년간 크게 변화했다. ElevenLabs가 거의 기본 선택이었으나 이후 Deepgram, OpenAI, Microsoft가 차례로 TTS 기능을 추가했고, ByteDance의 음성 제품도 중국 내에서 경쟁하고 있다. Mistral은 "오픈 웨이트 + 저가 API" 노선으로 진입한다——언어 모델과 동일한 전략이다.
음성 에이전트, 팟캐스트 제작, 언어 학습, 고객 서비스 시스템이 TTS의 주요 적용 시나리오다. 비용을 통제하고 데이터를 해외로 보내고 싶지 않은 기업에게 자체 배포 옵션은 확실히 매력적이다——상업적 사용의 경우에도 먼저 오픈 웨이트로 테스트하고 효과를 확인한 후 API로 전환할 수 있다.
하지만 다시 강조한다: 중국어는 지원되지 않는다. 이 제품의 현재 주요 대상은 유럽, 남아시아 또는 다국어 해외 진출 팀이며, 중국 국내에서 직접 사용할 수 있는 시나리오는 많지 않다.
출처: Mistral AI just released a text-to-speech model it says beats ElevenLabs (VentureBeat); Mistral releases a new open source model for speech generation (TechCrunch); CocoLoop; Speaking of Voxtral (Mistral AI 공식 블로그)