Mistral publie un modèle vocal 4B open source, une évaluation supérieure à ElevenLabs

Le 26 mars, Mistral a publié Voxtral TTS, son premier modèle vocal.

4B paramètres, poids ouverts, naturalité dans l'évaluation manuelle supérieure à ElevenLabs Flash v2.5, prix de l'API à 0,016 USD par millier de caractères et possibilité de l'exécuter directement sur son propre serveur – ce sont les principaux arguments de vente de ce produit.

Comment les 4B paramètres sont structurés

L'architecture de Voxtral TTS se compose de trois modules :

Composant Nombre de paramètres Fonction
Colonne vertébrale du décodeur transformer 3,4B Basé sur Ministral 3B, responsable de la compréhension du langage et du traitement du texte
Transformer acoustique 390M Architecture flow-matching, gère la génération de caractéristiques audio
Codec audio neuronal 300M Conception de codec symétrique, compression et restauration audio

Données de latence : Avec 500 caractères de texte et 10 secondes d'audio de référence, la première trame audio apparaît en 70 millisecondes. Le facteur temps réel est d'environ 9,7x, ce qui signifie que générer 1 seconde de parole ne nécessite qu'environ 0,1 seconde de temps de calcul.

Quel est le niveau par rapport à ElevenLabs

Selon la déclaration dans l'annonce de lancement de Mistral : Les évaluations manuelles montrent que la naturalité de la parole de Voxtral TTS dépasse ElevenLabs Flash v2.5 et est à égalité avec la qualité d'ElevenLabs v3.

ElevenLabs est actuellement l'acteur leader dans le secteur de l'IA vocale, et v3 est leur produit phare. Le positionnement "à égalité avec le produit phare, supérieur au second" appliqué à un modèle à poids ouverts de 4B est une affirmation assez audacieuse.

Pour le clonage vocal, 3 secondes d'audio de référence suffisent. Il ne s'agit pas simplement de copier le timbre, mais de capturer l'accent, les variations d'intonation, les habitudes de pause et même le rythme des habitudes de langage comme "euh" et "hum". De plus, il prend en charge le transfert multilingue zero-shot – avec la même configuration vocale, en changeant de langue pour la lecture, l'accent peut théoriquement rester cohérent.

Langues prises en charge

Anglais, français, allemand, espagnol, néerlandais, portugais, italien, hindi, arabe, soit 9 langues au total.

Le chinois ne figure pas dans la liste – pour les utilisateurs chinois, c'est un inconvénient majeur et, à ce stade, ce produit peut être ignoré.

Le degré d'ouverture doit être clarifié

Voici un détail qui mérite d'être noté : Le protocole de poids de Voxtral TTS est CC BY NC 4.0, pas Apache 2.0.

"NC" signifie Non-Commercial – à des fins non commerciales, les poids peuvent être téléchargés, modifiés et distribués librement ; à des fins commerciales, l'API est nécessaire. Si vous effectuez des recherches académiques, des projets personnels ou des démonstrations de contenu, téléchargez les poids directement depuis Hugging Face, sans limite de quota. Si vous souhaitez l'intégrer dans un produit commercial, utilisez l'API : 0,016 USD par millier de caractères.

Référence de prix des concurrents : ElevenLabs Flash v2.5 coûte environ 0,066 USD par millier de caractères, l'API de Voxtral coûte environ un quart de ce prix, un avantage de prix assez clair.

Qui sera affecté par ce produit

Le paysage de l'IA vocale a considérablement changé ces deux dernières années. ElevenLabs était presque le choix par défaut auparavant, puis Deepgram, OpenAI et Microsoft ont successivement ajouté des capacités TTS, et les produits vocaux de ByteDance sont également en concurrence sur le marché intérieur. Mistral entre avec la stratégie "poids ouverts + API à bas prix" – exactement la même stratégie que celle utilisée pour ses modèles de langage.

Les agents vocaux, la production de podcasts, l'apprentissage des langues et les systèmes de service client sont les principaux scénarios d'application du TTS. Pour les entreprises qui souhaitent contrôler les coûts et ne pas voir leurs données quitter le pays, l'option de déploiement autonome est effectivement attrayante – même si vous souhaitez une utilisation commerciale, vous pouvez d'abord utiliser les poids ouverts pour tester, confirmer l'effet, puis passer à l'API.

Mais je le répète : Le chinois n'est pas pris en charge. Le public cible principal de ce produit est actuellement les équipes en Europe, en Asie du Sud ou les équipes multilingues travaillant à l'étranger, et il y a peu de scénarios d'utilisation directe sur le marché intérieur.

Sources de référence : Mistral AI just released a text-to-speech model it says beats ElevenLabs (VentureBeat) ; Mistral releases a new open source model for speech generation (TechCrunch) ; CocoLoop ; Speaking of Voxtral (Blog officiel de Mistral AI)