Mistral veröffentlicht Open-Source-Sprachmodell mit 4B Parametern, Bewertung übertrifft ElevenLabs

Am 26. März veröffentlichte Mistral Voxtral TTS, sein erstes Sprachmodell.

4B Parameter, offene Gewichte, in manuellen Bewertungen eine Natürlichkeit, die ElevenLabs Flash v2.5 übertrifft, API-Preis von 0,016 USD pro tausend Zeichen, und es kann direkt auf dem eigenen Server ausgeführt werden – das sind die Kernverkaufsargumente dieses Produkts.

Wie die 4B Parameter aufgebaut sind

Die Architektur von Voxtral TTS besteht aus drei Modulen:

Komponente Parameteranzahl Funktion
Transformer-Decoder-Backbone 3,4B Basiert auf Ministral 3B, zuständig für Sprachverständnis und Textverarbeitung
Akustischer Transformer 390M Flow-Matching-Architektur, verarbeitet die Generierung von Audio-Merkmalen
Neuraler Audio-Codec 300M Symmetrisches Codec-Design, Audiokompression und -wiederherstellung

Latenzdaten: Bei 500 Zeichen Text und 10 Sekunden Referenzaudio erscheint der erste Audio-Frame innerhalb von 70 Millisekunden. Der Echtzeitfaktor beträgt etwa 9,7x, was bedeutet, dass die Generierung von 1 Sekunde Sprache nur etwa 0,1 Sekunden Rechenzeit benötigt.

Wie schneidet es im Vergleich zu ElevenLabs ab

Laut Aussage in der Ankündigung von Mistral: Manuelle Bewertungen zeigen, dass die Sprach-Natürlichkeit von Voxtral TTS die von ElevenLabs Flash v2.5 übertrifft und mit der Qualität von ElevenLabs v3 gleichzieht.

ElevenLabs ist derzeit der führende Akteur im Bereich Sprach-KI, v3 ist ihr Flaggschiffprodukt. Die Positionierung "Gleichauf mit dem Flaggschiff, über dem Zweitplatzierten" für ein Modell mit offenen Gewichten und 4B Parametern ist eine ziemlich gewagte Behauptung.

Für die Sprachklonung reichen 3 Sekunden Referenzaudio. Es kopiert nicht einfach die Klangfarbe, sondern kann Akzente, Tonfallschwankungen, Pausengewohnheiten und sogar den Rhythmus von Sprachgewohnheiten wie "äh" und "hm" erfassen. Darüber hinaus unterstützt es Zero-Shot-übergreifende Sprachübertragung – mit derselben Sprachkonfiguration kann beim Wechsel der Sprache zum Vorlesen der Akzent theoretisch konsistent bleiben.

Unterstützte Sprachen

Englisch, Französisch, Deutsch, Spanisch, Niederländisch, Portugiesisch, Italienisch, Hindi, Arabisch, insgesamt 9 Sprachen.

Chinesisch ist nicht in der Liste – für chinesische Nutzer ist das ein schwerwiegender Mangel, und in der aktuellen Phase kann man dieses Produkt direkt überspringen.

Der Offenheitsgrad muss klargestellt werden

Hier gibt es ein erwähnenswertes Detail: Das Gewichteprotokoll von Voxtral TTS ist CC BY NC 4.0, nicht Apache 2.0.

"NC" steht für Non-Commercial – für nicht-kommerzielle Zwecke können die Gewichte frei heruntergeladen, modifiziert und verteilt werden, für kommerzielle Zwecke ist die API erforderlich. Wenn Sie akademische Forschung, persönliche Projekte oder Inhaltsdemonstrationen durchführen, laden Sie die Gewichte direkt von Hugging Face herunter, ohne Kontingentbeschränkungen. Wenn Sie es in ein kommerzielles Produkt integrieren möchten, verwenden Sie die API: 0,016 USD pro tausend Zeichen.

Preisvergleich der Konkurrenz: ElevenLabs Flash v2.5 kostet etwa 0,066 USD pro tausend Zeichen, die Voxtral-API kostet etwa ein Viertel davon, ein deutlicher Preisvorteil.

Wer wird von diesem Produkt betroffen sein

Die Landschaft der Sprach-KI hat sich in den letzten zwei Jahren erheblich verändert. ElevenLabs war früher fast die Standardwahl, dann haben Deepgram, OpenAI und Microsoft nacheinander TTS-Fähigkeiten hinzugefügt, und die Sprachprodukte von ByteDance konkurrieren ebenfalls im Inland. Mistral steigt mit der Strategie "offene Gewichte + günstige API" ein – genau dieselbe Strategie wie bei seinen Sprachmodellen.

Sprachagenten, Podcast-Produktion, Sprachenlernen und Kundendienstsysteme sind die wichtigsten Einsatzszenarien für TTS. Für Unternehmen, die Kosten kontrollieren möchten und deren Daten das Land nicht verlassen sollen, ist die Option zur Selbstbereitstellung tatsächlich attraktiv – selbst wenn Sie es kommerziell nutzen möchten, können Sie zuerst die offenen Gewichte zum Testen verwenden, die Ergebnisse bestätigen und dann zur API wechseln.

Aber noch einmal: Chinesisch wird nicht unterstützt. Die Hauptzielgruppe dieses Produkts sind derzeit Teams in Europa, Südasien oder mehrsprachige Teams, die ins Ausland gehen, und es gibt nur wenige direkte Anwendungsszenarien im Inland.

Quellenangabe: Mistral AI just released a text-to-speech model it says beats ElevenLabs (VentureBeat); Mistral releases a new open source model for speech generation (TechCrunch); CocoLoop; Speaking of Voxtral (Offizieller Mistral AI Blog)