Mistral Rilis Model Suara 4B Secara Open Source, Dinilai Lebih Natural dari ElevenLabs

Pada 26 Maret, Mistral merilis Voxtral TTS, model suara pertama mereka.

4B parameter, bobot terbuka, naturalitas yang dinilai manusia melampaui ElevenLabs Flash v2.5, harga API $0,016 per seribu karakter, dan dapat dijalankan langsung di server sendiri — inilah nilai jual inti produk ini.

Bagaimana 4B Parameter Dibangun

Arsitektur Voxtral TTS terdiri dari tiga modul:

KomponenJumlah ParameterFungsi
Backbone decoder transformer3,4BBerbasis Ministral 3B, menangani pemahaman bahasa dan pemrosesan teks
Transformer akustik390MArsitektur flow-matching, menangani pembuatan fitur audio
Codec saraf audio300MDesain codec simetris, kompresi dan rekonstruksi audio

Data latensi: Dengan 500 karakter teks dan 10 detik audio referensi, frame audio pertama keluar dalam 70 milidetik. Faktor real-time sekitar 9,7x, artinya menghasilkan 1 detik ucapan hanya membutuhkan sekitar 0,1 detik waktu komputasi.

Bagaimana Perbandingannya dengan ElevenLabs

Pernyataan Mistral dalam pengumuman rilis: Evaluasi manusia menunjukkan naturalitas suara Voxtral TTS melampaui ElevenLabs Flash v2.5 dan setara dengan kualitas ElevenLabs v3.

ElevenLabs adalah pemain terdepan di jalur AI suara saat ini, dengan v3 sebagai produk unggulan mereka. Posisi "setara dengan unggulan, melampaui sub-unggulan" untuk model open-weight 4B merupakan klaim yang cukup berani.

Untuk kloning suara, audio referensi 3 detik sudah cukup. Bukan sekadar menyalin timbre, tetapi mampu menangkap aksen, pola intonasi, kebiasaan jeda, dan bahkan ritme kebiasaan linguistik seperti "eh" dan "um." Selain itu mendukung transfer lintas bahasa zero-shot — konfigurasi suara yang sama dapat membaca dalam bahasa berbeda dengan aksen yang secara teoretis tetap konsisten.

Bahasa yang Didukung

Inggris, Prancis, Jerman, Spanyol, Belanda, Portugis, Italia, Hindi, dan Arab — total 9 bahasa.

Bahasa Mandarin tidak ada dalam daftar — ini adalah kekurangan signifikan bagi pengguna Tiongkok dan saat ini model ini dapat diabaikan.

Kejelasan Tingkat Keterbukaan

Ada detail penting yang perlu diperhatikan: Lisensi bobot Voxtral TTS adalah CC BY NC 4.0, bukan Apache 2.0.

"NC" adalah singkatan dari Non-Commercial — penggunaan non-komersial memungkinkan pengunduhan, modifikasi, dan distribusi secara gratis, sementara penggunaan komersial harus melalui API. Untuk penelitian akademis, proyek pribadi, atau demonstrasi konten, bobot dapat diunduh langsung dari Hugging Face tanpa batasan penggunaan. Untuk integrasi ke dalam produk komersial, gunakan API: $0,016 per seribu karakter.

Referensi harga pesaing: ElevenLabs Flash v2.5 sekitar $0,066 per seribu karakter. API Voxtral kira-kira seperempatnya, menawarkan keunggulan harga yang jelas.

Siapa yang Akan Terpengaruh oleh Produk Ini

Lanskap AI suara telah berubah cukup signifikan dalam beberapa tahun terakhir. ElevenLabs hampir menjadi pilihan default, kemudian Deepgram, OpenAI, dan Microsoft secara berturut-turut menambahkan kemampuan TTS, sementara produk suara ByteDance juga bersaing di dalam negeri Tiongkok. Mistral masuk dengan pendekatan "bobot terbuka + API murah" — strategi yang sama dengan yang digunakan untuk model bahasa.

Agen suara, produksi podcast, pembelajaran bahasa, dan sistem layanan pelanggan adalah skenario penerapan utama TTS. Bagi perusahaan yang ingin mengendalikan biaya atau tidak ingin data keluar dari yurisdiksi mereka, opsi deploy mandiri memang menarik — bahkan untuk penggunaan komersial, Anda dapat menguji dengan bobot terbuka terlebih dahulu, mengonfirmasi hasilnya, lalu beralih ke API.

Tapi sekali lagi: Bahasa Mandarin tidak didukung. Audiens utama produk ini saat ini adalah tim Eropa, Asia Selatan, atau tim ekspansi multibahasa; tidak banyak skenario penggunaan langsung di dalam negeri Tiongkok.

Sumber: Mistral AI just released a text-to-speech model it says beats ElevenLabs (VentureBeat); Mistral releases a new open source model for speech generation (TechCrunch); CocoLoop; Speaking of Voxtral (blog resmi Mistral AI)