Mistral lanza modelo de voz 4B de código abierto, evaluación supera a ElevenLabs

El 26 de marzo, Mistral lanzó Voxtral TTS, su primer modelo de voz.

4B parámetros, pesos abiertos, naturalidad en evaluación manual superior a ElevenLabs Flash v2.5, precio de API de 0,016 USD por cada mil caracteres y la capacidad de ejecutarse directamente en su propio servidor: estos son los puntos de venta principales de este producto.

Cómo están estructurados los 4B parámetros

La arquitectura de Voxtral TTS consta de tres módulos:

Componente Cantidad de parámetros Función
Columna vertebral del decodificador transformer 3,4B Basado en Ministral 3B, responsable de la comprensión del lenguaje y el procesamiento de texto
Transformer acústico 390M Arquitectura flow-matching, procesa la generación de características de audio
Códec de audio neuronal 300M Diseño de códec simétrico, compresión y restauración de audio

Datos de latencia: Con 500 caracteres de texto y 10 segundos de audio de referencia, el primer fotograma de audio aparece en 70 milisegundos. El factor en tiempo real es de aproximadamente 9,7x, lo que significa que generar 1 segundo de voz solo requiere alrededor de 0,1 segundos de tiempo de cálculo.

¿A qué nivel se compara con ElevenLabs?

Según la declaración en el anuncio de lanzamiento de Mistral: Las evaluaciones manuales muestran que la naturalidad de la voz de Voxtral TTS supera a ElevenLabs Flash v2.5 y está a la par con la calidad de ElevenLabs v3.

ElevenLabs es actualmente el actor líder en el sector de IA de voz, y v3 es su producto estrella. El posicionamiento de "igualar al buque insignia, superar al secundario", colocado en un modelo de pesos abiertos de 4B, es una afirmación bastante audaz.

En cuanto a la clonación de voz, 3 segundos de audio de referencia son suficientes. No se trata de copiar simplemente el timbre, sino de capturar el acento, las variaciones de entonación, los hábitos de pausa e incluso el ritmo de hábitos del habla como "eh" y "mm". Además, admite transferencia multilingüe zero-shot: con la misma configuración de voz, al cambiar de idioma para leer, el acento teóricamente puede mantenerse consistente.

Idiomas compatibles

Inglés, francés, alemán, español, neerlandés, portugués, italiano, hindi, árabe, un total de 9 idiomas.

El chino no está en la lista – para los usuarios chinos, esto es una carencia importante y, en la etapa actual, este producto se puede omitir directamente.

El grado de apertura debe aclararse

Aquí hay un detalle que vale la pena señalar: El protocolo de pesos de Voxtral TTS es CC BY NC 4.0, no Apache 2.0.

"NC" significa Non-Commercial: para fines no comerciales, los pesos se pueden descargar, modificar y distribuir libremente; para fines comerciales, se debe usar la API. Si está realizando investigación académica, proyectos personales o demostraciones de contenido, descargue los pesos directamente desde Hugging Face, sin límites de cuota. Si desea integrarlo en un producto comercial, use la API: 0,016 USD por cada mil caracteres.

Referencia de precios de la competencia: ElevenLabs Flash v2.5 cuesta aproximadamente 0,066 USD por cada mil caracteres, la API de Voxtral cuesta aproximadamente una cuarta parte de eso, una ventaja de precio bastante clara.

¿Quién se verá afectado por este producto?

El panorama de la IA de voz ha cambiado considerablemente en los últimos dos años. ElevenLabs era casi la opción predeterminada antes, luego Deepgram, OpenAI y Microsoft agregaron capacidades de TTS sucesivamente, y los productos de voz de ByteDance también compiten en el mercado interno. Mistral entra con la estrategia de "pesos abiertos + API de bajo costo", exactamente la misma estrategia que utiliza para sus modelos de lenguaje.

Los agentes de voz, la producción de podcasts, el aprendizaje de idiomas y los sistemas de atención al cliente son los principales escenarios de aplicación del TTS. Para las empresas que desean controlar costos y no quieren que los datos salgan del país, la opción de autoimplementación es realmente atractiva: incluso si desea uso comercial, primero puede usar los pesos abiertos para probar, confirmar el efecto y luego cambiar a la API.

Pero repito: El chino no es compatible. El público objetivo principal de este producto actualmente son equipos en Europa, Asia meridional o equipos multilingües que operan en el extranjero, y hay pocos escenarios de uso directo en el mercado interno.

Fuentes de referencia: Mistral AI just released a text-to-speech model it says beats ElevenLabs (VentureBeat); Mistral releases a new open source model for speech generation (TechCrunch); CocoLoop; Speaking of Voxtral (Blog oficial de Mistral AI)