Mistral lança modelo de voz 4B de código aberto, avaliação supera ElevenLabs

Em 26 de março, a Mistral lançou o Voxtral TTS, seu primeiro modelo de voz.

4B parâmetros, pesos abertos, naturalidade em avaliação manual superior ao ElevenLabs Flash v2.5, preço de API de US$ 0,016 por mil caracteres e capacidade de execução direta em seu próprio servidor – estes são os principais pontos de venda deste produto.

Como os 4B parâmetros são estruturados

A arquitetura do Voxtral TTS consiste em três módulos:

Componente Quantidade de parâmetros Função
Backbone do decodificador transformer 3,4B Baseado no Ministral 3B, responsável pela compreensão da linguagem e processamento de texto
Transformer acústico 390M Arquitetura flow-matching, processa a geração de características de áudio
Codec de áudio neural 300M Design de codec simétrico, compressão e restauração de áudio

Dados de latência: Com 500 caracteres de texto e 10 segundos de áudio de referência, o primeiro quadro de áudio aparece em 70 milissegundos. O fator em tempo real é de aproximadamente 9,7x, o que significa que gerar 1 segundo de fala leva apenas cerca de 0,1 segundo de tempo de computação.

Qual é o nível em comparação com ElevenLabs

De acordo com a declaração no anúncio de lançamento da Mistral: Avaliações manuais mostram que a naturalidade da fala do Voxtral TTS supera o ElevenLabs Flash v2.5 e iguala a qualidade do ElevenLabs v3.

A ElevenLabs é atualmente a líder no segmento de IA de voz, e o v3 é seu produto principal. O posicionamento de "igualar o principal, superar o secundário", colocado em um modelo de pesos abertos de 4B, é uma afirmação bastante ousada.

Para clonagem de voz, 3 segundos de áudio de referência são suficientes. Não se trata de copiar simplesmente o timbre, mas de capturar sotaque, variações de entonação, hábitos de pausa e até mesmo o ritmo de hábitos de fala como "é" e "hum". Além disso, suporta transferência multilíngue zero-shot – com a mesma configuração de voz, ao alternar o idioma para leitura, o sotaque teoricamente pode permanecer consistente.

Idiomas suportados

Inglês, francês, alemão, espanhol, holandês, português, italiano, hindi, árabe, totalizando 9 idiomas.

O chinês não está na lista – para usuários chineses, esta é uma falha grave e, no estágio atual, este produto pode ser ignorado.

O grau de abertura precisa ser esclarecido

Aqui há um detalhe que merece atenção: O protocolo de pesos do Voxtral TTS é CC BY NC 4.0, não Apache 2.0.

"NC" significa Non-Commercial – para fins não comerciais, os pesos podem ser baixados, modificados e distribuídos livremente; para fins comerciais, é necessário usar a API. Se você estiver fazendo pesquisa acadêmica, projetos pessoais ou demonstrações de conteúdo, baixe os pesos diretamente do Hugging Face, sem limites de cota. Se quiser integrar em um produto comercial, use a API: US$ 0,016 por mil caracteres.

Referência de preço da concorrência: ElevenLabs Flash v2.5 custa aproximadamente US$ 0,066 por mil caracteres, a API do Voxtral custa cerca de um quarto disso, uma vantagem de preço bastante clara.

Quem será afetado por este produto

O cenário da IA de voz mudou consideravelmente nos últimos dois anos. A ElevenLabs era quase a escolha padrão antes, depois Deepgram, OpenAI e Microsoft adicionaram capacidades de TTS sucessivamente, e os produtos de voz da ByteDance também competem no mercado interno. A Mistral entra com a estratégia de "pesos abertos + API de baixo custo" – exatamente a mesma estratégia que usa para seus modelos de linguagem.

Agentes de voz, produção de podcasts, aprendizado de idiomas e sistemas de atendimento ao cliente são os principais cenários de aplicação do TTS. Para empresas que desejam controlar custos e não querem que os dados saiam do país, a opção de autoimplante é realmente atraente – mesmo que você queira uso comercial, pode primeiro usar os pesos abertos para testar, confirmar o efeito e depois migrar para a API.

Mas repetindo: O chinês não é suportado. O público-alvo principal deste produto atualmente são equipes na Europa, Sul da Ásia ou equipes multilíngues que atuam no exterior, e há poucos cenários de uso direto no mercado interno.

Fontes de referência: Mistral AI just released a text-to-speech model it says beats ElevenLabs (VentureBeat); Mistral releases a new open source model for speech generation (TechCrunch); CocoLoop; Speaking of Voxtral (Blog oficial da Mistral AI)