Em 23 de setembro, o Google lançou dois modelos de síntese de voz: Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. O primeiro é voltado a cenários criativos que exigem controle detalhado de tom e construção de personagens; o segundo é voltado a chamadas em grande volume e baixo custo. Os dois já estão disponíveis desde o lançamento na Gemini API e no Google AI Studio, com a versão corporativa Gemini Enterprise chegando em seguida.
O que os modelos fazem
As vozes vêm de três fontes: 30 vozes nativas, mais de 2.000 vozes prontas para uso comercial direto e vozes personalizadas criadas pelo próprio usuário. Para criar uma voz personalizada, basta uma amostra de áudio de 30 segundos; o Google afirma suportar mais de 100 idiomas e dialetos. A função de mistura de vozes está marcada como "em breve".
No controle, os desenvolvedores podem usar linguagem natural para escrever instruções de interpretação linha a linha, indicando, por exemplo, qual frase deve ser dita mais baixo ou com risada. O modelo suporta nativamente cenas de diálogo entre duas pessoas, podendo inserir risadas, suspiros, inspirações e interjeições como "hum" e "é" conforme o roteiro. O Google também afirma que a qualidade do áudio não se degrada de forma perceptível na geração de conteúdos de várias horas.
Os dois modelos também chegam ao usuário final: o Flash TTS foi incorporado ao Gemini Notebook e o Flash-Lite TTS ao Google Vids, ambos acessíveis a usuários comuns. Dez empresas, incluindo Agora, LiveKit, Pipecat, Vercel, Figma e HeyGen, fazem parte do primeiro grupo de parceiros de integração.
Clonagem de voz tem restrições regionais
O Google colocou várias barreiras na função de clonagem: todo áudio gerado carrega uma marca d'água SynthID, é necessária verificação de consentimento autorizado antes da clonagem, além de credenciais de conteúdo C2PA. A função de clonagem ainda não está disponível nos estados americanos de Illinois e Texas, nem no Espaço Econômico Europeu, Reino Unido, Suíça e Índia. Illinois e Texas têm leis específicas de proteção de dados biométricos.
Nas avaliações, o Google cita o benchmark de design de voz da Hume AI, segundo o qual o Flash TTS ficou em primeiro lugar no ranking geral e também em primeiro na modelagem de sotaques; no Voice Arena, o modelo aparece entre os primeiros colocados nos rankings de japonês, português do Brasil, vietnamita, árabe padrão moderno, espanhol mexicano e hindi. Esses são resultados de rankings de terceiros citados pelo Google; o anúncio não menciona separadamente o desempenho em chinês.
Fazendo as contas
Segundo a página de preços da Gemini API, a saída de áudio é cobrada a 25 tokens por segundo. Uma hora de fala equivale a 90 mil tokens de áudio. Uma estimativa aproximada pelo preço por milhão de tokens de saída:
| Modelo | Até o fim de 2026 | A partir de 1º/1/2027 |
|---|---|---|
| 3.8 Flash TTS (US$ 9 / US$ 18) | cerca de US$ 0,81/hora | cerca de US$ 1,62/hora |
| 3.8 Flash-Lite TTS (US$ 6 / US$ 12) | cerca de US$ 0,54/hora | cerca de US$ 1,08/hora |
| 2.5 Flash TTS (prévia) (US$ 10) | cerca de US$ 0,90/hora | — |
O preço da entrada de texto é de US$ 0,5 por milhão de tokens até o fim do ano e sobe para US$ 1 no ano que vem; o volume de texto de uma hora de fala é de apenas algumas dezenas de milhares de caracteres, o que torna essa parte praticamente irrelevante. O processamento em lote (batch) ainda tem 50% de desconto adicional.
Fazendo essa conta, nos pouco mais de três meses restantes deste ano, os novos modelos saem mais baratos que a antiga versão de prévia; a partir do próximo ano, o Flash fica cerca de 80% mais caro por hora, e o Flash-Lite também custa mais que a versão anterior. O Google não explicou por que adotou essa estrutura de preços — "metade do preço agora, dobrando depois do prazo". Para negócios que consomem voz por hora, como audiolivros, podcasts e atendimento ao cliente, um custo em torno de US$ 1 por hora ainda é muito inferior ao de um dublador humano; o que provavelmente vai decidir a adoção é a qualidade do áudio e o resultado da clonagem, e essa diferença de poucos centavos deve ter impacto limitado.
Fontes: blog oficial do Google, página de preços da Gemini API, CocoLoop, Hume AI; foram conferidos o número de vozes, a duração da amostra de clonagem, as restrições regionais e o preço de saída por milhão de tokens de áudio.