Google lança síntese de voz Gemini 3.8, clonagem com apenas 30 segundos de áudio

Em 23 de setembro, o Google lançou dois modelos de síntese de voz: Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. O primeiro é voltado a cenários criativos que exigem controle detalhado de tom e construção de personagens; o segundo é voltado a chamadas em grande volume e baixo custo. Os dois já estão disponíveis desde o lançamento na Gemini API e no Google AI Studio, com a versão corporativa Gemini Enterprise chegando em seguida.

O que os modelos fazem

As vozes vêm de três fontes: 30 vozes nativas, mais de 2.000 vozes prontas para uso comercial direto e vozes personalizadas criadas pelo próprio usuário. Para criar uma voz personalizada, basta uma amostra de áudio de 30 segundos; o Google afirma suportar mais de 100 idiomas e dialetos. A função de mistura de vozes está marcada como "em breve".

No controle, os desenvolvedores podem usar linguagem natural para escrever instruções de interpretação linha a linha, indicando, por exemplo, qual frase deve ser dita mais baixo ou com risada. O modelo suporta nativamente cenas de diálogo entre duas pessoas, podendo inserir risadas, suspiros, inspirações e interjeições como "hum" e "é" conforme o roteiro. O Google também afirma que a qualidade do áudio não se degrada de forma perceptível na geração de conteúdos de várias horas.

Os dois modelos também chegam ao usuário final: o Flash TTS foi incorporado ao Gemini Notebook e o Flash-Lite TTS ao Google Vids, ambos acessíveis a usuários comuns. Dez empresas, incluindo Agora, LiveKit, Pipecat, Vercel, Figma e HeyGen, fazem parte do primeiro grupo de parceiros de integração.

Clonagem de voz tem restrições regionais

O Google colocou várias barreiras na função de clonagem: todo áudio gerado carrega uma marca d'água SynthID, é necessária verificação de consentimento autorizado antes da clonagem, além de credenciais de conteúdo C2PA. A função de clonagem ainda não está disponível nos estados americanos de Illinois e Texas, nem no Espaço Econômico Europeu, Reino Unido, Suíça e Índia. Illinois e Texas têm leis específicas de proteção de dados biométricos.

Nas avaliações, o Google cita o benchmark de design de voz da Hume AI, segundo o qual o Flash TTS ficou em primeiro lugar no ranking geral e também em primeiro na modelagem de sotaques; no Voice Arena, o modelo aparece entre os primeiros colocados nos rankings de japonês, português do Brasil, vietnamita, árabe padrão moderno, espanhol mexicano e hindi. Esses são resultados de rankings de terceiros citados pelo Google; o anúncio não menciona separadamente o desempenho em chinês.

Fazendo as contas

Segundo a página de preços da Gemini API, a saída de áudio é cobrada a 25 tokens por segundo. Uma hora de fala equivale a 90 mil tokens de áudio. Uma estimativa aproximada pelo preço por milhão de tokens de saída:

ModeloAté o fim de 2026A partir de 1º/1/2027
3.8 Flash TTS (US$ 9 / US$ 18)cerca de US$ 0,81/horacerca de US$ 1,62/hora
3.8 Flash-Lite TTS (US$ 6 / US$ 12)cerca de US$ 0,54/horacerca de US$ 1,08/hora
2.5 Flash TTS (prévia) (US$ 10)cerca de US$ 0,90/hora—

O preço da entrada de texto é de US$ 0,5 por milhão de tokens até o fim do ano e sobe para US$ 1 no ano que vem; o volume de texto de uma hora de fala é de apenas algumas dezenas de milhares de caracteres, o que torna essa parte praticamente irrelevante. O processamento em lote (batch) ainda tem 50% de desconto adicional.

Fazendo essa conta, nos pouco mais de três meses restantes deste ano, os novos modelos saem mais baratos que a antiga versão de prévia; a partir do próximo ano, o Flash fica cerca de 80% mais caro por hora, e o Flash-Lite também custa mais que a versão anterior. O Google não explicou por que adotou essa estrutura de preços — "metade do preço agora, dobrando depois do prazo". Para negócios que consomem voz por hora, como audiolivros, podcasts e atendimento ao cliente, um custo em torno de US$ 1 por hora ainda é muito inferior ao de um dublador humano; o que provavelmente vai decidir a adoção é a qualidade do áudio e o resultado da clonagem, e essa diferença de poucos centavos deve ter impacto limitado.

Fontes: blog oficial do Google, página de preços da Gemini API, CocoLoop, Hume AI; foram conferidos o número de vozes, a duração da amostra de clonagem, as restrições regionais e o preço de saída por milhão de tokens de áudio.