El 23 de septiembre, Google presentó dos modelos de síntesis de voz: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS. El primero está pensado para escenarios creativos que requieren un control minucioso del tono y la construcción de personajes; el segundo se orienta a llamadas de gran volumen y bajo costo. Ambos están disponibles desde el lanzamiento en la Gemini API y en Google AI Studio, y la versión empresarial Gemini Enterprise los seguirá más adelante.
Qué pueden hacer
Las voces provienen de tres fuentes: 30 voces nativas, más de 2.000 voces ya listas para uso comercial directo, y voces personalizadas creadas por el propio usuario. Para crear una voz personalizada basta con una muestra de audio de 30 segundos; Google afirma que admite más de 100 idiomas y dialectos. La función de mezcla de voces figura como "próximamente".
En cuanto al control, los desarrolladores pueden usar lenguaje natural para escribir instrucciones de interpretación línea por línea, indicando, por ejemplo, qué frase debe decirse más bajo o con risa. El modelo admite de forma nativa escenas de diálogo entre dos personas y puede insertar risas, suspiros, inhalaciones y muletillas como "eh" o "sí" según el guion. Google también asegura que la calidad del audio no se degrada de forma perceptible al generar contenidos de varias horas.
Los dos modelos también llegan al usuario final: Flash TTS se integró en Gemini Notebook y Flash-Lite TTS en Google Vids, ambos accesibles para usuarios comunes. Diez empresas, entre ellas Agora, LiveKit, Pipecat, Vercel, Figma y HeyGen, forman el primer grupo de socios de integración.
La clonación de voz tiene restricciones regionales
Google incorporó varias salvaguardas para la función de clonación: todo el audio generado lleva una marca de agua SynthID, antes de clonar se exige una verificación de consentimiento autorizado, y además se añaden credenciales de contenido C2PA. La función de clonación aún no está disponible en los estados de Illinois y Texas en Estados Unidos, ni en el Espacio Económico Europeo, el Reino Unido, Suiza e India. Illinois y Texas cuentan con leyes específicas de protección de datos biométricos.
En cuanto a evaluaciones, Google cita el benchmark de diseño de voz de Hume AI, según el cual Flash TTS ocupa el primer puesto en la clasificación general y también el primero en modelado de acentos; en Voice Arena, el modelo se sitúa entre los primeros puestos en los rankings de japonés, portugués de Brasil, vietnamita, árabe estándar moderno, español mexicano e hindi. Se trata de resultados de rankings de terceros citados por Google; el anuncio no menciona por separado el rendimiento en chino.
Haciendo cuentas
Según la página de precios de la Gemini API, la salida de audio se cobra a razón de 25 tokens por segundo. Una hora de voz equivale a 90.000 tokens de audio. Un cálculo aproximado según el precio por millón de tokens de salida:
| Modelo | Hasta fines de 2026 | Desde el 1/1/2027 |
|---|---|---|
| 3.8 Flash TTS (9 USD / 18 USD) | unos 0,81 USD/hora | unos 1,62 USD/hora |
| 3.8 Flash-Lite TTS (6 USD / 12 USD) | unos 0,54 USD/hora | unos 1,08 USD/hora |
| 2.5 Flash TTS (vista previa) (10 USD) | unos 0,90 USD/hora | — |
El precio de la entrada de texto es de 0,5 USD por millón de tokens hasta fin de año y sube a 1 USD el próximo año; el volumen de texto de una hora de diálogo apenas alcanza unas decenas de miles de caracteres, por lo que esta parte resulta prácticamente insignificante. El procesamiento por lotes (batch) tiene además un 50% de descuento adicional.
Haciendo este cálculo, en los poco más de tres meses que quedan de este año los nuevos modelos resultan más baratos que la antigua versión de vista previa; a partir del próximo año, Flash costará alrededor de un 80% más por hora, y Flash-Lite también será más caro que la versión anterior. Google no ha explicado por qué adoptó esta estructura de precios: "mitad de precio ahora, el doble después del plazo". Para negocios que consumen voz por horas, como audiolibros, pódcast o atención al cliente, un costo de alrededor de 1 dólar por hora sigue siendo muy inferior al de un locutor humano; lo que probablemente decida la adopción es la calidad del audio y el resultado de la clonación, y esta diferencia de pocos centavos tendrá un impacto limitado.
Fuentes: blog oficial de Google, página de precios de la Gemini API, CocoLoop, Hume AI; se verificaron el número de voces, la duración de la muestra de clonación, las restricciones regionales y el precio de salida por millón de tokens de audio.