El 26 de marzo, Google lanzó Gemini 3.1 Flash Live.
Si crees que esto es solo una API de síntesis de voz más rápida y barata, vale la pena reconsiderarlo. Este modelo introduce un cambio fundamental en la arquitectura técnica.
Cómo funciona la IA de voz tradicional
La interacción de voz por IA anterior era básicamente un pipeline de tres etapas:
- Reconocimiento de voz (ASR): Convierte tu audio en texto
- Inferencia del modelo de lenguaje: El texto se introduce en el LLM para generar una respuesta en texto
- Síntesis de voz (TTS): Convierte el texto nuevamente en salida de voz
Cada paso tiene latencia, que se acumula, creando la sensación de hablar y esperar un momento para recibir una respuesta. Además, cada conversión pierde información: tu tono de voz, pausas y emociones desaparecen en el paso del texto.
Qué hace Gemini 3.1 Flash Live
Comprime este pipeline de tres etapas en un modelo nativo de audio a audio (audio-to-audio).
Sin pasar por el estado intermedio del texto, directamente desde tu entrada de voz hasta la salida de voz.
Especificaciones técnicas:
- Entrada de audio: PCM de 16 bits, frecuencia de muestreo de 16 kHz
- Salida de audio: 24 kHz
- Método de conexión: Conexión larga con estado basada en WebSocket
- Soporta más de 70 idiomas
Debido a que no hay pasos de conversión intermedios, la latencia se reduce significativamente y se puede capturar información como la entonación y la velocidad del habla que no está presente en el texto.
Qué puede hacer específicamente
Función de interrupción (Barge-in): Puedes interrumpir a la IA mientras está hablando, hacer una nueva pregunta o cambiar de dirección — el TTS tradicional no puede hacer esto; tienes que esperar a que termine una frase para decir la siguiente.
Llamada a herramientas: Puede llamar a funciones y a la Búsqueda de Google, lo que significa que durante el diálogo por voz, el modelo puede consultar información y ejecutar acciones en tiempo real.
Transcripción bilateral: El contenido de ambos lados de la conversación se puede transcribir simultáneamente, facilitando el registro y el análisis.
Dos modos de implementación: Servidor a servidor (adecuado para sistemas de back-end como chatbots de servicio al cliente) y cliente a servidor (adecuado para aplicaciones de voz orientadas directamente al usuario).
Resultados de benchmark
ComplexFuncBench Audio, una prueba que mide específicamente el rendimiento de los modelos de voz en escenarios complejos de llamada a funciones, Gemini 3.1 Flash Live obtuvo un 90,8%.
Impacto práctico
Uno de los mayores obstáculos de la IA de voz actualmente es la sensación de pausa, como cuando se hace una llamada telefónica que aún no se ha conectado. Reducir la latencia y permitir interrupciones son condiciones necesarias para acercar la interacción por voz a una conversación natural.
Este modelo está disponible para desarrolladores a través de la API Gemini Live en Google AI Studio y también se ha integrado en Gemini Live (para usuarios en más de 200 países).
La estrategia de Google en el ámbito de la voz, desde Gemini 2.5 Flash Native Audio hasta el actual Gemini 3.1 Flash Live, es muy consistente: tratar la voz como un ciudadano de primera clase, en lugar de simplemente poner una capa de TTS sobre un LLM.
Fuente de referencia: Gemini 3.1 Flash Live: Making audio AI more natural and reliable (Google Blog); CocoLoop, Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model (MarkTechPost); Gemini Live gets its biggest upgrade yet with Gemini 3.1 Flash Live (9to5Google)