Gemini 3.8 Live con avatar en vídeo llega a disponibilidad general

El 25 de septiembre, Google Cloud anunció que Gemini 3.8 Live with Live Avatar pasa a disponibilidad general (GA) en Gemini Enterprise. Esta versión añade un "rostro" que habla al modelo de conversación por voz en tiempo real ya existente: genera un avatar en vídeo cuyos labios se sincronizan con la voz, pensado para escenarios que requieren presencia humana, como atención al cliente, asesoría de compra y presentación de productos. La función se había mostrado antes en una vista previa en Google Cloud Next 2026.

Qué puede hacer esta versión

Según la descripción del blog de Google Cloud, Gemini 3.8 Live apuesta esta vez por cinco capacidades principales:

  • Avatar en vídeo: genera un avatar de diálogo con sincronización labial;
  • Voz a voz: conversación nativa por voz en la que el usuario puede interrumpir a mitad de camino y seguir hablando después, sin perder el contexto previo ni las acciones que se ejecutan en segundo plano;
  • Llamadas a herramientas asíncronas: la conversación no se interrumpe mientras se llaman APIs o se consultan CRM o ERP en segundo plano;
  • Multilingüe: entiende y habla 97 idiomas, con reconocimiento automático del idioma;
  • Visión en tiempo real: procesa a la vez la imagen de la cámara, el uso compartido de pantalla y el audio.

En cuanto al despliegue, se ofrecen dos endpoints, en Estados Unidos y en la Unión Europea, con soporte para rendimiento reservado (provisioned throughput), y se hace hincapié en el cumplimiento normativo y la gobernanza de datos para empresas.

El anuncio recoge dos limitaciones. El avatar personalizado por ahora solo está disponible para clientes en una lista blanca: las empresas que quieran usar su propia imagen o representante deben pasar antes por la aprobación de Google. Todos los flujos de audio y vídeo generados incorporan una marca de agua SynthID invisible a simple vista. Además, la variante con razonamiento extendido, Gemini 3.8 Live Extended Thinking, sigue en vista previa privada y no pasó a disponibilidad general junto con esta actualización.

Qué han hecho los clientes con esto

El anuncio menciona a cuatro clientes. Autotrader, marca de Cox Automotive, lo usa como asistente de compra de coches: el avatar conversa mientras destaca vehículos, compara modelos y explica opciones de financiación en la página web. Marianne Johnson, directora de producto de Cox Automotive, declaró:

"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."

(Cada vez más compradores esperan poder describir lo que necesitan con sus propias palabras, en lugar de tener que pasar por filtros y menús.)

El asistente personal de la empresa india Equal AI gestiona más de 1 millón de llamadas en tiempo real al día, en 9 idiomas de la India; su director ejecutivo afirma que la nueva versión mejora el manejo de interrupciones, las conversaciones multilingües y la fiabilidad de las llamadas a herramientas. Salesforce indicó que está combinando la función con Agentforce; Specs, una plataforma de asistentes de IA, mencionó mejoras en la detección de actividad de voz y en la latencia general. Todas estas son afirmaciones de las propias empresas: el anuncio no ofrece cifras comparables, como latencia en milisegundos o tasas de conversión.

¿Pueden usarlo los desarrolladores en China?

Gemini Enterprise y la API Live dependen de la infraestructura de Google Cloud, por lo que los desarrolladores en China continental no pueden acceder directamente; los equipos orientados a mercados internacionales pueden usar los endpoints de EE. UU. o la UE. Entre los 97 idiomas admitidos está el chino, y los escenarios de atención al cliente y asesoría de compra en mercados multilingües como el Sudeste Asiático u Oriente Medio son la aplicación más directa.

En China, los avatares digitales de atención al cliente y de livestreaming llevan ya varios años funcionando, normalmente encadenando reconocimiento de voz, un modelo grande, síntesis de voz y un avatar con sincronización labial en pasos separados; cada paso añade su propia latencia, y el manejo de interrupciones suele ser el punto débil. Esta vez Google integra escucha, habla, visión, llamadas a herramientas y generación de imagen en un único modelo en tiempo real, apostando por la ventaja de una solución de extremo a extremo en latencia y en la experiencia ante interrupciones. Qué enfoque resulta más rentable dependerá de cómo se cobre la salida del avatar y del coste real de la concurrencia, algo que por ahora no tiene cifras públicas comparables.

Lo que aún no queda claro

Sobre el precio de Live Avatar, el blog solo remite a la página general de precios, sin detallar una tarifa específica para la salida de vídeo del avatar; tampoco se han hecho públicas las condiciones de solicitud ni el plazo de revisión de la lista blanca. Igualmente no se explica a qué terceros estará disponible la herramienta de detección de la marca de agua SynthID. Para las empresas que evalúan si adoptarlo, estos puntos afectan directamente a las decisiones de costo y cumplimiento.

Fuentes: Blog oficial de Google Cloud, Android Headlines, CocoLoop, Unite.AI; se verificaron el número de idiomas admitidos, las restricciones de lista blanca y marca de agua, el volumen medio diario de llamadas de Equal AI y las citas de los clientes.