Em 25 de setembro, o Google Cloud anunciou que o Gemini 3.8 Live with Live Avatar passou a ter disponibilidade geral (GA) no Gemini Enterprise. Esta versão adiciona um "rosto" falante ao modelo de conversa por voz em tempo real já existente: gera um avatar em vídeo cujos movimentos labiais são sincronizados com a fala, voltado para cenários que exigem presença humana, como atendimento ao cliente, orientação de compras e apresentação de produtos. O recurso havia sido apresentado antes no Google Cloud Next 2026.
O que esta versão traz
Segundo a descrição no blog do Google Cloud, o Gemini 3.8 Live aposta desta vez em cinco recursos principais:
- Avatar em vídeo: gera um avatar de diálogo com sincronização labial;
- Voz para voz: conversa nativa por voz, em que o usuário pode interromper no meio e continuar depois, sem perder o contexto anterior nem as ações em execução em segundo plano;
- Chamadas de ferramentas assíncronas: a conversa não é interrompida enquanto o sistema chama APIs ou consulta CRM e ERP em segundo plano;
- Multilíngue: entende e fala 97 idiomas, com reconhecimento automático do idioma;
- Visão em tempo real: processa simultaneamente imagem da câmera, compartilhamento de tela e áudio.
Na implantação, há dois endpoints disponíveis, nos Estados Unidos e na União Europeia, com suporte a taxa de transferência reservada (provisioned throughput), além de ênfase em conformidade corporativa e governança de dados.
O anúncio traz duas ressalvas. O avatar personalizado por enquanto só está disponível para clientes em lista branca — empresas que queiram usar sua própria imagem ou porta-voz precisam antes passar pela aprovação do Google. Todos os fluxos de áudio e vídeo gerados incorporam uma marca d'água SynthID invisível a olho nu. Além disso, a versão com raciocínio estendido, Gemini 3.8 Live Extended Thinking, permanece em pré-visualização privada e não passou a disponibilidade geral junto com esta atualização.
O que os clientes já fizeram com isso
O anúncio cita quatro clientes. A Autotrader, marca da Cox Automotive, usa o recurso como assistente de compra de carros: o avatar conversa enquanto destaca veículos, compara modelos e explica opções de financiamento na página. Marianne Johnson, diretora de produto da Cox Automotive, disse:
"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."
(Cada vez mais, os compradores esperam poder descrever o que precisam com suas próprias palavras, em vez de navegar por filtros e menus.)
O assistente pessoal da empresa indiana Equal AI processa mais de 1 milhão de chamadas em tempo real por dia, em 9 idiomas da Índia; o CEO da empresa afirma que a nova versão melhorou o tratamento de interrupções, as conversas multilíngues e a confiabilidade das chamadas de ferramentas. A Salesforce disse estar combinando o recurso com o Agentforce; já a Specs, uma plataforma de assistentes de IA, mencionou melhorias na detecção de atividade de voz e na latência geral. Todas essas são declarações das próprias empresas — o anúncio não traz números comparáveis, como latência em milissegundos ou taxas de conversão.
Desenvolvedores na China conseguem usar?
O Gemini Enterprise e a Live API dependem da infraestrutura do Google Cloud, por isso desenvolvedores na China continental não conseguem acessá-los diretamente; equipes voltadas ao mercado internacional podem usar os endpoints dos EUA ou da UE. Entre os 97 idiomas suportados está o chinês, e cenários de atendimento ao cliente e orientação de compras em mercados multilíngues, como Sudeste Asiático e Oriente Médio, são a aplicação mais direta.
No mercado chinês, avatares digitais de atendimento e para live commerce já funcionam há alguns anos, geralmente combinando reconhecimento de voz, um grande modelo de linguagem, síntese de voz e um avatar com sincronização labial em etapas separadas — cada etapa traz sua própria latência, e o tratamento de interrupções costuma ser o ponto fraco. Desta vez, o Google reúne escuta, fala, visão, chamadas de ferramentas e geração de imagem em um único modelo em tempo real, apostando na vantagem de uma solução ponta a ponta em latência e na experiência de interrupção. Qual abordagem compensa mais depende de como será cobrada a saída do avatar e do custo real de concorrência — por enquanto não há números públicos para comparar.
O que ainda não ficou claro
Sobre o preço do Live Avatar, o blog aponta apenas para a página geral de preços, sem listar uma tarifa específica para a saída de vídeo do avatar; as condições de solicitação e o prazo de análise da lista branca também não foram divulgados. Também não foi explicado a quais terceiros a ferramenta de detecção da marca d'água SynthID estará disponível. Para empresas avaliando a adoção, esses pontos afetam diretamente decisões de custo e conformidade.
Fontes: Blog oficial do Google Cloud, Android Headlines, CocoLoop, Unite.AI; verificados o número de idiomas suportados, as restrições de lista branca e marca d'água, o volume médio diário de chamadas da Equal AI e as citações dos clientes.