Gemini 3.8 Live avec avatar vidéo passe en disponibilité générale

Le 25 septembre, Google Cloud a annoncé le passage de Gemini 3.8 Live with Live Avatar en disponibilité générale (GA) sur Gemini Enterprise. Cette version ajoute un "visage" parlant au modèle de conversation vocale en temps réel existant : elle génère un avatar vidéo dont les mouvements des lèvres sont synchronisés avec la voix, destiné à des scénarios exigeant une présence humaine, comme le service client, le conseil d'achat ou la présentation de produits. La fonctionnalité avait été présentée en avant-première lors de Google Cloud Next 2026.

Ce que permet cette version

Selon la description du blog de Google Cloud, Gemini 3.8 Live mise cette fois sur cinq capacités principales :

  • Avatar vidéo : génère un avatar de dialogue avec synchronisation labiale ;
  • Voix à voix : conversation vocale native permettant à l'utilisateur d'interrompre en cours de route puis de reprendre sans perdre le contexte précédent ni les actions en cours en arrière-plan ;
  • Appels d'outils asynchrones : la conversation ne s'interrompt pas pendant que le système appelle des API ou consulte un CRM ou un ERP en arrière-plan ;
  • Multilingue : comprend et parle 97 langues, avec reconnaissance automatique de la langue ;
  • Vision en temps réel : traite simultanément l'image de la caméra, le partage d'écran et l'audio.

Côté déploiement, deux points d'accès sont proposés, aux États-Unis et dans l'Union européenne, avec prise en charge du débit réservé (provisioned throughput), et l'accent est mis sur la conformité et la gouvernance des données en entreprise.

L'annonce mentionne deux limites. L'avatar personnalisé n'est pour l'instant ouvert qu'aux clients figurant sur une liste blanche : les entreprises souhaitant utiliser leur propre image ou porte-parole doivent d'abord obtenir l'aval de Google. Tous les flux audio et vidéo générés intègrent un filigrane SynthID invisible à l'œil nu. Par ailleurs, la variante à raisonnement étendu, Gemini 3.8 Live Extended Thinking, reste en préversion privée et n'est pas passée en disponibilité générale avec cette mise à jour.

Ce que les clients en ont fait

L'annonce cite quatre clients. Autotrader, une marque de Cox Automotive, l'utilise comme assistant d'achat automobile : l'avatar dialogue tout en mettant en avant des véhicules, en comparant des modèles et en expliquant les options de financement sur le site. Marianne Johnson, directrice produit de Cox Automotive, a déclaré :

"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."

(Les acheteurs s'attendent de plus en plus à pouvoir décrire ce dont ils ont besoin avec leurs propres mots, plutôt que de devoir naviguer entre filtres et menus.)

L'assistant personnel de l'entreprise indienne Equal AI traite plus d'un million d'appels en temps réel par jour, dans 9 langues indiennes ; son PDG indique que la nouvelle version améliore la gestion des interruptions, les conversations multilingues et la fiabilité des appels d'outils. Salesforce a déclaré combiner cette fonctionnalité avec Agentforce ; Specs, une plateforme d'assistants IA, a évoqué des améliorations dans la détection d'activité vocale et la latence globale. Ce sont là des déclarations émanant des entreprises elles-mêmes : l'annonce ne fournit aucune donnée comparable, comme une latence en millisecondes ou un taux de conversion.

Les développeurs chinois peuvent-ils en profiter ?

Gemini Enterprise et l'API Live reposent sur l'infrastructure de Google Cloud, ce qui empêche les développeurs de Chine continentale d'y accéder directement ; les équipes tournées vers l'international peuvent passer par les points d'accès américain ou européen. Parmi les 97 langues prises en charge figure le chinois, et les scénarios de service client et de conseil d'achat pour des marchés multilingues comme l'Asie du Sud-Est ou le Moyen-Orient constituent le débouché le plus direct.

En Chine, les avatars numériques de service client et de livestream fonctionnent déjà depuis plusieurs années, généralement en enchaînant reconnaissance vocale, grand modèle de langage, synthèse vocale et avatar à synchronisation labiale en étapes distinctes ; chaque étape ajoute sa propre latence, et la gestion des interruptions reste souvent un point faible. Cette fois, Google réunit écoute, parole, vision, appels d'outils et génération d'image dans un seul modèle en temps réel, misant sur l'avantage d'une solution de bout en bout en matière de latence et d'expérience lors des interruptions. La rentabilité de chaque approche dépendra de la tarification de la sortie de l'avatar et du coût réel en cas de forte concurrence simultanée, un point pour lequel il n'existe pour l'instant aucune donnée publique comparable.

Ce qui reste flou

Concernant le prix de Live Avatar, le blog ne renvoie qu'à la page tarifaire générale, sans indiquer de tarif spécifique pour la sortie vidéo de l'avatar ; les conditions de candidature et le délai d'examen de la liste blanche ne sont pas non plus publiés. On ignore également à quels tiers l'outil de détection du filigrane SynthID sera ouvert. Pour les entreprises qui évaluent l'opportunité d'un déploiement, ces éléments pèsent directement sur les décisions de coût et de conformité.

Sources : blog officiel de Google Cloud, Android Headlines, CocoLoop, Unite.AI ; vérifiés : le nombre de langues prises en charge, les restrictions de liste blanche et de filigrane, le volume moyen d'appels quotidiens d'Equal AI ainsi que les citations des clients.