Google Cloud gab am 25. September bekannt, dass Gemini 3.8 Live with Live Avatar auf Gemini Enterprise allgemein verfügbar (GA) ist. Die Version verpasst dem bisherigen Echtzeit-Sprachdialogmodell ein sprechendes „Gesicht“: Sie erzeugt einen Video-Avatar, dessen Lippenbewegungen synchron zur Sprache laufen, gedacht für Szenarien wie Kundenservice, Verkaufsberatung und Produktvorführungen, die menschliche Präsenz brauchen. Erstmals vorgestellt wurde die Funktion auf der Google Cloud Next 2026.
Was diese Version kann
Laut Google-Cloud-Blog stehen bei Gemini 3.8 Live diesmal fünf Fähigkeiten im Mittelpunkt:
- Video-Avatar: erzeugt einen Dialog-Avatar mit lippensynchroner Sprache;
- Sprache zu Sprache: natives Sprachgespräch, bei dem Nutzer mittendrin unterbrechen und danach weiterreden können, ohne dass Kontext oder laufende Hintergrundaktionen verloren gehen;
- Asynchrone Tool-Aufrufe: das Gespräch läuft ununterbrochen weiter, während im Hintergrund APIs, CRM- oder ERP-Systeme abgefragt werden;
- Mehrsprachigkeit: versteht und spricht 97 Sprachen mit automatischer Spracherkennung;
- Echtzeit-Bildverarbeitung: verarbeitet gleichzeitig Kamerabild, Bildschirmfreigabe und Audio.
Für den Einsatz stehen zwei Endpunkte in den USA und der EU bereit, reservierter Durchsatz (provisioned throughput) wird unterstützt, und Google betont Unternehmens-Compliance und Daten-Governance.
Die Ankündigung nennt zwei Einschränkungen. Eigene Avatare stehen bislang nur Kunden auf einer Whitelist offen – Unternehmen, die ihr eigenes Erscheinungsbild oder eine eigene Markenfigur nutzen wollen, müssen zunächst eine Google-Prüfung durchlaufen. Alle erzeugten Audio- und Videostreams enthalten ein für das bloße Auge unsichtbares SynthID-Wasserzeichen. Zudem befindet sich die Variante mit erweitertem Reasoning, Gemini 3.8 Live Extended Thinking, weiterhin in der privaten Preview und wurde diesmal nicht mit allgemein verfügbar gemacht.
Was Kunden damit machen
Die Ankündigung nennt vier Kunden. Autotrader, eine Marke von Cox Automotive, nutzt die Funktion als Autokauf-Assistenten: Der Avatar führt das Gespräch und hebt gleichzeitig auf der Webseite Fahrzeugangebote hervor, vergleicht Modelle und erklärt Finanzierungsoptionen. Marianne Johnson, Chief Product Officer von Cox Automotive, sagte dazu:
"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."
(Käuferinnen und Käufer erwarten zunehmend, ihre Bedürfnisse in eigenen Worten schildern zu können, statt sich durch Filter und Menüs zu klicken.)
Der persönliche Assistent des indischen Unternehmens Equal AI bearbeitet täglich mehr als 1 Million Echtzeit-Anrufe in 9 indischen Sprachen; der CEO des Unternehmens sagt, die neue Version habe den Umgang mit Unterbrechungen, mehrsprachige Gespräche und die Zuverlässigkeit von Tool-Aufrufen verbessert. Salesforce erklärte, die Funktion mit Agentforce zu kombinieren; Specs, ein Anbieter von KI-Assistenten-Plattformen, nannte Verbesserungen bei der Sprachaktivitätserkennung und der Gesamtlatenz. All das sind Aussagen der Unternehmen selbst – die Ankündigung liefert keine vergleichbaren Zahlen wie Latenz in Millisekunden oder Konversionsraten.
Nützlich für Entwickler in China?
Gemini Enterprise und die Live API laufen über Google Cloud, weshalb Entwickler in Festlandchina nicht direkt darauf zugreifen können; Teams mit Auslandsgeschäft können die Endpunkte in den USA oder der EU nutzen. Unter den 97 unterstützten Sprachen ist auch Chinesisch – für Kundenservice- und Beratungsszenarien in mehrsprachigen Märkten wie Südostasien oder dem Nahen Osten liegt hier der naheliegendste Einsatzbereich.
Digitale Kundenservice- und Livestream-Avatare laufen in China bereits seit einigen Jahren, meist als Verkettung aus Spracherkennung, großem Sprachmodell, Sprachsynthese und einem lippensynchronen digitalen Menschen – jeder Schritt bringt eigene Latenz mit, und der Umgang mit Unterbrechungen bleibt oft eine Schwachstelle. Google steckt diesmal Hören, Sprechen, Sehen, Tool-Aufrufe und Bildausgabe in ein einziges Echtzeitmodell und setzt damit auf den Vorteil einer End-to-End-Lösung bei Latenz und Unterbrechungserlebnis. Welcher Ansatz sich mehr lohnt, hängt von der Abrechnung der Avatar-Ausgabe und den tatsächlichen Kosten bei gleichzeitiger Nutzung ab – dazu gibt es bislang keine vergleichbaren öffentlichen Zahlen.
Was noch ungeklärt ist
Beim Preis von Live Avatar verweist der Blogbeitrag lediglich auf die allgemeine Preisseite, ohne eine gesonderte Gebühr für die Avatar-Videoausgabe zu nennen; auch die Antragsbedingungen und die Dauer der Whitelist-Prüfung sind nicht öffentlich. Ebenfalls ungeklärt bleibt, welchen Drittparteien das Erkennungstool für das SynthID-Wasserzeichen offensteht. Für Unternehmen, die eine Einführung prüfen, wirken sich genau diese Punkte direkt auf Kosten- und Compliance-Entscheidungen aus.
Quellen: Offizieller Google-Cloud-Blog, Android Headlines, CocoLoop, Unite.AI; geprüft wurden die Anzahl der unterstützten Sprachen, die Einschränkungen bei Whitelist und Wasserzeichen, das tägliche Anrufvolumen von Equal AI sowie die Kundenzitate.