Google Cloudは9月25日、Gemini 3.8 Live with Live AvatarがGemini Enterpriseで正式提供(GA)になったと発表した。既存のリアルタイム音声対話モデルに、しゃべる「顔」を追加したバージョンで、生成された動画アバターの口の動きを音声に同期させ、カスタマーサポートや接客、製品説明など人間らしさが求められる場面を想定している。Google Cloud Next 2026でプレビュー版として初公開されていた。
今回のバージョンでできること
Google Cloudのブログ記事によると、今回のGemini 3.8 Liveは以下の5つの機能を軸にしている。
- 動画アバター:口の動きが音声と同期した対話アバターを生成;
- 音声対音声:ネイティブな音声対話。ユーザーが会話の途中で割り込んでも、それまでの文脈やバックグラウンドで実行中の処理を失わずに続けられる;
- 非同期のツール呼び出し:会話を中断せずに、裏でAPIを呼んだりCRMやERPを照会したりできる;
- 多言語対応:97言語を聞き取り・発話でき、言語を自動識別する;
- リアルタイム視覚認識:カメラ映像、画面共有、音声を同時に処理する。
提供形態としては米国・EUの2つのエンドポイントを用意し、予約済みスループット(provisioned throughput)にも対応、企業向けのコンプライアンスとデータガバナンスを重視しているとしている。
発表には2つの制限も明記されている。カスタムアバターは現時点でホワイトリスト登録企業のみが利用可能で、自社の容姿や広告塔となる人物の姿を使いたい企業はまずGoogleの審査を通過する必要がある。生成されるすべての音声・動画ストリームには、肉眼では見えないSynthID電子透かしが埋め込まれる。また、長時間の思考を伴うGemini 3.8 Live Extended Thinkingは依然としてプライベートプレビューの段階にあり、今回のGA化には含まれていない。
顧客はどう使っているか
発表では4社の顧客事例が紹介されている。Cox Automotive傘下のAutotraderは、これを自動車購入アシスタントとして活用し、アバターが会話をしながらウェブページ上で在庫車両をハイライトしたり、車種を比較したり、ローンの説明をしたりする。Cox AutomotiveのチーフプロダクトオフィサーMarianne Johnson氏はこう述べている。
"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."
(消費者は年々、フィルターやメニューを一つずつ操作するのではなく、自分の言葉でニーズを伝えたいと考えるようになっている、という趣旨。)
インドのEqual AIは、9つのインド言語に対応する個人アシスタント電話サービスを提供しており、1日100万件を超えるリアルタイム通話を処理している。同社CEOは、新バージョンで割り込み対応、多言語対話、ツール呼び出しの信頼性が改善したと述べた。Salesforceは同モデルをAgentforceと組み合わせていると説明し、AIアシスタントプラットフォームのSpecsは音声区間検出(VAD)と全体的な遅延の改善を挙げている。いずれも各社による自己申告であり、発表にはミリ秒単位の遅延やコンバージョン率といった比較可能な数値は示されていない。
中国本土の開発者は使えるのか
Gemini EnterpriseとLive APIはGoogle Cloud上で提供されているため、中国本土の開発者は直接利用できず、海外展開するチームは米国またはEUのエンドポイント経由で利用することになる。97言語には中国語も含まれており、東南アジアや中東など多言語市場でのカスタマーサポートや接客用途が最も直接的な活用先になりそうだ。
中国国内のデジタルヒューマン接客やライブ配信用アバターはここ数年稼働してきたが、一般的な方式は音声認識・大規模言語モデル・音声合成・口の動きを駆動するデジタルヒューマンエンジンをそれぞれ別々につなぎ合わせるというもので、各段階でそれぞれ遅延が発生し、割り込み対応も弱点になりやすい。今回Googleが聞く・話す・見る・ツール呼び出し・映像生成を一つのリアルタイムモデルに統合したのは、エンドツーエンド方式が遅延や割り込み体験で優位に立つという賭けだ。どちらの方式がコスト面で有利かは、アバター出力の課金体系と実際の同時接続コスト次第で、現時点では比較できる公開数値はない。
Googleはこれまでに音声合成モデルGemini 3.8 Flash TTSとFlash-Lite TTSを提供しており、今回の発表ではGemini 3.5 TranscribeとGemini 3.5 Live Translateも企業向け音声モデルのラインアップに加えられた。リアルタイム対話、文字起こし、翻訳、音声合成に動画アバターが加わったことで、Googleの企業向け音声関連プロダクトラインはほぼ出そろった形だ。
まだ明らかになっていない点
Live Avatarの価格については、ブログ記事は料金ページへのリンクを示すのみで、アバター動画出力に特化した料金は明記されていない。ホワイトリストの申請条件や審査期間も公開されていない。SynthIDの検出ツールをどの第三者に開放するのかについても、今回は説明がなかった。企業が導入を判断する際には、これらの点がコストとコンプライアンス評価に直接影響する。
参考資料:Google Cloud公式ブログ、Android Headlines、CocoLoop、Unite.AI;対応言語数、ホワイトリストと電子透かしの制限、Equal AIの1日あたりの通話量、各社のコメントについては今後の検証が必要。