Google Cloud於9月25日宣布,Gemini 3.8 Live with Live Avatar在Gemini Enterprise上正式推出(GA)。這個版本在原有的即時語音對話模型上,加了一張會說話的「臉」:生成的影片分身,嘴型與語音同步,鎖定客服、導購、產品說明這類需要真人感的場景。這項功能最早在Google Cloud Next 2026上以預覽版亮相。
這個版本能做什麼
根據Google Cloud部落格的說法,這次Gemini 3.8 Live主打五項能力:
- 影片分身:生成嘴型同步的對話分身;
- 語音對語音:原生語音對話,使用者中途插話後能接續對話,先前的脈絡與背景中正在執行的操作都不會遺失;
- 非同步工具呼叫:對話不中斷,同時在背景呼叫API、查詢CRM或ERP;
- 多語言支援:能聽能說97種語言,自動辨識語種;
- 即時視覺辨識:同時處理鏡頭畫面、螢幕分享與音訊。
部署方面提供美國與歐盟兩個端點,支援預留輸送量(provisioned throughput),並強調企業合規與資料治理。
公告中也寫明兩項限制。客製化分身目前僅開放白名單客戶使用,企業若想用自己的形象或代言人,得先通過Google的審核。所有生成的音訊與影片串流都嵌入肉眼不可見的SynthID浮水印。此外,具備長時間推理能力的Gemini 3.8 Live Extended Thinking仍處於私有預覽階段,並未隨這次一併轉為正式版。
客戶拿它做了什麼
公告列出四家客戶案例。Cox Automotive旗下的Autotrader用它打造購車助理,分身一邊對話,一邊在網頁上標示車源、比較車款、說明貸款方案。Cox Automotive產品長Marianne Johnson表示:
"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."
(意思是消費者越來越希望用自己的話描述需求,而不是一層層點選篩選選單。)
印度的Equal AI以此打造個人助理服務,每天處理超過100萬通即時電話,涵蓋9種印度語言,該公司執行長表示新版本改善了插話處理、多語對話與工具呼叫的可靠度。Salesforce表示正將其與Agentforce結合;AI助理平台Specs則提到語音活動偵測與整體延遲的改善。這些都是各公司自行揭露的說法,公告中並未提供毫秒級延遲或轉換率等可比較的數據。
中國大陸開發者用得到嗎
Gemini Enterprise與Live API依託Google Cloud提供服務,中國大陸開發者無法直接呼叫,出海團隊可透過美國或歐盟端點使用。97種語言中包含中文,鎖定東南亞、中東等多語市場的客服與導購場景,會是最直接的應用方向。
中國國內的數位人客服與直播數位人已經運作了幾年,常見做法是把語音辨識、大型語言模型、語音合成、驅動嘴型的數位人引擎各自串接起來,每個環節都有各自的延遲,插話處理也常是弱點。Google這次把聽、說、看、呼叫工具與輸出畫面整合進同一個即時模型,賭的是端到端方案在延遲與打斷體驗上的優勢。哪條路線更划算,得看分身輸出的計價方式與實際併發成本,目前尚無公開數字可供比較。
Google先前已推出Gemini 3.8 Flash TTS與Flash-Lite TTS語音合成模型,這次公告也把Gemini 3.5 Transcribe、Gemini 3.5 Live Translate一併列入企業語音模型陣容。即時對話、轉錄、翻譯、合成再加上影片分身,Google的企業語音產品線已大致補齊。
還沒說清楚的部分
Live Avatar的價格,部落格只給了定價頁連結,沒有單獨列出分身影片輸出的費率;白名單的申請條件與審核週期也未公開。SynthID浮水印的偵測工具會開放給哪些第三方使用,這次同樣沒有說明。企業評估要不要導入,這幾項會直接影響成本與合規判斷。
參考來源:Google Cloud官方部落格、Android Headlines、CocoLoop、Unite.AI;待查核支援語言數量、白名單與浮水印限制、Equal AI日均通話量及各客戶引述。