Gemini 3.8 Live影片分身正式上線

Google Cloud於9月25日宣布,Gemini 3.8 Live with Live Avatar在Gemini Enterprise上正式推出(GA)。這個版本在原有的即時語音對話模型上,加了一張會說話的「臉」:生成的影片分身,嘴型與語音同步,鎖定客服、導購、產品說明這類需要真人感的場景。這項功能最早在Google Cloud Next 2026上以預覽版亮相。

這個版本能做什麼

根據Google Cloud部落格的說法,這次Gemini 3.8 Live主打五項能力:

  • 影片分身:生成嘴型同步的對話分身;
  • 語音對語音:原生語音對話,使用者中途插話後能接續對話,先前的脈絡與背景中正在執行的操作都不會遺失;
  • 非同步工具呼叫:對話不中斷,同時在背景呼叫API、查詢CRM或ERP;
  • 多語言支援:能聽能說97種語言,自動辨識語種;
  • 即時視覺辨識:同時處理鏡頭畫面、螢幕分享與音訊。

部署方面提供美國與歐盟兩個端點,支援預留輸送量(provisioned throughput),並強調企業合規與資料治理。

公告中也寫明兩項限制。客製化分身目前僅開放白名單客戶使用,企業若想用自己的形象或代言人,得先通過Google的審核。所有生成的音訊與影片串流都嵌入肉眼不可見的SynthID浮水印。此外,具備長時間推理能力的Gemini 3.8 Live Extended Thinking仍處於私有預覽階段,並未隨這次一併轉為正式版。

客戶拿它做了什麼

公告列出四家客戶案例。Cox Automotive旗下的Autotrader用它打造購車助理,分身一邊對話,一邊在網頁上標示車源、比較車款、說明貸款方案。Cox Automotive產品長Marianne Johnson表示:

"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."

(意思是消費者越來越希望用自己的話描述需求,而不是一層層點選篩選選單。)

印度的Equal AI以此打造個人助理服務,每天處理超過100萬通即時電話,涵蓋9種印度語言,該公司執行長表示新版本改善了插話處理、多語對話與工具呼叫的可靠度。Salesforce表示正將其與Agentforce結合;AI助理平台Specs則提到語音活動偵測與整體延遲的改善。這些都是各公司自行揭露的說法,公告中並未提供毫秒級延遲或轉換率等可比較的數據。

中國大陸開發者用得到嗎

Gemini Enterprise與Live API依託Google Cloud提供服務,中國大陸開發者無法直接呼叫,出海團隊可透過美國或歐盟端點使用。97種語言中包含中文,鎖定東南亞、中東等多語市場的客服與導購場景,會是最直接的應用方向。

中國國內的數位人客服與直播數位人已經運作了幾年,常見做法是把語音辨識、大型語言模型、語音合成、驅動嘴型的數位人引擎各自串接起來,每個環節都有各自的延遲,插話處理也常是弱點。Google這次把聽、說、看、呼叫工具與輸出畫面整合進同一個即時模型,賭的是端到端方案在延遲與打斷體驗上的優勢。哪條路線更划算,得看分身輸出的計價方式與實際併發成本,目前尚無公開數字可供比較。

Google先前已推出Gemini 3.8 Flash TTS與Flash-Lite TTS語音合成模型,這次公告也把Gemini 3.5 Transcribe、Gemini 3.5 Live Translate一併列入企業語音模型陣容。即時對話、轉錄、翻譯、合成再加上影片分身,Google的企業語音產品線已大致補齊。

還沒說清楚的部分

Live Avatar的價格,部落格只給了定價頁連結,沒有單獨列出分身影片輸出的費率;白名單的申請條件與審核週期也未公開。SynthID浮水印的偵測工具會開放給哪些第三方使用,這次同樣沒有說明。企業評估要不要導入,這幾項會直接影響成本與合規判斷。

參考來源:Google Cloud官方部落格、Android Headlines、CocoLoop、Unite.AI;待查核支援語言數量、白名單與浮水印限制、Equal AI日均通話量及各客戶引述。