谷歌Gemini 3.8 Live视频头像正式可用

Google Cloud 9 月 25 日宣布,Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 上转为正式可用。这个版本在原有的实时语音对话模型上加了一张会说话的“脸”:生成视频头像,口型与语音同步,面向客服、导购、产品讲解这类需要真人感的场景。它最早在 Google Cloud Next 2026 上做过预览。

这一版能做什么

按 Google Cloud 博客的描述,Gemini 3.8 Live 这次主打五项能力:

  • 视频头像:生成口型同步的对话头像;
  • 语音到语音:原生语音对话,用户中途插话后能接着聊,前面的上下文和后台正在执行的操作不会丢;
  • 异步工具调用:对话不中断,同时在后台调 API、查 CRM 或 ERP;
  • 多语言:能听能说 97 种语言,自动识别语种;
  • 实时视觉:同时处理摄像头画面、屏幕共享和音频。

部署上提供美国和欧盟两个端点,支持预留吞吐量(provisioned throughput),并强调企业合规与数据治理。

有两处限制写在公告里。自定义头像目前只对白名单客户开放,企业想用自己的形象或代言人,得先过 Google 这一关。所有生成的音频和视频流都嵌入肉眼不可见的 SynthID 水印。另外,带长思考的 Gemini 3.8 Live Extended Thinking 仍在私有预览,没有随这次一起转正。

客户拿它做了什么

公告列了四家客户。Cox Automotive 旗下的 Autotrader 用它做购车助手,头像一边对话,一边在网页上高亮车源、比较车型、讲解贷款。Cox Automotive 首席产品官 Marianne Johnson 的说法是:

“Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus.” (买车的人越来越希望用自己的话说出需求,不想再一层层点筛选菜单。)

印度公司 Equal AI 的个人助理每天处理超过 100 万通实时电话,覆盖 9 种印度语言,公司 CEO 称新版改善了插话处理、多语对话和工具调用的可靠性。Salesforce 表示正把它与 Agentforce 结合;做 AI 助手平台的 Specs 则提到语音活动检测和整体延迟的改进。这些都是公司自述,公告里没有给出延迟毫秒数或转化率这类可比数据。

国内开发者用得上吗

Gemini Enterprise 和 Live API 依托 Google Cloud 提供服务,中国大陆开发者无法直接调用,出海团队可以走美国或欧盟端点。97 种语言里包括中文,面向东南亚、中东等多语市场的客服与导购场景,是最直接的用武之地。

国内的数字人客服和直播数字人已经跑了几年,常见做法是把语音识别、大模型、语音合成、驱动口型的数字人几段拼起来,每一段各有延迟,插话处理也常是短板。谷歌这次把听、说、看、调工具和出画面放进同一个实时模型,押的是端到端方案在延迟和打断体验上的优势。两条路线谁更划算,要看头像输出的计价和实际并发成本,这一点目前没有公开数字可比。

谷歌此前已上线 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 语音合成模型,这次公告也把 Gemini 3.5 Transcribe、Gemini 3.5 Live Translate 一并列进企业音频模型清单。实时对话、转写、翻译、合成加上视频头像,谷歌企业语音这条产品线已经基本齐了。

还没说清的部分

Live Avatar 的价格,博客只给了定价页入口,没有单列头像视频输出的费率;白名单的申请条件和审核周期也没有公开。SynthID 水印的检测工具对哪些第三方开放,这次同样没有说明。企业评估要不要上线,这几项会直接影响成本和合规判断。

参考来源:Google Cloud 官方博客、Android Headlines、CocoLoop、Unite.AI;核验支持语种数量、白名单与水印限制、Equal AI 日均通话量及各客户引语。