谷歌 9 月 23 日发布两款语音合成模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。前者面向需要细致控制语气、塑造角色的创作场景,后者主打大批量、低成本调用。两款当天起在 Gemini API 和 Google AI Studio 开放,企业版 Gemini Enterprise 随后跟进。
能做什么
声音来源有三种:30 个原生音色、2000 多个可直接商用的现成音色,以及用户自己定制。定制音色只需要一段 30 秒的录音样本,谷歌称支持 100 多种语言和方言。音色混合功能标注为“即将推出”。
控制方式上,开发者可以用自然语言逐句给台词写表演指示,比如哪一句要压低声音、哪一句带笑。模型原生支持两人对话场景,能按脚本插入笑声、叹气、倒吸一口气和“嗯”“对”这类附和声。谷歌还称,生成几个小时的长内容时音质不会明显衰减。
两款模型在消费端也有落点:Flash TTS 进了 Gemini Notebook,Flash-Lite TTS 进了 Google Vids,普通用户都能用。Agora、LiveKit、Pipecat、Vercel、Figma、HeyGen 等十家公司是首批集成伙伴。
声音克隆有地区限制
谷歌为克隆功能配了几道闸:所有生成音频都带 SynthID 水印,克隆前要做授权同意验证,并附 C2PA 内容凭证。克隆功能在美国伊利诺伊州、得克萨斯州,以及欧洲经济区、英国、瑞士、印度暂不可用。其中伊利诺伊州和得克萨斯州都有专门的生物识别信息保护法。
评测方面,谷歌引用 Hume AI 的音色设计基准,称 Flash TTS 排名总榜第一、口音建模也排第一;在 Voice Arena 的日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语、印地语榜单上位居前列。这些都是谷歌转述的第三方榜单成绩,中文表现公告里没有单独提。
算一笔账
Gemini API 定价页写明,音频输出按每秒 25 个 token 计。一小时语音就是 9 万个音频 token。按每百万 token 的输出价粗算:
| 模型 | 2026 年底前 | 2027 年 1 月 1 日起 |
|---|---|---|
| 3.8 Flash TTS(9 美元 / 18 美元) | 约 0.81 美元/小时 | 约 1.62 美元/小时 |
| 3.8 Flash-Lite TTS(6 美元 / 12 美元) | 约 0.54 美元/小时 | 约 1.08 美元/小时 |
| 2.5 Flash 预览版 TTS(10 美元) | 约 0.90 美元/小时 | — |
文本输入年底前每百万 token 0.5 美元、明年 1 美元,一小时的台词量不过几万字,这部分可以忽略。批处理再打五折。
照这个账,今年剩下三个多月,新模型比旧预览版便宜;明年起 Flash 版每小时贵出八成,Flash-Lite 也比旧版贵。谷歌没有解释为什么采用“先半价、到期翻倍”的定价结构。对有声书、播客、客服这类按小时消耗语音的业务,1 美元上下一小时的成本仍远低于真人配音,决定去留的更可能是音质和克隆效果,这几毛钱的差价影响有限。
参考来源:Google 官方博客、Gemini API 定价页、CocoLoop、Hume AI;核对音色数量、克隆样本时长、地区限制与每百万音频 token 输出价。