谷歌 8 月 26 日发布 Gemini 3.5 Transcribe,一个专做语音转文字的模型,分实时流式与预录音频两条线。
按 Artificial Analysis 的测量,非流式版本的平均词错率 2.6%,流式版本 4.0%。在多语种基准 FLEURS 上,流式 5.50%、非流式 5.04%。相比上一代的 Chirp 3,出最终转写结果的时间缩短了 70%。支持语种超过 85 种,可自动检测。
它交出的是一份成稿
谷歌给这个模型的定位,是把原始音频直接转成准确、干净、已排好版的文本。具体做三件事:处理说话人的自我修正(官方举的例子是 “let’s meet Tuesday—no, Wednesday”,模型保留最终的星期三);删掉 “um”、“ah” 这类填充词;自动完成格式化。
传统语音识别模型的产出是原始转写流,上面这些清理动作要放到下游,用另一个模型或一套规则引擎补。把它折进转写模型内部,省掉的是一次调用和一次往返延迟。对做实时语音 Agent 的团队,这一层的时延往往就是”听起来像不像在对话”的分界线。
模型还支持函数调用,可以在转写过程中把复杂任务转派出去;另有自定义词表、说话人区分(预录音频最多 3 人,3 人以上为实验性)、词级时间戳、通话中途切换语种。
两条 API,两种场景
实时那条叫 gemini-3.5-transcribe-live,走 Live API,面向交互式语音应用;预录那条是 gemini-3.5-transcribe,走 Interactions API,面向会议记录和通话日志。
开发者侧通过 Gemini API(Google AI Studio)与 Google Antigravity 进入公开预览,企业侧走 Gemini Enterprise Agent Platform 预览,后续接入 Gemini Enterprise for Customer Experience。普通用户能碰到的入口目前有三个:macOS 上的 Gemini 应用(仅英文)、Android 上的 Rambler(部分国家和语种),Chrome 的支持排在后面。
数字之外留下的两个问题
官方没有公布定价。语音转写是按分钟计费的生意,2.6% 的词错率如果配上高于同行的单价,落地节奏就会慢下来——过去两年这条赛道换代频繁,客户对切换成本敏感,价格往往比零点几个百分点的精度差更能决定采购。
说话人区分只保证 3 人以内的准确度,这道限制把一批高频场景卡在了外面:多人会议、客服质检、播客转写,三人往上都是常态。官方把 3 人以上标为实验性,等于承认这部分还没稳定。
粗算一下精度的实际含义:2.6% 的词错率对应一段 1000 词的会议录音里约 26 个词出错(估算,实际分布与口音、背景噪声强相关)。放在需要逐字引用的法律、医疗场景,这个量级仍然要人工过一遍;放在生成会议纪要、给 Agent 喂上下文的场景,已经够用。两类需求的分水岭不在模型,在下游怎么消费这段文本。
语音这条赛道今年动作密集,从 OpenAI 一口气发三个语音模型,到各家把语音 API 往 Agent 栈里塞,比拼的口径正在从”识别得准”换成”接进流程后省不省事”。Gemini 3.5 Transcribe 把清理和格式化收进模型内部,走的是同一个方向。
参考来源:Google 官方博客、CocoLoop、Artificial Analysis、DeepMind 模型文档;词错率、延迟改善与语种数量以官方发布页口径核验,定价未公布。