OpenAI 9 月 10 日把语音模型 GPT-Live-1 开放给 API 开发者。这个模型两个月前先在 ChatGPT 语音里上线,当时官方只说 API 版本”随后开放”。现在开发者可以直接拿它做电话客服、语音助手和口语陪练一类的产品。
GPT-Live-1 是全双工模型:用户说话时它在听,它说话时也在听,可以被随时打断,也能处理背景噪声和长时间通话。和上一代 Realtime 系列不同,它不负责把所有事情都想明白。遇到需要推理或调用工具的请求,它把任务交给开发者配置好的后端模型,自己继续维持对话节奏。
前端和后端分开计费
价格也按这个结构拆成两块。语音前端每分钟 0.05 美元,按秒计费,不足一分钟不按整分钟收;后端调用的模型和工具,按各自的正常价格另算。
OpenAI 给出的搭配建议有三类:排班、下单这类高频简单任务配 Luna;需要推理的复杂客服问题配 GPT-6 Astra;和代码相关的对话接 Codex。第三方模型也可以挂在后面。
开发者文档显示,模型名是 gpt-live-1,走新的 Live 接口(v1/live/sessions),不走原来的 Realtime API;输入输出支持音频和文本,不支持图像和视频;知识截止到 2025 年 7 月 31 日。并发会话上限按账户等级从 25 路到 500 路不等。
和 GPT-Realtime-2.1 逐项对比
OpenAI 公布的测试数字里,差距最大的是任务完成类指标:
| 指标 | GPT-Live-1 | GPT-Realtime-2.1 |
|---|---|---|
| Tau3 语音智能(一次通过率) | 86.2% | 45.7% |
| 全双工交互性 | 80.1% | 45.4% |
| 工具调用一次通过率 | 87.0% | 60.0% |
| 轮次切换延迟 | 0.798 秒 | 1.41 秒 |
| Artificial Analysis 对话动态 | 97.3% | 95.7% |
对话自然度那一项,两代只差 1.6 个百分点,上一代已经接近满分。拉开差距的是”边聊边把事办完”:Tau3 和工具调用两项,都要求模型在语音对话里走完一段真实业务流程。从架构看,提升很大程度来自把推理交给后端,前端只管听和说。Tau3 这项成绩是搭配后端模型测出的,官方材料提到的组合是 GPT-6 Astra;换成 Luna 这类便宜的后端能拿多少分,官方没有单独列出。
早期客户的反馈
OpenAI 点名的早期客户有 Yelp、Speak、Fin 和 Cognition。Yelp CTO Alex Levy 注意到,打进电话的用户开始说更完整的句子:
“Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different.”
来电用户说的句子更完整、更自然了,说明电话那头的体验确实变了。
语言学习应用 Speak 的 CTO Andrew Hsu 给了一个数字:用户停下来想词的时候,模型插嘴的情况比轮流发言式的系统少了约 80%。客服公司 Fin 的 COO Jordan Neil 形容,语音客服从”一问一停”变成了接近正常电话的节奏。Cognition 则把它接到 Devin 上,工程师可以边说边和编程智能体推敲方案。
生成的音频带 SynthID 水印。音色目前只有一小组可选,定制音色要找销售。
中文效果是这次没有公开的部分。官方只说语言和口音支持会在未来几个月陆续扩展,没有给出语种清单。做中文电话客服的团队,得先自己跑一轮测试再决定要不要换。
参考来源:OpenAI 官方公告与开发者文档核验定价、接口和并发上限、Unite.AI、CocoLoop、Yelp 与 Speak 等客户公开表态;各项测试成绩以 OpenAI 公布口径为准。