GPT-Live-1開放API 每分鐘5美分

OpenAI於9月10日將語音模型GPT-Live-1開放給API開發者使用。這款模型兩個月前已先在ChatGPT語音功能上線,當時官方只表示API版本「稍後開放」。現在開發者可以直接把它用在電話客服、語音助理和口說練習之類的產品上。

GPT-Live-1是全雙工模型:使用者說話時它在聽,自己說話時也同時在聽,可以隨時被打斷,也能處理背景噪音和長時間通話。和上一代Realtime系列不同的是,它不負責把所有事情都想清楚。遇到需要推理或呼叫工具的請求,它會把任務交給開發者設定好的後端模型,自己則專心維持對話節奏。

前端和後端分開計費

價格結構也照這個邏輯拆成兩塊。語音前端每分鐘0.05美元,按秒計費,不滿一分鐘不會整分鐘計算;後端呼叫的模型和工具,則依各自的正常價格另外計算。

OpenAI給出的搭配建議有三種:排班、下單這類高頻率的簡單任務搭配Luna;需要推理的複雜客服問題搭配GPT-6 Astra;和程式碼相關的對話則接Codex。第三方模型也可以掛在後端使用。

開發者文件顯示,模型名稱是gpt-live-1,走新的Live介面(v1/live/sessions),不是原本的Realtime API;輸入輸出支援音訊和文字,不支援圖片和影片;知識截止日期是2025年7月31日。同時連線數上限依帳號等級從25路到500路不等。

和GPT-Realtime-2.1逐項比較

OpenAI公布的測試數字裡,差距最大的是任務完成類指標:

指標GPT-Live-1GPT-Realtime-2.1
Tau3語音智慧(一次通過率)86.2%45.7%
全雙工互動性80.1%45.4%
工具呼叫一次通過率87.0%60.0%
輪流切換延遲0.798秒1.41秒
Artificial Analysis對話動態97.3%95.7%

對話自然度這一項,兩代只差1.6個百分點,上一代已經接近滿分。真正拉開差距的是「邊聊邊把事情辦完」:Tau3和工具呼叫這兩項,都要求模型在語音對話中走完一段真實的業務流程。從架構來看,這次的進步很大程度來自把推理交給後端,前端只負責聽和說。Tau3這項成績是搭配後端模型測出來的,官方資料提到的組合是GPT-6 Astra;換成Luna這類較便宜的後端能拿多少分,官方沒有單獨列出。

早期客戶的回饋

OpenAI點名的早期客戶有Yelp、Speak、Fin和Cognition。Yelp技術長(CTO)Alex Levy注意到,打電話進來的使用者開始講出更完整的句子:

"Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different."

(來電使用者講的句子更完整、更自然了,這說明電話另一端的體驗確實不一樣了。)

語言學習應用程式Speak的技術長Andrew Hsu給出一個數字:使用者停下來想詞彙時,模型插話的情況比輪流發言式的系統少了約80%。客服公司Fin的營運長(COO)Jordan Neil形容,語音客服從「問一句停一下」變成接近正常電話的節奏。Cognition則把它接上寫程式代理人Devin,工程師可以邊說邊和程式代理人討論方案。

生成的音訊帶有SynthID浮水印。音色目前只有少數幾種可選,要客製化音色得找業務團隊。

中文效果是這次沒有公開的部分。官方只表示語言和口音支援會在未來幾個月陸續擴增,沒有給出語種清單。做中文電話客服的團隊,得先自己跑一輪測試再決定要不要換。

參考來源:OpenAI官方公告與開發者文件核實定價、介面和同時連線上限、Unite.AI、CocoLoop、Yelp與Speak等客戶的公開表態;各項測試成績以OpenAI公布的口徑為準。