OpenAI 一口氣發布三款 Realtime 語音模型

5 月 7 日,OpenAI 一口氣發表三款語音模型,把 Realtime API 產品線重新整理了一遍。這次的重點,是把聽、想、說,以及工具呼叫放進同一條即時對話流程。

三款模型分別是:能一邊推理一邊說話的對話模型 GPT-Realtime-2;支援 70 種輸入語言、13 種輸出語言的即時口譯模型 GPT-Realtime-Translate;以及串流語音轉文字模型 GPT-Realtime-Whisper。三者都進入 Realtime API 正式版,並支援遠端 MCP 伺服器呼叫、圖片輸入和 SIP 電話撥入。

Realtime-2 要解決的是「想的時候卡住」

這次最值得看的,是 Realtime-2 能在推理請求的同時維持對話。過去很多語音 agent 的問題是,使用者講完之後它要停下來思考,想完再回答。電話場景裡,只要停頓超過幾秒,使用者就會覺得系統是不是掛了。

Realtime-2 可以邊推理邊接話,使用者中途插話也不丟上下文,還能同時呼叫多個工具。上下文視窗從上一代的 32K 擴到 128K,開發者也能在「快」和「想得更深」之間調整推理強度。OpenAI 的說法是,它能在推理、工具呼叫、修正和打斷處理中讓對話繼續往前走。

換句話說,OpenAI 想讓 AI 接電話時,不再像反應慢半拍的客服。

Zillow 和 Deutsche Telekom 是第一批案例

OpenAI 這次特別點名 Zillow 和 Deutsche Telekom。美國大型房地產平台 Zillow 已經用 Realtime-2 跑過一段真實電話流量。OpenAI 表示,接電話成功率有明顯提升,合規穩健性也更好,但沒有公布具體百分比。

這件事的意義在於,語音 agent 過去的瓶頸不是單純聽不聽得懂,而是接不接得住下一輪。例如客戶問「這個房源下午三點能不能看?我女兒放學,所以四點前要結束」,這類多條件約束常常讓上一代模型卡住。Zillow 的測試顯示,Realtime-2 正在跨過這類卡點。

Deutsche Telekom 則在測試 Realtime-Translate,用於跨國客服:客戶說德語、客服說英語,中間不再需要人工翻譯。

價格也改得更適合連續語音

GPT-Realtime-2 的價格是每百萬音訊輸入 token 32 美元,快取輸入 0.40 美元,每百萬輸出 token 64 美元。GPT-Realtime-Translate 為每分鐘 0.034 美元,GPT-Realtime-Whisper 為每分鐘 0.017 美元。

Translate 和 Whisper 改成按分鐘計費後,客服、會議記錄等連續語音場景更容易估算成本:1,000 分鐘就是 Whisper 17 美元,Translate 34 美元。Realtime-2 仍按 token 計費,但快取輸入折扣很大,適合那些系統 prompt 很長、每次對話都重複使用同一段設定的客服 agent。

語音 agent 的技術堆疊正在縮短

如果把時間拉回去年初,語音 AI 還是分層競爭:ElevenLabs 主打 TTS,聲音好聽但不負責推理;Deepgram、Whisper 主打 STT;第一代 GPT-4o 語音模式雖然有對話能力,但延遲和打斷處理仍不穩。OpenAI 現在想把「聽、想、說」壓進同一個推理流程。

接下來競爭的焦點也會改變。重點不只是誰的辨識更準,而是誰能讓 AI 在電話裡像真人一樣接得上話。ElevenLabs 有 voice cloning 優勢,Anthropic 今年還沒在語音 API 這條線推出模型;如果 Zillow 的早期數據成立,客服外包公司和 call center SaaS 今年可能很快會在財報裡感受到壓力。

參考來源:OpenAI has new voice models that reason,CocoLoop、 translate, and transcribe as you speak(9to5Mac);OpenAI's New Voice API Models(StartupHub.ai);Advancing voice intelligence with new models in the API(OpenAI 官方部落格)