Grok 新語音模型跑分甩開 Gemini 30 個百分點

公開排行榜 τ-voice Bench 過去一年都是 Gemini 3.1 Flash Live 和 GPT Realtime 輪流坐莊。4 月 25 日 xAI 丟了一個新模型上去,直接拿下 67.3%

下一名 Gemini 3.1 Flash Live:43.8%。

中間這 23.5 個百分點的差距,在 LLM benchmark 裡不叫「領先」,叫「另一個量級」。

更值得說的不是跑分。是這模型已經在 Starlink 的客服系統裡真的在用了

grok-voice-think-fast-1.0:先看幾個數字

模型叫 grok-voice-think-fast-1.0,官方定位是「full-duplex 語音 agent」。Full-duplex 的意思是——它不用等你說完才能回話,可以一邊聽一邊說,像兩個人正常對話。

τ-voice Bench 各垂直領域的得分:

領域 grok-voice-think-fast-1.0 第二名
零售 62.3% 45.6%
航空 66.0% 64.0%
電信 73.7% 40.4%

電信這一欄拉開的差距最離譜。73.7% 對 40.4%,幾乎翻倍。這不是參數堆出來的,是 xAI 在客服這種典型 electronics/account 場景下專門做了大量訓練。

支援 25+ 種語言,能在嘈雜環境、口音、被打斷的情況下保持穩定。

它的「想」是怎麼不卡頓的

最有趣的技術點叫 background reasoning——後台推理。

普通的 voice agent 遇到複雜請求會有兩種典型表現:要嘛直接給一個淺層回答(你能感覺它在敷衍),要嘛沉默幾秒做思考(你能感覺它在卡)。兩種體驗都不像跟人說話。

grok-voice-think-fast-1.0 的做法是:在回應你的同時,後台並行做 reasoning。表層先用低延遲的對話模型 hold 住流暢度——「嗯」、「對」、「我明白」、「讓我看看」,這種自然的對話填充——背後另一個推理 pass 在解決你提的實際問題。等推理 pass 出結果,立刻接到主對話流裡。

xAI 官方說法:

「在背景中思考——處理複雜的查詢和工作流,對回應延遲零影響。」

聽起來像行銷話術,但 τ-voice Bench 的電信場景本身就是測這個:用戶說一長串帳戶號碼、訂閱資訊、地址變更,模型不能停頓超過 200 毫秒。grok-voice-think-fast-1.0 在這種場景 73.7% 的得分,是把這套機制跑通了的實證。

Starlink 把客服全交給它了:一組真金白銀的數字

理論 benchmark 沒意思。讓人坐不住的是 Starlink 的部署數據。

Starlink 把這套 voice agent 接進了真實的銷售和客服電話線。運營了一段時間,xAI 公開了幾個 KPI:

銷售轉換率 20%。 五個打進來諮詢的人裡,就有一個在通話當中直接掏錢開通 Starlink 服務

這是什麼概念?傳統電銷行業,一線銷售經過專門培訓和話術訓練,平均 call-to-sale 轉換率 5-8% 已經算優秀。20% 在人類銷售裡屬於頂尖業務員的水平,而且要持續保持非常難——人會累、會情緒化、會有 bad day。

AI 不會。

70% 的客服請求實現完全自主解決,沒有人類介入。

這條數據更扎心。意思是 10 個客戶致電問題,7 個 agent 自己搞定,掛電話之前問題已經處理完——帳單查詢、套餐變更、技術故障的初級排查、地址修改、停機重連,全部端到端走完,不 transfer 給人類

剩下 30% 走升級流程交給人工,但走到這步之前 voice agent 已經把客戶的問題、帳戶上下文、試過的解決方案打包好了——人類客服一接過來就能直接處理,不用再問「您的帳號是?您之前試過什麼?」

單個 agent 同時操作 28 個不同的內部工具。

這條最值得關注。所謂「agent」過去一年講爛了,但真正能在生產環境串起幾十個工具調用的不多。Starlink 這套部署裡,一個對話流可能涉及:帳戶系統、計費系統、設備狀態查詢、覆蓋圖、物流追蹤、退款流程、技術工單、上門服務調度、客戶關係記錄……一通電話 5-10 分鐘,agent 可能調了 15 次工具。

為什麼是 Starlink 先用

不是巧合。

xAI 和 Starlink 都在 SpaceX 體系內。Musk 上個月剛把 SpaceX 和 xAI 合併打包申請 IPO(1.75 兆美金估值,史上最大),這種「自家先用自家產品」的內部協同,比賣給 Salesforce 或微軟速度快得多。Starlink 敢把 sales-critical 的電話線接給一個新模型,因為出了問題 Musk 發條簡訊就能改。

這種內部閉環對模型訓練也是金礦。Starlink 每天的客服通話量是百萬級,全部回流到 xAI 做 RLHF 訓練數據。普通的 voice AI 公司想拿到這種規模的真實場景數據,要花幾年簽客戶、做合規。xAI 走了捷徑。

這件事改變了什麼

第一,voice AI 市場的領先位次重洗了。

過去 voice agent 這個賽道頭部是 OpenAI Realtime、Google Gemini Flash Live、ElevenLabs、Vapi、Bland 這些。τ-voice Bench 這次的差距不是 1-2 分,是斷層。短期內 Gemini 和 OpenAI 得回去做能力補足。

第二,B2B 採購方的決策權重變了。

之前企業選 voice 供應商主要看兩點:延遲和聲音品質。現在第三個維度變成「end-to-end 能不能閉環」。Starlink 的 70% 自主解決率把這個標準明確化了——能閉環的語音 agent 和不能閉環的,應該是兩個價格段。

第三,B2C 用戶體驗的天花板被抬高了。

20% 銷售轉換、70% 自主解決、操作 28 個工具、25 種語言、零延遲 thinking。一年前這套指標在 voice AI 圈是「理論上限」,現在變成「已經在生產裡跑的實測」。所有用 voice agent 做客服的公司,現在都得重新想自己的 baseline。

至於 Anthropic 和 OpenAI 接下來出什麼牌,應該不用等太久。他們都有 voice 能力但都還沒把「在 SpaceX 旗下子公司接管全部客服線」這種規模的部署案例擺出來。τ-voice Bench 這條曲線,下次更新會很熱鬧。

參考來源:Grok Voice Think Fast 1.0(xAI 官方公告)、CocoLoop、xAI Launches grok-voice-think-fast-1.0: Topping τ-voice Bench at 67.3%(MarkTechPost)、xAI launches Grok Voice Think Fast 1.0 for voice agents(Testing Catalog)、xAI Unveils Grok Voice AI That Thinks In Real Time While Handling Customer Support At Scale(Metaverse Post)