Google 重構語音 AI,發布 Gemini 3.1 Flash Live

3 月 26 日,Google 發布了 Gemini 3.1 Flash Live。

如果你以為這只是一個更快、更便宜的語音合成 API,那值得重新看一下。這個模型在技術架構上做了一個根本性的改變。

傳統語音 AI 是怎麼運作的

原來的 AI 語音互動,基本上是三段式管線:

  1. 語音辨識(ASR):把你的音訊轉成文字
  2. 語言模型推理:文字輸入 LLM,生成文字回答
  3. 語音合成(TTS):把文字再轉成語音輸出

每一步都有延遲,加起來就是那種說完等一會兒再回答的感覺。而且,每次轉換都會遺失資訊——你說話的語氣、停頓、情緒,在文字這一步就沒了。

Gemini 3.1 Flash Live 做了什麼

它把這三段管線壓縮成了一個原生音訊到音訊(audio-to-audio)的模型。

不經過文字這個中間狀態,直接從你的聲音輸入,產生語音輸出。

技術規格:

  • 音訊輸入:16-bit PCM,16kHz 取樣率
  • 音訊輸出:24kHz
  • 連接方式:基於 WebSocket 的有狀態長連接
  • 支援 70+ 語言

因為沒有中間轉換步驟,延遲顯著降低,而且能捕捉到語調、語速這些文字裡沒有的資訊。

具體能做什麼

打斷功能(Barge-in):可以在 AI 說話過程中打斷它,重新提問或者更改方向——傳統 TTS 做不到這個,說完一句話你才能說下一句。

工具呼叫:可以呼叫函式和 Google Search,意味著語音對話過程中模型可以即時查資料、執行操作。

雙方轉錄:對話雙方的內容都可以同時轉錄,方便記錄和分析。

兩種部署模式:伺服器對伺服器(適合客服機器人等後台系統),以及客戶端對伺服器(適合直接面向用戶的語音應用)。

基準測試成績

ComplexFuncBench Audio,這個測試專門測語音模型在複雜函式呼叫場景下的表現,Gemini 3.1 Flash Live 拿了 90.8%

實際影響

語音 AI 目前最大的障礙之一,就是那種像在打電話還沒接通時的停頓感。降低延遲加上支援打斷,是真正讓語音互動接近自然對話的必要條件。

這個模型透過 Gemini Live API 在 Google AI Studio 向開發者開放,也已經整合進了 Gemini Live(面向 200 多個國家的用戶)。

Google 在語音這條線上的佈局,從 Gemini 2.5 Flash Native Audio 到現在的 3.1 Flash Live,方向很一致:把語音當作一等公民來做,而不是往 LLM 上貼一層 TTS 包裝。

參考來源:Gemini 3.1 Flash Live: Making audio AI more natural and reliable(Google Blog);CocoLoop、Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model(MarkTechPost);Gemini Live gets its biggest upgrade yet with Gemini 3.1 Flash Live(9to5Google)