3 月 26 日,Google 發布了 Gemini 3.1 Flash Live。
如果你以為這只是一個更快、更便宜的語音合成 API,那值得重新看一下。這個模型在技術架構上做了一個根本性的改變。
傳統語音 AI 是怎麼運作的
原來的 AI 語音互動,基本上是三段式管線:
- 語音辨識(ASR):把你的音訊轉成文字
- 語言模型推理:文字輸入 LLM,生成文字回答
- 語音合成(TTS):把文字再轉成語音輸出
每一步都有延遲,加起來就是那種說完等一會兒再回答的感覺。而且,每次轉換都會遺失資訊——你說話的語氣、停頓、情緒,在文字這一步就沒了。
Gemini 3.1 Flash Live 做了什麼
它把這三段管線壓縮成了一個原生音訊到音訊(audio-to-audio)的模型。
不經過文字這個中間狀態,直接從你的聲音輸入,產生語音輸出。
技術規格:
- 音訊輸入:16-bit PCM,16kHz 取樣率
- 音訊輸出:24kHz
- 連接方式:基於 WebSocket 的有狀態長連接
- 支援 70+ 語言
因為沒有中間轉換步驟,延遲顯著降低,而且能捕捉到語調、語速這些文字裡沒有的資訊。
具體能做什麼
打斷功能(Barge-in):可以在 AI 說話過程中打斷它,重新提問或者更改方向——傳統 TTS 做不到這個,說完一句話你才能說下一句。
工具呼叫:可以呼叫函式和 Google Search,意味著語音對話過程中模型可以即時查資料、執行操作。
雙方轉錄:對話雙方的內容都可以同時轉錄,方便記錄和分析。
兩種部署模式:伺服器對伺服器(適合客服機器人等後台系統),以及客戶端對伺服器(適合直接面向用戶的語音應用)。
基準測試成績
ComplexFuncBench Audio,這個測試專門測語音模型在複雜函式呼叫場景下的表現,Gemini 3.1 Flash Live 拿了 90.8%。
實際影響
語音 AI 目前最大的障礙之一,就是那種像在打電話還沒接通時的停頓感。降低延遲加上支援打斷,是真正讓語音互動接近自然對話的必要條件。
這個模型透過 Gemini Live API 在 Google AI Studio 向開發者開放,也已經整合進了 Gemini Live(面向 200 多個國家的用戶)。
Google 在語音這條線上的佈局,從 Gemini 2.5 Flash Native Audio 到現在的 3.1 Flash Live,方向很一致:把語音當作一等公民來做,而不是往 LLM 上貼一層 TTS 包裝。
參考來源:Gemini 3.1 Flash Live: Making audio AI more natural and reliable(Google Blog);CocoLoop、Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model(MarkTechPost);Gemini Live gets its biggest upgrade yet with Gemini 3.1 Flash Live(9to5Google)