Google新語音轉寫模型錯誤率降至2.6%
Google於8月26日發表語音轉文字模型Gemini 3.5 Transcribe,將字詞錯誤率降至2.6%,較上一代Chirp 3縮短70%轉寫時間,支援85種以上語言。
收錄 語音 AI 相關產品動態與產業觀察,共 13 篇文章。
Google於8月26日發表語音轉文字模型Gemini 3.5 Transcribe,將字詞錯誤率降至2.6%,較上一代Chirp 3縮短70%轉寫時間,支援85種以上語言。
Qwen-Audio-3.0-Realtime把工具調用接進即時語音互動。本文整理已核驗事實,以及它為何不只是單一發布消息。
ChatGPT 語音換上 GPT-Live以繁體中文科技新聞語氣重寫,保留關鍵數字、產品邊界與後續觀察點。
Bland 稱去年處理 1.75 億通電話,目前每週處理約 350 萬通,主攻保險與金融等高壓場景。
Vapi raised a $50 million Series B after Amazon Ring chose its voice AI stack over dozens of alternatives for inbound support calls.
語音 AI Wispr Flow 融資,估值衝高. 本文整理事件重點、戰略背景,以及受影響用戶或企業需要注意的實務風險。
ElevenLabs 將 D 輪融資擴大到 5.5 億美元以上、估值 110 億美元;更值得看的是企業語音 AI 收入在一季內暴增 43%。
OpenAI 重做 Realtime API 產品線,加入邊說邊推理、即時口譯與串流語音轉文字三類模型。
xAI 的 grok-voice-think-fast-1.0 在 τ-voice Bench 上獲得 67.3%,遠超 Gemini 3.1 Flash Live 的 43.8%,並且已在 Starlink 的客服系統中實際運作。
xAI 上線 Grok 語音 API,辨識錯誤率約 5%. 本文整理事件重點、戰略背景,以及受影響用戶或企業需要注意的實務風險。
阿里 Qwen 團隊推出 Qwen3.5-Omni,這是其首個真正意義上的全模態模型,將文字、圖片、音訊、影片全部納入單一架構處理,並具備即時語音複製與音影片 Vibe Coding 功能。
Mistral 於 3 月 26 日發布首個語音模型 Voxtral TTS。這款 4B 參數的開放權重模型,經人工評測自然度超越 ElevenLabs Flash v2.5,與 ElevenLabs v3 品質持平。API 定價為每千字 0.016 美元,可在自有伺服器上直接運行。
Google 發布 Gemini 3.1 Flash Live,將傳統三段式語音管線壓縮為原生音訊到音訊(audio-to-audio)模型,降低延遲並支援打斷功能與工具呼叫。