Gemini 3.5 Transcribe、文字起こし誤り率2.6%に
グーグルは8月26日、音声認識モデルGemini 3.5 Transcribeを発表。語誤り率を2.6%に抑え、前世代Chirp 3比で書き起こし速度を70%短縮、85以上の言語に対応する。
音声AIに関する製品動向と業界分析を全13件掲載しています。
グーグルは8月26日、音声認識モデルGemini 3.5 Transcribeを発表。語誤り率を2.6%に抑え、前世代Chirp 3比で書き起こし速度を70%短縮、85以上の言語に対応する。
Qwen-Audio-3.0-Realtimeはリアルタイム音声対話にツール呼び出しを組み込んだ。この記事は確認済みの事実と、単発の発表を超えた意味を整理する。
ChatGPT Voice、GPT-Liveへ移行を、日本のテクノロジー読者向けに要点、数字、検証すべき論点を保った形で整理した記事です。
Blandは過去1年で1億7500万件の電話を処理し、現在は週350万件規模だという。
Vapi raised a $50 million Series B after Amazon Ring chose its voice AI stack over dozens of alternatives for inbound support calls.
音声AIの Wispr Flow、大型資金調達で成長加速. 発表内容、戦略的な背景、影響を受ける利用者や企業にとっての実務上のリスクを整理する。
ElevenLabsはシリーズDを5.5億ドル超へ拡大し、評価額を110億ドルに固定した。より重要なのは、企業向け音声AIのARRが3カ月で43%伸びた点だ。
OpenAIはRealtime APIを刷新し、会話しながら推論する音声モデル、リアルタイム翻訳、ストリーミング文字起こしを追加した。
xAIのgrok-voice-think-fast-1.0がτ-voice Benchで67.3%を記録し、Gemini 3.1 Flash Liveの43.8%を大きく引き離す。すでにStarlinkのカスタマーサービスで実運用されている。
xAI、Grok音声APIを公開 認識エラー率5%. 発表内容、戦略的な背景、影響を受ける利用者や企業にとっての実務上のリスクを整理する。
AlibabaのQwenチームは、テキスト、画像、音声、動画を単一アーキテクチャで処理する初の真の全モーダルモデルQwen3.5-Omniをリリース。リアルタイム音声クローンや音声動画Vibe Codingを実現する。
Mistralは3月26日、初の音声モデルVoxtral TTSをリリース。4Bパラメータのオープンウェイトモデルは、人間評価でElevenLabs Flash v2.5を上回り、ElevenLabs v3と同等の自然さと評価された。API価格は1,000文字あたり0.016ドルで、自社サーバーでの実行も可能。
GoogleはGemini 3.1 Flash Liveをリリース。従来の3段階音声パイプラインをネイティブな音声間(audio-to-audio)モデルに圧縮し、レイテンシを低減、割り込み機能やツール呼び出しを実現した。