구글 신형 음성 전사 모델, 오류율 2.6%로
구글이 8월 26일 음성 인식 모델 Gemini 3.5 Transcribe를 공개했다. 단어 오류율을 2.6%로 낮추고 Chirp 3 대비 전사 속도를 70% 단축했으며 85개 이상 언어를 지원한다.
음성 AI 관련 제품 동향과 산업 분석 13건을 모았습니다.
구글이 8월 26일 음성 인식 모델 Gemini 3.5 Transcribe를 공개했다. 단어 오류율을 2.6%로 낮추고 Chirp 3 대비 전사 속도를 70% 단축했으며 85개 이상 언어를 지원한다.
Qwen-Audio-3.0-Realtime은 실시간 음성 대화에 도구 호출을 더했다. 이 글은 확인된 사실과 단일 발표를 넘어서는 의미를 정리한다.
ChatGPT Voice, GPT-Live로 전환를 한국 기술 독자가 읽기 쉬운 흐름으로 다시 정리하고 핵심 수치와 검증 지점을 유지했다.
Bland는 지난해 1억7500만 통의 전화를 처리했고 현재 주당 350만 통을 소화한다고 밝혔다.
Vapi raised a $50 million Series B after Amazon Ring chose its voice AI stack over dozens of alternatives for inbound support calls.
음성 AI Wispr Flow, 신규 투자로 성장 가속. 발표 내용과 전략적 맥락, 영향을 받는 이용자와 기업의 실질적 위험을 정리한다.
ElevenLabs는 시리즈 D를 5억5천만 달러 이상으로 키우며 110억 달러 가치를 확정했다. 더 큰 신호는 기업용 음성 AI 매출이 한 분기 만에 43% 늘었다는 점이다.
OpenAI가 말하면서 추론하는 음성 모델과 실시간 통역, 스트리밍 음성 인식을 Realtime API 정식 라인에 넣었다.
xAI의 grok-voice-think-fast-1.0이 τ-voice Bench에서 67.3%를 기록하며 Gemini 3.1 Flash Live(43.8%)를 크게 앞질렀고, 이미 Starlink 고객 서비스에서 실제로 운영되고 있다.
xAI, 오류율 5%의 Grok 음성 API 출시. 발표 내용과 전략적 맥락, 영향을 받는 이용자와 기업의 실질적 위험을 정리한다.
알리바바 Qwen 팀이 텍스트, 이미지, 오디오, 비디오를 단일 아키텍처로 처리하는 최초의 진정한 전모달 모델 Qwen3.5-Omni를 출시했다. 실시간 음성 복제와 오디오-비디오 바이브 코딩 기능을 갖췄다.
Mistral이 3월 26일 첫 번째 음성 모델 Voxtral TTS를 출시했다. 4B 파라미터 오픈 웨이트 모델은 인간 평가에서 ElevenLabs Flash v2.5보다 자연스러움이 뛰어나고 ElevenLabs v3와 품질이 동등한 것으로 평가됐다. API 가격은 1,000자당 0.016달러이며 자체 서버에서 실행할 수 있다.
구글이 Gemini 3.1 Flash Live를 출시했습니다. 기존 3단계 음성 파이프라인을 네이티브 오디오-투-오디오(audio-to-audio) 모델로 압축해 지연 시간을 줄이고, 말 끊기(barge-in) 및 도구 호출 기능을 구현했습니다.