StepFun, 음성 모델 5종 공개…오류율 1.7%
스텝펀이 음성 AI 'StepAudio 3' 다섯 모델을 동시 공개했다. Realtime 등이 Artificial Analysis 여러 부문에서 1위를 차지했고, ASR 오류율은 1.7%를 기록했다.
음성 인식 관련 제품 동향과 산업 분석 4건을 모았습니다.
스텝펀이 음성 AI 'StepAudio 3' 다섯 모델을 동시 공개했다. Realtime 등이 Artificial Analysis 여러 부문에서 1위를 차지했고, ASR 오류율은 1.7%를 기록했다.
샤오미가 공개한 음성인식 모델은 여러 명이 동시에 말해도 목표 화자만 골라 받아쓴다. 3인 동시 발화 오류율 12.29%는 경쟁 모델의 76~121%를 크게 밑돈다.
Hume AI 검증 실험 결과, 공개 벤치마크 점수가 높은 음성인식 모델일수록 실제 음성이 아니라 데이터셋의 잘못된 참조 텍스트를 그대로 재현하는 경향이 강한 것으로 나타났다.
텐센트가 Hy ASR 3.0 preview를 공개하고 WER, 방언 범위, 클라우드 API 제약을 제시했다.