샤오미, 3인 발화 오류율 12.29% ASR 오픈소스 공개

샤오미(Xiaomi)가 9월 11일 '칵테일파티 문제'를 풀기 위한 음성인식 모델 Xiaomi-CocktailASR-1을 오픈소스로 공개했다. 여러 사람이 한 공간에서 동시에 말할 때, 듣고 싶은 한 사람의 말만 받아쓰는 모델이다. 코드는 깃허브 xiaomi-research 조직에, 가중치는 허깅페이스에 올라와 있고, 기술 보고서는 9월 10일 arXiv에 제출됐다.

일반적인 음성인식 모델과 달리 입력값에 목표 화자의 참조 음성이 하나 더 들어간다. 모델은 이 음성을 성문(음성 지문) 단서로 삼아 뒤섞인 오디오 트랙에서 해당 화자의 목소리만 골라 받아쓰고, 다른 사람의 말은 아예 텍스트로 출력하지 않는다.

수치로 보면

다화자 테스트셋에서의 오류율은 보고서 기준으로 LibriMix 2인 발화 4.11%, 3인 발화인 LibriMix3mix 12.29%, LibriSpeechMix2mix 2.90%다. 같은 3인 테스트에서 범용 음성인식 모델들의 오류율은 76%에서 121% 사이였다. 100%를 넘는다는 것은 삽입된 오류 글자 수가 원래 발화보다 많다는 뜻으로, 모델이 두세 사람의 말을 하나의 뒤섞인 텍스트로 합쳐버렸다는 의미다.

실제 환경 데이터로는 AliMeeting 회의 녹음을 사용했으며, 원거리 조건에서 목표 화자 오류율(TS-WER)은 20.63%로 기존 공개된 최고 성적 27.5%보다 약 7%포인트 낮았다. 단일 화자의 깨끗한 음성인 LibriSpeech에서는 1.73%로 주류 범용 모델과 비슷한 수준을 기록했는데, 이 수치가 이 모델을 혼합 음성 전용 부품이 아니라 범용 ASR로 쓸 수 있는지를 가른다.

거부율이라는 지표도 있다. 목표 화자가 아예 말하지 않았을 때 모델은 빈 텍스트를 출력해야 한다. 영어 네거티브 샘플셋에서 거부율은 79.59%였다. 보고서는 Gemini-2.5-pro를 대조군으로 삼았는데, 이 모델의 오거부율은 21.31%로, 받아써야 할 상황에서 '아무도 말하지 않았다'고 잘못 판단한 비율이 그만큼이었다는 뜻이다.

구조는 단순, 데이터양은 방대

구조는 3단으로 이뤄진다. Data2Vec2 기반의 자기지도 오디오 인코더(파라미터 약 6000만 개)가 프레임 단위로 1280차원 임베딩을 출력하고, 선형 어댑터가 이 오디오 임베딩을 언어모델의 은닉 공간으로 투영하며, 백본은 Qwen3-8B다. 전체적으로 엔드투엔드 대형언어모델 구조이며, 음향 모델과 언어 모델을 따로 붙이는 전통적인 ASR 방식이 아니다.

학습은 4단계로 진행됐고, 그중 2단계에서만 40만 시간이 넘는 다화자 데이터와 60만 시간의 단일 화자 데이터가 쓰였다. 이 정도 규모는 모델의 성능이 주로 데이터 양과 혼합 음성 합성의 커버리지에서 나온다는 것을 뜻하며, 아키텍처 자체가 외부 재현의 걸림돌이 되지는 않는다.

모델은 사고연쇄(CoT) 모드도 지원한다. 받아쓰기 전에 '이 음성에 몇 명이 있는지, 목표 성문이 어느 구간과 일치하는지'를 먼저 추론한다. 보고서에 따르면 CoT를 켜면 오류율이 0.24%포인트(절대값) 더 낮아진다. 실무적으로는 이 0.24%포인트의 이득이 추가되는 추론 비용을 상쇄하기는 어려울 가능성이 크며, 이 모드의 가치는 오히려 해석 가능성, 즉 오류가 났을 때 모델의 판단이 어디서 틀렸는지 볼 수 있다는 데 있다.

중국 내 상용화에 갖는 의미

중국 내 음성인식 시장에는 상용 솔루션이 부족하지 않다. 부족한 것은 여러 사람의 대화 속에서 한 사람을 안정적으로 붙잡아낼 수 있는 오픈소스 부품이다. 회의록 작성, 여러 명이 타는 차량용 음성비서, 고객센터의 이중 녹음 품질 검수, 보청기까지 모두 같은 벽에 부딪힌다. 마이크에 잡히는 목소리가 한 사람만이 아니라는 점이다.

샤오미 자신의 활용 방향도 짐작하기 어렵지 않다. 차량과 IoT 기기의 음성비서는 모두 여러 사람이 한 공간에 있는 상황을 상대해야 한다. 다만 이번에는 전체 가중치와 코드를 오픈소스 방식으로 공개했기 때문에, 제3자가 클라우드 서비스의 API 개방을 기다리지 않고 바로 가져다 쓸 수 있다. 보고서에 나온 테스트셋도 모두 공개 데이터셋이어서 다른 사람들이 재현하고 흠을 잡는 문턱도 낮아졌다.

한 가지 짚어둘 점이 있다. LibriMix 같은 데이터셋은 깨끗한 음성을 인위적으로 섞은 것이라, 실제 방 안의 잔향과 방향, 끼어들기와는 완전히 맞아떨어지지 않는다. 일상 사용에 더 가까운 지표는 AliMeeting의 20.63%이며, '실용적'이라 부르기에는 아직 거리가 있다. 샤오미도 중국어 다화자 시나리오에서의 성적은 따로 공개하지 않았다.

참고 출처: 샤오미 오픈소스 저장소 xiaomi-research/xiaomi-cocktailasr-1, CocoLoop, arXiv 기술 보고서 2609.11274, ITHome; 각 데이터셋의 오류율과 거부율 수치는 기술 보고서 기준이다.