Tencent Hunyuan은 8월 4일 Hy ASR 3.0 preview를 발표했다. QbitAI는 이 모델이 Hy3를 기반으로 음성 인식과 의미 이해를 결합한다고 전했다. Tencent Cloud 문서도 실시간 음성 인식 WebSocket API에서 engine_model_type을 Hy-ASR-3.0-preview로 설정하는 방식을 확인해 준다.
먼저 확인되는 수치는 WER
QbitAI와 ITHome은 공개 평가셋에서 중국어 표준어 WER 3.34%, 영어 WER 2.62%, 광둥어 WER 3.12%라는 같은 수치를 인용했다. Tencent Cloud 문서는 20개 무료 동시 채널과 표준어, 영어, 20개 중국어 방언 지원도 제시한다.
이 숫자들은 같은 의미가 아니다. WER는 모델 평가 지표이고, 무료 동시 채널과 방언 범위는 클라우드 제품의 사용 조건이다. 개발자에게는 정확도와 API 한도, 지역 언어 범위가 모두 배포 비용에 영향을 준다.
핵심은 문맥
텐센트 설명에 따르면 Hy ASR은 "逐字转写、单点优化"에서 "理解语境、兼容场景、一键直出"으로 이동한다. 실제로는 동음이의어, 전문 용어, 프로젝트명을 앞뒤 발화로 판단해야 한다는 뜻이다.
QbitAI는 SFT recipe가 context, 전문 명사, 음향 환경, 다양한 화자를 포함한다고 보도했다. 방언 데이터는 10개 주요 방언권과 20개 이상의 하위 지역을 덮는다. 텐센트는 일반 전사, Any-context 능력, 복잡한 장기 꼬리 음향 환경을 위한 다단계 강화학습도 언급했다.
프리뷰의 제한도 뚜렷하다
Tencent Cloud 문서는 현재 프리뷰가 실시간 ASR, 1분 이내 음성, 16k 모노 PCM 입력만 지원한다고 밝힌다. 화자 분리, VAD, 어휘 치환, 노이즈 임계값 기능은 아직 없고, 문맥 입력과 핫워드는 추후 체험 기능으로 남아 있다.
초기 용도는 짧은 음성 입력, 실시간 자막, 고객센터 문장, 음성 검색, 비서 명령에 가깝다. 긴 회의나 다자 인터뷰에는 제품 성숙도가 더 필요하다.
출처: QbitAI, ITHome, Tencent Cloud documentation, CocoLoop, CLS; Hy ASR 3.0 preview release timing, WER figures, 20 free concurrent channels, 20 dialects, preview input limits, API parameter and Yuanbao rollout verified.