Tencent Hunyuan công bố Hy ASR 3.0 preview ngày 4 tháng 8. QbitAI cho biết phiên bản này dựa trên Hy3, kết hợp nhận dạng giọng nói với hiểu ngữ nghĩa. Tài liệu Tencent Cloud xác nhận nhà phát triển có thể gọi qua real-time speech recognition WebSocket API bằng cách đặt engine_model_type là Hy-ASR-3.0-preview.
Số liệu đầu tiên là WER
QbitAI và ITHome cùng dẫn các số liệu benchmark mở: WER tiếng Quan thoại 3,34%, WER tiếng Anh 2,62% và WER tiếng Quảng Đông 3,12%. Tencent Cloud cũng ghi 20 kênh đồng thời miễn phí và hỗ trợ tiếng Quan thoại, tiếng Anh cùng 20 phương ngữ Trung Quốc.
Các con số này không cùng một loại. WER đo chất lượng mô hình. Số kênh miễn phí và danh sách phương ngữ mô tả ranh giới sản phẩm cloud. Với nhà phát triển, API, hạn mức và phạm vi ngôn ngữ địa phương đều ảnh hưởng chi phí triển khai.
Điểm chính là ngữ cảnh
Tencent nói Hy ASR chuyển từ "逐字转写、单点优化" sang "理解语境、兼容场景、一键直出". Nói trong sản phẩm, mô hình phải dùng câu trước sau để chọn đúng từ đồng âm, thuật ngữ chuyên ngành hoặc mã dự án.
QbitAI cho biết recipe SFT bao phủ context, thuật ngữ chuyên môn, môi trường âm học và nhiều nhóm người nói. Dữ liệu phương ngữ bao gồm 10 vùng lớn và hơn 20 tiểu vùng. Tencent cũng nói tới reinforcement learning nhiều giai đoạn cho chuyển lời nói chung, năng lực Any-context và cảnh âm học long-tail.
Preview vẫn có giới hạn
Tencent Cloud ghi rõ bản preview hiện chỉ hỗ trợ ASR thời gian thực, âm thanh dưới một phút và đầu vào PCM mono 16k. Tách người nói, VAD, thay thế từ vựng và ngưỡng nhiễu chưa được hỗ trợ. Context input và hot words vẫn ở trạng thái sắp mở trải nghiệm.
Vì vậy, giai đoạn đầu phù hợp hơn với nhập giọng nói ngắn, phụ đề thời gian thực, đoạn thoại chăm sóc khách hàng, tìm kiếm bằng giọng nói và lệnh trợ lý. Họp dài hoặc phỏng vấn nhiều người nói vẫn cần sản phẩm trưởng thành hơn.
Nguồn: QbitAI, ITHome, Tencent Cloud documentation, CocoLoop, CLS; verified release timing, WER figures, 20 free concurrent channels, 20 dialects, preview input limits, API parameter and Yuanbao rollout.