Xiaomi mã nguồn mở mô hình giọng nói, lỗi ký tự 12,29% khi ba người nói chồng

Ngày 11 tháng 9, Xiaomi đã mã nguồn mở một mô hình nhận dạng giọng nói có tên Xiaomi-CocktailASR-1, được thiết kế riêng để giải quyết "bài toán buổi tiệc cocktail": khi cả phòng cùng nói chuyện, mô hình chỉ phiên âm lời của đúng người bạn muốn nghe. Mã nguồn được đăng trên GitHub dưới tổ chức xiaomi-research, trọng số mô hình đặt trên Hugging Face, còn báo cáo kỹ thuật được nộp lên arXiv ngày 10 tháng 9.

Đầu vào của mô hình này nhiều hơn một mô hình nhận dạng giọng nói thông thường: một đoạn âm thanh tham chiếu của người nói mục tiêu. Mô hình dùng đoạn âm thanh đó làm gợi ý dấu giọng, tách lời của đúng người này ra khỏi bản ghi âm chồng lấn để phiên âm, còn lời của những người khác thì không xuất hiện trong văn bản.

Con số

Về tỷ lệ lỗi ký tự trên các bộ kiểm tra đa người nói, báo cáo đưa ra các con số sau: LibriMix hai người nói chồng 4,11%, LibriMix3mix ba người nói chồng 12,29%, LibriSpeechMix2mix 2,90%. Trên cùng bộ kiểm tra ba người này, các mô hình nhận dạng giọng nói thông dụng có tỷ lệ lỗi ký tự từ 76% đến 121%. Vượt quá 100% nghĩa là số ký tự sai được chèn vào còn nhiều hơn cả lời gốc — mô hình đã trộn lẫn lời của hai, ba người thành một chuỗi hỗn loạn.

Dữ liệu tình huống thực tế dùng bản ghi âm cuộc họp AliMeeting, ở điều kiện thu xa TS-WER đạt 20,63%, thấp hơn gần bảy điểm phần trăm so với kết quả công bố tốt nhất trước đó là 27,5%. Trên âm thanh sạch một người nói, LibriSpeech đạt 1,73%, ngang ngửa các mô hình thông dụng chủ lưu — chỉ số này quyết định mô hình có thể dùng như một ASR thông dụng hay chỉ là công cụ chuyên dụng cho tình huống nói chồng.

Còn một chỉ số nữa là khả năng từ chối phiên âm. Khi người nói mục tiêu hoàn toàn không lên tiếng, mô hình phải trả về văn bản rỗng. Trên bộ dữ liệu âm tính tiếng Anh, tỷ lệ từ chối đúng của mô hình là 79,59%; báo cáo lấy Gemini-2.5-pro làm đối chứng, mô hình này có tỷ lệ từ chối sai (false rejection) 21,31%, tức là đáng lẽ phải phiên âm thì lại đoán nhầm thành "không ai nói".

Cấu trúc không phức tạp, nhưng dữ liệu huấn luyện không nhỏ

Mô hình gồm ba phần: một bộ mã hóa âm thanh tự giám sát dựa trên Data2Vec2, khoảng 60 triệu tham số, cho ra embedding cấp khung hình 1280 chiều; một adapter tuyến tính chiếu embedding âm thanh vào không gian ẩn của mô hình ngôn ngữ; còn xương sống là Qwen3-8B. Toàn bộ là kiến trúc mô hình ngôn ngữ lớn đầu-cuối, không phải kiểu ghép mô hình âm học với mô hình ngôn ngữ theo lối ASR truyền thống.

Huấn luyện chia làm bốn giai đoạn, riêng giai đoạn hai đã dùng hơn 400.000 giờ dữ liệu đa người nói và 600.000 giờ dữ liệu một người nói. Quy mô này cho thấy năng lực của mô hình chủ yếu đến từ khối lượng dữ liệu và độ phủ của kỹ thuật trộn âm tổng hợp, còn bản thân kiến trúc thì không đặt ra rào cản lớn cho việc tái hiện lại từ bên ngoài.

Mô hình còn hỗ trợ chế độ chuỗi suy luận (chain-of-thought): trước khi phiên âm, nó suy luận xem "đoạn âm thanh này có bao nhiêu người nói, giọng mục tiêu khớp với đoạn nào" rồi mới ra văn bản. Báo cáo cho biết khi bật CoT, tỷ lệ lỗi từ giảm thêm 0,24 điểm phần trăm (giá trị tuyệt đối). Về mặt kỹ thuật, mức lợi 0,24 điểm này nhiều khả năng không bù được chi phí suy luận phát sinh thêm; giá trị của chế độ này nằm nhiều hơn ở khả năng giải thích — khi sai, có thể thấy mô hình phán đoán sai ở bước nào.

Ý nghĩa với việc triển khai tại Trung Quốc

Mảng nhận dạng giọng nói ở Trung Quốc không thiếu giải pháp thương mại, cái thiếu là một sản phẩm mã nguồn mở có thể khóa ổn định vào một người trong cuộc trò chuyện nhiều người. Biên bản cuộc họp, khoang lái xe hơi có nhiều người, kiểm tra chất lượng ghi âm kép của trung tâm chăm sóc khách hàng, thiết bị trợ thính — những tình huống này đều vướng ở cùng một điểm: micro thu vào không chỉ một người.

Hướng ứng dụng của Xiaomi cũng không khó đoán: trợ lý giọng nói trên ô tô và thiết bị IoT đều phải đối mặt với nhiều người cùng ở trong một không gian. Nhưng lần này Xiaomi thả ra trọng số đầy đủ cùng mã nguồn theo hình thức mở, bên thứ ba có thể lấy chạy trực tiếp mà không cần chờ một dịch vụ đám mây nào đó mở API. Tất cả các bộ kiểm tra trong báo cáo cũng đều là bộ dữ liệu công khai, nên rào cản để người khác tái hiện và bắt lỗi cũng thấp đi.

Cần nói thêm một câu: các bộ dữ liệu kiểu LibriMix là ghép nhân tạo từ giọng nói sạch, không hoàn toàn khớp với độ vang, hướng âm thanh và tình huống ngắt lời trong một căn phòng thực tế. Con số sát với việc sử dụng hằng ngày hơn là AliMeeting với 20,63%, vẫn còn một khoảng cách để gọi là "dùng tốt". Xiaomi cũng chưa công bố riêng kết quả của mô hình trong tình huống nhiều người nói tiếng Trung.

Nguồn tham khảo: kho mã nguồn mở của Xiaomi xiaomi-research/xiaomi-cocktailasr-1, CocoLoop, báo cáo kỹ thuật arXiv 2609.11274, IT Home; các số liệu tỷ lệ lỗi ký tự và tỷ lệ từ chối của từng bộ dữ liệu lấy theo báo cáo kỹ thuật.