Ngày 9 tháng 9, Tencent Hunyuan đã mã nguồn mở mô hình tạo và chỉnh sửa giọng nói AuK. Mã nguồn được đặt trong tổ chức Tencent-Hunyuan trên GitHub, trọng số được đăng đồng thời lên Hugging Face và ModelScope, báo cáo kỹ thuật mang mã arXiv 2609.08936.
Định vị của mô hình này không phải là thêm một công cụ TTS nữa. Nó gom công việc vốn rải rác trong hàng chục mô hình chuyên dụng trên chuỗi xử lý giọng nói vào một cửa ngõ duy nhất: dùng lệnh ngôn ngữ tự nhiên kèm một đoạn âm thanh tham chiếu, nói rõ cần làm gì, mô hình sẽ xuất ra đoạn âm thanh đã được chỉnh sửa.
Hàng chục việc, một cửa ngõ duy nhất
Tài liệu chính thức chia các tác vụ thành sáu nhóm. Phía tạo sinh gồm chuyển văn bản thành giọng nói zero-shot và TTS theo chỉ dẫn; phía chỉnh sửa chia ba lớp — lớp nội dung sửa lời nói ra và lời bài hát, lớp âm học sửa cao độ, tốc độ nói, âm lượng, lớp cận ngôn ngữ sửa cảm xúc, âm sắc, khẩu âm và các âm thanh phi ngôn ngữ, kể cả chuyển giọng nói bình thường thành giọng thì thầm; phía xử lý gồm khử nhiễu, khử vang, tách nhạc và trích xuất giọng người nói mục tiêu.
Trước đây mỗi tác vụ về cơ bản ứng với một mô hình riêng biệt. Đội làm lồng tiếng phải cài một bộ TTS, muốn đổi cảm xúc phải có thêm một bộ chuyển đổi âm sắc khác, muốn loại bỏ tiếng nền lại cần một bộ mô hình tách nguồn khác, định dạng âm thanh, tần số lấy mẫu và phiên bản thư viện phụ thuộc của ba bộ này đều khác nhau, phần lớn công sức kỹ thuật thường dồn vào việc ghép chúng lại với nhau. Cách làm của AuK là biến lệnh chỉ dẫn thành giao diện thống nhất, để mô hình tự phán đoán nên đi theo đường nào.
Phần mã hoá dùng Qwen2.5-Omni-3B làm nền tảng mô hình lớn đa phương thức. Ngoài API Python, kho mã còn đi kèm giao diện Gradio và node ComfyUI, cả hai đều là cổng vào quen thuộc của cộng đồng âm thanh - video mã nguồn mở hiện nay. Các ví dụ trong video demo là tiếng Trung và tiếng Anh.
AuK-Flash nhanh ở đâu
AuK-Flash là phiên bản nhanh được chưng cất từ mô hình nền, NFE cố định là 4, CFG đặt bằng 0. Quy trình chưng cất theo mô tả chính thức gồm hai giai đoạn: trước tiên dùng khởi tạo nhất quán cấp quỹ đạo để đưa mô hình học trò ít bước vào guồng, sau đó chuyển sang mục tiêu DMD tách rời theo định tuyến tác vụ, riêng tác vụ tách nguồn dùng hồi quy dự đoán sạch để giám sát.
Với người dùng, những chi tiết này có nghĩa là: các mô hình giọng nói dạng khuếch tán thông thường mỗi lần tạo phải chạy vài chục bước lấy mẫu, còn phải chạy thêm một nhánh không điều kiện để đảm bảo chất lượng; AuK-Flash cắt bỏ cả hai khoản chi phí đó, cái giá phải trả là chất lượng chỉ "gần" chứ không bằng mô hình giáo viên. Con số hãng công bố là tăng tốc 4,5 lần theo thời gian thực, không công bố mức tổn thất tương ứng trên các chỉ số khách quan.
So với các mô hình mã nguồn mở khác trong lĩnh vực này
Mật độ mô hình giọng nói mã nguồn mở năm nay không hề thấp. Mistral từng phát hành mô hình giọng nói 4B, đối chuẩn với ElevenLabs; Qwen3.5-Omni của Alibaba gộp văn bản, âm thanh, video vào một bộ và hỗ trợ nhân bản giọng nói; bản thân Hunyuan trước đó cũng đã mã nguồn mở mô hình nền Hy4 và khung tăng tốc suy luận.
Điểm khác biệt của AuK không nằm ở điểm số benchmark, mà ở hai chữ "chỉnh sửa". Hướng chính của các mô hình kể trên là tạo sinh, cho văn bản để ra giọng nói; một nửa chức năng của AuK là lấy một đoạn âm thanh có sẵn vào để chỉnh sửa, sửa xong vẫn phải giữ được âm sắc và nhịp điệu của người nói gốc. Đây là hai bài toán kỹ thuật khác nhau, bài toán sau đòi hỏi tính nhất quán khắt khe hơn, cũng sát với quy trình hậu kỳ thực tế hơn.
Giấy phép MIT là điểm đáng nói riêng. Nó cho phép sử dụng thương mại, chỉnh sửa và phân phối lại, miễn là giữ ghi công, thoáng hơn nhiều so với giấy phép tuỳ chỉnh đi kèm không ít mô hình mã nguồn mở trong nước. Với các đội nhỏ muốn đưa năng lực giọng nói vào sản phẩm, điều khoản giấy phép đôi khi quyết định lựa chọn hơn cả số lượng tham số.
Hãng chưa công bố các con số WER, độ tương đồng người nói hay MOS so với các mô hình khác; kho mã có liệt kê bảng đối chiếu hiệu năng trên bốn nhóm tác vụ tạo sinh, chỉnh sửa, tăng cường, tách nguồn, nhưng điểm số cụ thể cần tự tái lập mới có. Tuyên bố "ra mắt đã dẫn đầu" hiện chỉ đến từ lời truyền tai của cộng đồng, chưa có đánh giá độc lập từ bên thứ ba theo sau.
Nguồn tham khảo: Kho mã và báo cáo kỹ thuật Tencent-Hunyuan/AuK, CocoLoop, trang bài báo trên Hugging Face; số lượng tham số, giấy phép và tỷ lệ tăng tốc đã được đối chiếu theo mô tả chính thức trong kho mã, điểm số đánh giá chưa được xác minh độc lập.