Alibaba ra mắt mô hình phiên dịch thời gian thực, độ trễ còn 2,3 giây

Ngày 19 tháng 9, đội ngũ Qwen của Alibaba ra mắt mô hình phiên dịch đồng thời thời gian thực Qwen3.8-LiveTranslate, đưa độ trễ trung bình mỗi từ từ 2,8 giây của thế hệ trước xuống còn 2,3 giây. Mô hình hỗ trợ hiểu 60 ngôn ngữ và xuất giọng nói ở 29 ngôn ngữ, đồng thời mở trang trải nghiệm và API.

Cái khó của phiên dịch đồng thời không nằm ở chất lượng bản dịch, mà ở sự đánh đổi giữa chất lượng và độ trễ. Chờ càng nhiều chữ, cấu trúc câu càng trọn vẹn, bản dịch càng chính xác; nhưng chờ càng lâu, người nghe càng khó theo kịp. Nửa giây được rút ngắn này chính là trọng tâm của lần ra mắt này.

Interleave ghép ba công đoạn làm một

Mô hình dùng kiến trúc hai mô-đun Thinker–Talker dựa trên Hybrid MoE. Thinker xử lý đầu vào âm thanh và video rồi hoàn thành việc dịch, Talker chịu trách nhiệm tạo giọng nói và giữ nguyên âm sắc của người nói gốc. Hai mô-đun được nối với nhau theo cách Interleave, đan xen ba khâu: hiểu theo dòng, xuất văn bản và tạo giọng nói.

Ý nghĩa của cấu trúc này là ba công đoạn không còn phải chờ nhau tuần tự nữa. Cách làm truyền thống là nghe xong một đoạn, dịch xong đoạn đó, rồi mới tổng hợp giọng nói, mỗi đoạn đều phải gom đủ đầu vào; còn Interleave cho phép đoạn sau bắt đầu xử lý khi đoạn trước chưa kết thúc, nhờ đó độ trễ được kéo xuống. Cái giá phải trả là yêu cầu về độ ổn định khi xử lý theo dòng của mô hình cao hơn hẳn, chỉ cần nửa câu đầu hiểu sai thì giọng nói của nửa câu sau đã phát ra rồi.

Ngoài độ trễ, phiên bản này bổ sung ba năng lực mới: tách người nói theo thời gian thực và giữ riêng âm sắc từng người, hiển thị bản gốc và bản dịch cùng khung cùng màn hình, khử nhập nhằng ngữ cảnh dài. Hai năng lực đầu là nhu cầu thiết yếu trong họp hành, khi nhiều người nói lẫn nhau vẫn phân biệt được ai đang nói, bản dịch và bản gốc có thể đối chiếu; năng lực thứ ba nhắm vào những trường hợp ngữ cảnh trước sau quyết định nghĩa của từ.

Hai bộ đánh giá, độ bao phủ chênh nhau 5 lần

Alibaba đưa ra hai bộ số liệu. Một bộ trên tập kiểm thử âm thanh công khai FLEURS, bao phủ 70 hướng ngôn ngữ, Alibaba cho biết mô hình vượt trội hơn thế hệ trước và các hệ thống phiên dịch đồng thời thời gian thực chủ lưu hiện nay ở bốn khía cạnh: chất lượng dịch, độ trễ trung bình mỗi từ, độ chính xác nhận dạng giọng nói và chất lượng tổng hợp giọng nói. Bộ còn lại trên Omnilingua-MSpeaker, đây là tập đánh giá âm thanh dài nhiều người nói do Alibaba tự xây, bao phủ 14 hướng ngôn ngữ, so sánh độ trung thực của bản dịch, độ trôi chảy, độ súc tích và tỷ lệ lỗi nhận diện người nói.

Độ bao phủ của hai bộ chênh nhau 5 lần, và đúng bộ có độ bao phủ hẹp hơn lại là bộ đo năng lực tách người nói được quảng bá chính trong lần này. Tập công khai không có chỉ số tương ứng cho nhiều người nói, nên việc tái hiện độc lập từ bên ngoài chỉ có thể bắt đầu từ 70 hướng của FLEURS. Cụ thể mỗi khía cạnh trong bốn khía cạnh vượt trội bao nhiêu, tài liệu chính thức không đưa ra con số cho từng mục.

So ngang hàng, đối thủ ở đâu

Hiện tại phiên dịch đồng thời thời gian thực có vài hướng công nghệ khác nhau. Một hướng là nối chuỗi ba công cụ đã chín muồi: nhận dạng giọng nói, dịch máy, tổng hợp giọng nói, kỹ thuật ổn định, dễ thay thế từng phần, nhưng độ trễ thường trên 3 giây; hướng còn lại là mô hình đầu cuối giọng nói sang giọng nói, độ trễ thấp nhưng độ bao phủ ngôn ngữ thường không rộng. Con số 60 ngôn ngữ hiểu, 29 ngôn ngữ xuất cùng độ trễ 2,3 giây mà Qwen3.8-LiveTranslate công bố nằm ở giữa hai hướng này, nghiêng về phía đầu cuối.

Muốn so sánh thật sự, phải nhìn vào con số trên cùng một tập kiểm thử, cùng một hướng ngôn ngữ. Hiện tại phần so sánh công khai duy nhất là của chính Alibaba, bên thứ ba tái hiện độc lập trên FLEURS vẫn chưa xuất hiện.

Những điều chưa được nói tới

Lần ra mắt này không đề cập đến việc mã nguồn mở và giấy phép sử dụng, cũng chưa công bố giá API. Nhìn vào nhịp độ của Alibaba với dòng Qwen trong năm nay, phần lớn các mô hình cấp Flash đều mở API trước rồi mới phát hành trọng số sau, nhưng liệu mô hình này có đi theo lối đó hay không thì phía chính thức chưa lên tiếng.

Các tình huống như họp hành, phát trực tiếp, chăm sóc khách hàng xuyên biên giới đòi hỏi ở phiên dịch đồng thời không chỉ con số độ trễ. Tốc độ phục hồi sau lỗi ngắt câu, độ bền vững trước giọng địa phương, tính nhất quán của tên riêng, tất cả những điều này chỉ có thể biết được khi chạy qua âm thanh thực tế. Trang trải nghiệm đã mở, câu trả lời nằm trong tay người dùng.

Nguồn tham khảo: Thông báo chính thức của Qwen (Alibaba), CocoLoop, Tencent News, iFeng; các số liệu về độ trễ, số lượng ngôn ngữ và độ bao phủ hướng ngôn ngữ của hai bộ đánh giá được đối chiếu theo công bố chính thức, mức độ vượt trội cụ thể ở bốn khía cạnh chưa được phía chính thức công bố chi tiết.