Qwen giảm giá toàn bộ dòng giọng nói, nhận dạng giảm tới 95%

Ngày 23/9, Qwen của Alibaba ra mắt dòng mô hình giọng nói Qwen-Audio-3.1, tung ra cùng lúc năm mô hình bao phủ nhận dạng, tổng hợp, hội thoại thời gian thực và sáng tạo âm thanh, đồng thời hạ giá đồng loạt cho toàn bộ dòng sản phẩm giọng nói: tổng hợp giọng nói (TTS) giảm khoảng 70%, giọng nói thời gian thực (Realtime) giảm khoảng 85%, nhận dạng giọng nói (ASR) giảm tới 95%.

Năm mô hình chia thành hai nhóm. Ba mô hình là bản nâng cấp của các dòng sản phẩm cũ:

  • Qwen-Audio-3.1-ASR: một mô hình duy nhất hỗ trợ 30 ngôn ngữ và 16 phương ngữ tiếng Trung, hãng cho biết đạt kết quả tốt nhất trên 11 tập con kiểm thử phương ngữ, các phương ngữ khó như tiếng Ôn Châu được cải thiện rõ rệt, độ trễ phản hồi ký tự đầu tiên khoảng 160 mili giây;
  • Qwen-Audio-3.1-TTS: tổng hợp đa ngôn ngữ, hỗ trợ chuyển giọng xuyên ngôn ngữ, có thể dùng ngôn ngữ tự nhiên để chỉ định ngữ điệu, ví dụ yêu cầu "đọc bằng giọng cứng rắn, không khoan nhượng";
  • Qwen-Audio-3.1-Realtime: hội thoại song công hoàn toàn, vừa nói vừa nghe, có thể bị ngắt lời bất cứ lúc nào, hỗ trợ gọi công cụ; hãng cho biết mô hình sẽ nói chậm lại khi phát hiện người dùng có tâm trạng thấp.

Hai mô hình còn lại là gương mặt mới:

  • TTS-Next: khung thống nhất kết hợp mô hình ngôn ngữ và mô hình khuếch tán, tạo đồng thời giọng nói, hiệu ứng âm thanh và nhạc nền trong một lần, hướng đến sách nói, podcast, trò chơi và quảng cáo;
  • ASR-Next: có thể phân biệt người nói khi nhiều người nói cùng lúc, đưa ra dấu thời gian và văn bản khớp, đồng thời nhận diện cảm xúc, âm thanh môi trường và âm thanh máy móc, phục vụ mô tả âm thanh, định vị sự kiện và hỏi đáp về âm thanh.

Bảng điểm phương ngữ

Trong tài liệu công bố, Qwen đưa ra vài bộ số liệu về phương ngữ: tỷ lệ lỗi ký tự trung bình khi nhận dạng giọng nói phương ngữ tiếng Trung là 10,38%, độ chính xác ngữ nghĩa câu trung bình khi dịch phương ngữ là 82,10%. Đây là số liệu tự kiểm thử của hãng, thành phần tập kiểm thử chưa được công bố đầy đủ, hiện chưa có kết quả tái lập từ bên thứ ba.

Đối với các nhà phát triển trong nước, nhận dạng phương ngữ là nhu cầu thực sự. Trong dịch vụ khách hàng, đường dây nóng hành chính công, livestream thương mại điện tử cấp huyện, mô hình nhận dạng tiếng phổ thông chính xác nhưng vừa gặp phương ngữ là loạn, đây là điểm nghẽn khiến nhiều sản phẩm giọng nói khó triển khai thực tế. Việc gộp 16 phương ngữ vào cùng một mô hình ít nhất cũng giúp bớt phải chuyển đổi mô hình theo từng vùng.

So sánh với ElevenLabs

Ở mảng tổng hợp giọng nói, đối tượng so sánh ở nước ngoài thường là ElevenLabs. Dịch vụ định tuyến bên thứ ba OrcaRouter từng tổng hợp một bộ giá: gói TTS Plus của Qwen-Audio-3.0 thế hệ trước có giá khoảng 27,6 USD/triệu ký tự, gói Flash khoảng 15 USD; ElevenLabs Eleven v3 giá tiêu chuẩn khoảng 100 USD/triệu ký tự, gói Flash khoảng 50 USD.

Tính sơ bộ theo mức "giảm khoảng 70%", gói Plus của phiên bản 3.1 sẽ rơi xuống hơn 8 USD/triệu ký tự một chút. Đây chỉ là ước tính, bản thân thông báo chỉ đưa ra mức giảm, giá mới cụ thể sẽ theo bảng giá của Alibaba Cloud Bailian.

Về chất lượng, theo dữ liệu tháng 8 trên đấu trường giọng nói của Artificial Analysis, điểm Elo của Qwen-Audio-3.0-TTS-Plus là 1234, còn Eleven v3 là 1168. Phiên bản TTS 3.1 chưa xuất hiện trên bất kỳ đấu trường công khai nào, việc chất lượng âm thanh của phiên bản mới tiến hay lùi hiện chỉ có lời của chính hãng.

Ứng dụng ở đâu

Lần này Qwen gắn mô hình giọng nói với một loạt sản phẩm nhà mình: trợ lý lập trình Qoder, Qwen văn phòng, cùng các thiết bị phần cứng như QwenNote, A2, Eva, kính AI Qwen và kính AI Leqi. Các thiết bị như kính, bút ghi âm gọi API giọng nói theo phút, theo lượt, việc nhận dạng và hội thoại thời gian thực giảm giá 85-95% có tác động trực tiếp nhất đến chi phí dịch vụ trên từng thiết bị của các hãng phần cứng.

Mức giảm của hội thoại thời gian thực đứng thứ hai. Một cuộc gọi thời gian thực thường phải chạy đồng thời nhận dạng, suy luận và tổng hợp, thuộc nhóm có chi phí đơn vị cao trong các sản phẩm giọng nói; sau đợt giảm giá này, liệu trợ lý giọng nói có thể mở miễn phí lâu dài cho người dùng hay không còn tùy vào chính sách giá của các bên tích hợp trong quý tới.

Nguồn tham khảo: Qwen công bố chính thức, ITHome, The Decoder, CocoLoop, tổng hợp giá của OrcaRouter; mức giảm giá và số liệu kiểm thử phương ngữ theo công bố chính thức của Qwen, giá phiên bản cũ và ElevenLabs do bên thứ ba tổng hợp, điểm số đấu trường theo bảng xếp hạng công khai của Artificial Analysis.