Ngày 15/9, StepFun công bố loạt StepAudio 3, tung ra cùng lúc năm mô hình: StepAudio 3 Realtime, ASR, TTS, Gen và Music, tất cả đều lên nền tảng mở của StepFun.
Theo bảng xếp hạng của tổ chức đánh giá độc lập Artificial Analysis, Realtime đạt điểm tổng hợp 98,9% ở hạng mục Conversational Dynamics, đứng đầu bảng; cũng trên bảng Speech Reasoning của tổ chức này, độ chính xác suy luận giọng nói của nó là 99,7%, cũng đứng đầu. ASR đạt tỷ lệ lỗi từ 1,7% trên bảng độ chính xác nhận dạng giọng nói không streaming, đồng hạng nhất.
Năm mô hình, mỗi mô hình một vai trò
Phân công đại thể như sau: Realtime phụ trách hội thoại thời gian thực song công toàn phần, mô hình suy luận trực tiếp trên tín hiệu giọng nói mà không qua bước chuyển thành văn bản; ASR đưa khả năng hiểu ngữ nghĩa của mô hình lớn vào khâu nhận dạng, theo công bố chính thức có thể xử lý phương ngữ, pha trộn Trung-Anh và thuật ngữ chuyên ngành; TTS tổng hợp giọng nói ở mức gần người thật, ngoài đọc đúng chữ còn khôi phục các yếu tố cận ngôn ngữ như ngắt nghỉ, ngữ điệu; Gen đưa giọng người, hiệu ứng âm thanh, âm thanh môi trường và nhạc nền vào cùng một giao diện tạo sinh; Music hỗ trợ sáng tác tương tác nhiều lượt, còn có thể dùng ký âm ABC để điều khiển giai điệu trực tiếp.
Trong năm mô hình, phần công phu nhất nằm ở khả năng "suy luận giọng nói gốc" (native voice reasoning) của Realtime. Cách làm truyền thống là chuyển giọng nói thành văn bản, suy luận trên văn bản, rồi chuyển văn bản trở lại thành giọng nói — ba đoạn ghép lại, ngữ điệu, trọng âm và cảm xúc đã mất ngay từ bước đầu tiên. Bỏ qua bước chuyển đổi này, mô hình mới có cơ hội hiểu được câu "bạn nói hay thật" là khen hay châm biếm.
Công bố không đề cập một chữ nào về việc có mã nguồn mở hay không, cũng như cách tính phí.
Con số 1,7% nên hiểu thế nào
Tỷ lệ lỗi từ 1,7% là kết quả ở chế độ không streaming, điều kiện giới hạn này không thể bỏ qua. Không streaming nghĩa là lấy trọn đoạn âm thanh rồi mới chuyển thành văn bản, mô hình có thể xem cả ngữ cảnh trước lẫn sau; streaming đòi hỏi vừa nghe vừa xuất chữ, chỉ thấy được phần đã qua, tỷ lệ lỗi thường cao hơn hẳn. Đặt hai con số ở hai đường đua khác nhau cạnh nhau để so sánh là vô nghĩa.
"Đồng hạng nhất" cũng là một thông tin. Nó cho thấy vị trí này không phải độc chiếm — ít nhất còn một mô hình khác dừng ở cùng mức thập phân đó; ở hạng mục nhận dạng không streaming, khoảng cách giữa nhóm dẫn đầu đã lùi xuống hàng phần nghìn.
Sự khác biệt thực sự nhiều khả năng nằm ngoài bảng xếp hạng: bao nhiêu phương ngữ được phủ, chuyển đổi khi nói pha trộn có mượt hay không, thuật ngữ chuyên ngành có cần cấu hình thêm hay không. StepFun có nhắc đến những điểm này nhưng chưa đưa ra con số có thể so sánh.
Ý nghĩa với các đội ngũ trong nước
Trong năm nay, mật độ các mô hình giọng nói được công bố công khai tại Trung Quốc không hề thấp. Tencent Hunyuan từng mở mã nguồn mô hình AuK, Xiaomi từng mở mã nguồn một mô hình nhận dạng đa người nói, mô hình giọng nói của Tongyi (Alibaba) đã được bổ sung khả năng gọi công cụ. Khác biệt nằm ở hướng đi: các bên mở mã nguồn công bố trọng số để ai cũng có thể lấy về chỉnh sửa; còn năm mô hình lần này của StepFun được đưa thẳng lên nền tảng mở của chính họ, gọi qua API — ngưỡng vào thấp hơn với những đội ngũ không định tự xây cụm suy luận, đổi lại là mô hình chạy trên máy của người khác.
Với các đội ngũ làm sản phẩm giọng nói, điều quyết định có tích hợp hay không thường là ba việc khác: độ trễ đầu-cuối của Realtime có thể ép xuống bao nhiêu mili-giây, âm sắc của TTS có tùy chỉnh được không, hiệu ứng âm thanh do Gen tạo ra có giấy phép thương mại hay không. Cả ba điểm này công bố đều chưa nói rõ, phải chờ tài liệu của nền tảng mở.
Nguồn tham khảo: Công bố chính thức của StepFun, bảng xếp hạng Artificial Analysis, CocoLoop, ITHome; tên gọi năm mô hình, cách tính điểm Conversational Dynamics và Speech Reasoning, cũng như tỷ lệ lỗi từ không streaming đều lấy theo công bố chính thức và trang bảng xếp hạng.