StepFun ra mắt 5 mô hình giọng nói, tỷ lệ lỗi từ xuống còn 1,7%
StepFun công bố loạt StepAudio 3 gồm 5 mô hình giọng nói cùng ngày, ASR đạt tỷ lệ lỗi từ 1,7%, đồng hạng nhất trên bảng xếp hạng Artificial Analysis.
4 bài đã kiểm chứng về Nhận dạng giọng nói, sản phẩm và diễn biến ngành.
StepFun công bố loạt StepAudio 3 gồm 5 mô hình giọng nói cùng ngày, ASR đạt tỷ lệ lỗi từ 1,7%, đồng hạng nhất trên bảng xếp hạng Artificial Analysis.
Xiaomi mở mã nguồn mô hình Xiaomi-CocktailASR-1, chuyên tách lời một người nói mục tiêu giữa đám đông ồn ào, đạt lỗi ký tự 12,29% khi ba người nói chồng, trong khi các mô hình ASR thông dụng sai 76-121%.
Thử nghiệm của Hume AI trên 11 mô hình ASR cho thấy điểm WER thấp nhất thường trùng với tỷ lệ lặp lại lỗi văn bản tham chiếu cao nhất, đặt câu hỏi về cách chọn mô hình giọng nói cho sản xuất.
Tencent ra mắt Hy ASR 3.0 preview với số liệu WER, phạm vi phương ngữ và giới hạn API Tencent Cloud.