Mô hình chuyển giọng nói mới của Google giảm tỷ lệ lỗi từ xuống 2,6%

Ngày 26 tháng 8, Google ra mắt Gemini 3.5 Transcribe, một mô hình chuyên chuyển giọng nói thành văn bản, gồm hai nhánh: truyền trực tuyến theo thời gian thực và xử lý âm thanh đã ghi sẵn.

Theo phép đo của Artificial Analysis, tỷ lệ lỗi từ (WER) trung bình của phiên bản không truyền trực tuyến là 2,6%, phiên bản truyền trực tuyến là 4,0%. Trên bộ chuẩn đa ngôn ngữ FLEURS, con số này là 5,50% cho bản truyền trực tuyến và 5,04% cho bản không truyền trực tuyến. So với thế hệ trước Chirp 3, thời gian trả về bản ghi cuối cùng rút ngắn 70%. Mô hình hỗ trợ hơn 85 ngôn ngữ, có thể tự động nhận diện.

Đầu ra là một bản thảo hoàn chỉnh

Định vị mà Google đặt ra cho mô hình này là chuyển âm thanh gốc trực tiếp thành văn bản chính xác, sạch và đã được định dạng sẵn. Cụ thể mô hình làm ba việc: xử lý các trường hợp người nói tự sửa lời (ví dụ chính thức là "let's meet Tuesday—no, Wednesday", mô hình giữ lại kết quả cuối cùng là thứ Tư); loại bỏ các từ đệm như "um", "ah"; và tự động hoàn thành việc định dạng.

Các mô hình nhận dạng giọng nói truyền thống chỉ cho ra luồng bản ghi thô, những thao tác làm sạch nói trên phải thực hiện ở khâu sau, bằng một mô hình khác hoặc một bộ quy tắc riêng. Khi gộp việc này vào bên trong mô hình chuyển giọng nói, phần tiết kiệm được là một lượt gọi và một vòng độ trễ. Với các đội xây dựng agent thoại thời gian thực, độ trễ ở lớp này thường chính là ranh giới quyết định trải nghiệm có "giống như đang trò chuyện" hay không.

Mô hình còn hỗ trợ gọi hàm (function calling), có thể chuyển giao các tác vụ phức tạp ngay trong lúc chuyển giọng nói thành văn bản; ngoài ra còn có danh sách từ vựng tùy chỉnh, phân biệt người nói (tối đa 3 người với âm thanh ghi sẵn, trên 3 người vẫn ở dạng thử nghiệm), dấu thời gian theo từng từ, và chuyển đổi ngôn ngữ ngay giữa cuộc gọi.

Hai API cho hai kịch bản

Nhánh thời gian thực có tên gemini-3.5-transcribe-live, chạy trên Live API, hướng tới các ứng dụng giọng nói tương tác; nhánh xử lý âm thanh ghi sẵn là gemini-3.5-transcribe, chạy trên Interactions API, hướng tới biên bản cuộc họp và nhật ký cuộc gọi.

Phía nhà phát triển có thể tiếp cận qua Gemini API (Google AI Studio) và Google Antigravity, hiện đang ở giai đoạn xem trước công khai; phía doanh nghiệp đi qua bản xem trước của Gemini Enterprise Agent Platform, sau đó sẽ tích hợp vào Gemini Enterprise for Customer Experience. Người dùng phổ thông hiện có ba cửa ngõ để tiếp cận: ứng dụng Gemini trên macOS (chỉ tiếng Anh), Rambler trên Android (một số quốc gia và ngôn ngữ), còn hỗ trợ trên Chrome sẽ đến sau.

Hai câu hỏi còn lại ngoài những con số

Google chưa công bố giá. Chuyển giọng nói thành văn bản là mô hình kinh doanh tính phí theo phút, nếu tỷ lệ lỗi từ 2,6% đi kèm mức giá cao hơn đối thủ, nhịp độ triển khai thực tế sẽ chậm lại — hai năm qua lĩnh vực này đổi thế hệ liên tục, khách hàng khá nhạy cảm với chi phí chuyển đổi, và giá thường quyết định việc mua sắm nhiều hơn là chênh lệch độ chính xác vài phần mười phần trăm.

Phân biệt người nói chỉ đảm bảo độ chính xác trong phạm vi 3 người, giới hạn này loại một loạt kịch bản tần suất cao ra ngoài: họp nhiều người, kiểm tra chất lượng dịch vụ khách hàng, chuyển văn bản podcast — các trường hợp trên 3 người là chuyện thường ngày. Google xếp trường hợp trên 3 người vào dạng thử nghiệm, tức là thừa nhận phần này chưa ổn định.

Thử tính nhanh ý nghĩa thực tế của con số: tỷ lệ lỗi từ 2,6% tương ứng khoảng 26 từ sai trong một đoạn ghi âm cuộc họp dài 1.000 từ (ước tính, phân bổ thực tế phụ thuộc nhiều vào giọng nói và tiếng ồn nền). Với các kịch bản pháp lý, y tế cần trích dẫn chính xác từng chữ, mức sai số này vẫn cần người kiểm tra lại; nhưng với việc tạo biên bản cuộc họp hay đưa ngữ cảnh cho agent, mức này đã đủ dùng. Ranh giới giữa hai nhu cầu không nằm ở mô hình, mà ở cách văn bản được sử dụng ở khâu sau.

Mảng giọng nói năm nay có nhiều động thái dồn dập, từ việc OpenAI ra mắt liền ba mô hình giọng nói, đến việc các hãng đưa API giọng nói vào ngăn xếp agent, tiêu chí cạnh tranh đang chuyển từ "nhận dạng chính xác" sang "có tiết kiệm công sức khi đưa vào quy trình hay không". Gemini 3.5 Transcribe gộp việc làm sạch và định dạng vào bên trong mô hình, đi theo đúng hướng đó.

Nguồn tham khảo: Blog chính thức của Google, CocoLoop, Artificial Analysis, tài liệu mô hình DeepMind; tỷ lệ lỗi từ, mức cải thiện độ trễ và số ngôn ngữ hỗ trợ được đối chiếu theo trang công bố chính thức, giá chưa được công bố.