Google tái cấu trúc AI giọng nói, ra mắt Gemini 3.1 Flash Live

Ngày 26 tháng 3, Google đã phát hành Gemini 3.1 Flash Live.

Nếu bạn nghĩ đây chỉ là một API tổng hợp giọng nói nhanh hơn và rẻ hơn, thì đáng để xem xét lại. Mô hình này mang một thay đổi căn bản về kiến trúc kỹ thuật.

Cách AI giọng nói truyền thống hoạt động

Tương tác giọng nói AI trước đây về cơ bản là một quy trình ba bước:

  1. Nhận dạng giọng nói (ASR): Chuyển đổi âm thanh của bạn thành văn bản
  2. Suy luận mô hình ngôn ngữ: Văn bản được đưa vào LLM để tạo ra câu trả lời dạng văn bản
  3. Tổng hợp giọng nói (TTS): Chuyển đổi văn bản trở lại thành đầu ra giọng nói

Mỗi bước đều có độ trễ, cộng dồn lại tạo ra cảm giác nói xong phải chờ một lúc mới có câu trả lời. Hơn nữa, mỗi lần chuyển đổi đều làm mất thông tin — giọng điệu, sự ngập ngừng, cảm xúc của bạn đều biến mất ở bước văn bản.

Gemini 3.1 Flash Live đã làm gì

Nó nén quy trình ba bước này thành một mô hình âm thanh gốc từ đầu vào đến đầu ra (audio-to-audio).

Không qua trạng thái trung gian là văn bản, trực tiếp từ đầu vào giọng nói của bạn tạo ra đầu ra giọng nói.

Thông số kỹ thuật:

  • Đầu vào âm thanh: PCM 16-bit, tốc độ lấy mẫu 16kHz
  • Đầu ra âm thanh: 24kHz
  • Phương thức kết nối: Kết nối dài có trạng thái dựa trên WebSocket
  • Hỗ trợ hơn 70 ngôn ngữ

Vì không có bước chuyển đổi trung gian, độ trễ giảm đáng kể và có thể nắm bắt được các thông tin như ngữ điệu, tốc độ nói mà văn bản không có.

Cụ thể có thể làm gì

Chức năng ngắt lời (Barge-in): Có thể ngắt lời AI khi nó đang nói, đặt lại câu hỏi hoặc thay đổi hướng — TTS truyền thống không làm được điều này, bạn phải đợi nó nói xong mới có thể nói câu tiếp theo.

Gọi công cụ: Có thể gọi hàm và Google Search, nghĩa là trong quá trình hội thoại giọng nói, mô hình có thể tra cứu thông tin và thực hiện thao tác theo thời gian thực.

Phiên âm hai chiều: Nội dung của cả hai bên trong cuộc hội thoại đều có thể được phiên âm đồng thời, thuận tiện cho việc ghi chép và phân tích.

Hai chế độ triển khai: Server-to-server (phù hợp cho các hệ thống hậu trường như chatbot dịch vụ khách hàng) và client-to-server (phù hợp cho các ứng dụng giọng nói trực tiếp hướng tới người dùng).

Kết quả benchmark

ComplexFuncBench Audio, bài kiểm tra chuyên đánh giá hiệu suất của mô hình giọng nói trong các tình huống gọi hàm phức tạp, Gemini 3.1 Flash Live đạt 90,8%.

Tác động thực tế

Một trong những rào cản lớn nhất của AI giọng nói hiện nay là cảm giác ngập ngừng như khi gọi điện thoại chưa kết nối được. Giảm độ trễ và hỗ trợ ngắt lời là điều kiện cần thiết để tương tác giọng nói thực sự tiến gần đến hội thoại tự nhiên.

Mô hình này được mở cho các nhà phát triển thông qua Gemini Live API trong Google AI Studio và cũng đã được tích hợp vào Gemini Live (dành cho người dùng tại hơn 200 quốc gia).

Chiến lược của Google trong mảng giọng nói, từ Gemini 2.5 Flash Native Audio đến Gemini 3.1 Flash Live hiện tại, rất nhất quán: coi giọng nói là công dân hạng nhất, thay vì chỉ dán một lớp TTS lên LLM.

Nguồn tham khảo: Gemini 3.1 Flash Live: Making audio AI more natural and reliable (Google Blog); CocoLoop, Google Releases Gemini 3.1 Flash Live: A Real-Time Multimodal Voice Model (MarkTechPost); Gemini Live gets its biggest upgrade yet with Gemini 3.1 Flash Live (9to5Google)