Ngày 25 tháng 9, Google Cloud thông báo Gemini 3.8 Live with Live Avatar đã chuyển sang trạng thái chính thức (GA) trên Gemini Enterprise. Phiên bản này bổ sung một "gương mặt" biết nói cho mô hình đối thoại giọng nói thời gian thực vốn có: tạo ra ảnh đại diện video với khẩu hình khớp với giọng nói, nhắm tới các tình huống cần cảm giác con người thật như chăm sóc khách hàng, tư vấn mua sắm, giới thiệu sản phẩm. Tính năng này từng được giới thiệu lần đầu tại Google Cloud Next 2026.
Phiên bản này làm được gì
Theo mô tả trên blog của Google Cloud, Gemini 3.8 Live lần này tập trung vào năm khả năng chính:
- Ảnh đại diện video: tạo ảnh đại diện đối thoại có khẩu hình đồng bộ với giọng nói;
- Giọng nói sang giọng nói: đối thoại bằng giọng nói gốc, người dùng có thể ngắt lời giữa chừng rồi tiếp tục trò chuyện mà không mất ngữ cảnh trước đó hay các thao tác đang chạy ở hậu trường;
- Gọi công cụ không đồng bộ: cuộc trò chuyện không bị gián đoạn trong khi hệ thống gọi API, tra cứu CRM hoặc ERP ở hậu trường;
- Đa ngôn ngữ: nghe và nói được 97 ngôn ngữ, tự động nhận diện ngôn ngữ;
- Thị giác thời gian thực: xử lý đồng thời hình ảnh camera, chia sẻ màn hình và âm thanh.
Về triển khai, dịch vụ cung cấp hai điểm cuối tại Mỹ và EU, hỗ trợ thông lượng đã đặt trước (provisioned throughput), đồng thời nhấn mạnh tuân thủ doanh nghiệp và quản trị dữ liệu.
Thông báo cũng nêu rõ hai giới hạn. Ảnh đại diện tùy chỉnh hiện chỉ mở cho khách hàng nằm trong danh sách trắng — doanh nghiệp muốn dùng hình ảnh hoặc gương mặt đại diện của riêng mình phải được Google phê duyệt trước. Mọi luồng âm thanh và video được tạo ra đều nhúng watermark SynthID vô hình với mắt thường. Ngoài ra, phiên bản có khả năng suy luận dài — Gemini 3.8 Live Extended Thinking — vẫn đang trong giai đoạn xem trước riêng tư (private preview), chưa được chuyển sang chính thức cùng đợt này.
Khách hàng đã dùng nó để làm gì
Thông báo liệt kê bốn khách hàng. Autotrader, thuộc Cox Automotive, dùng công nghệ này làm trợ lý mua xe: ảnh đại diện vừa trò chuyện vừa làm nổi bật các mẫu xe, so sánh phiên bản và giải thích các gói vay trên trang web. Giám đốc sản phẩm của Cox Automotive, bà Marianne Johnson, cho biết:
"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."
(Người mua xe ngày càng muốn diễn đạt nhu cầu bằng lời của chính mình, thay vì phải lần lượt chọn qua các bộ lọc và menu.)
Trợ lý cá nhân của công ty Ấn Độ Equal AI xử lý hơn 1 triệu cuộc gọi thời gian thực mỗi ngày, bao phủ 9 ngôn ngữ Ấn Độ; CEO công ty này cho biết phiên bản mới cải thiện khả năng xử lý ngắt lời, hội thoại đa ngôn ngữ và độ tin cậy khi gọi công cụ. Salesforce cho biết đang kết hợp công nghệ này với Agentforce; còn Specs, một nền tảng trợ lý AI, nhắc tới cải thiện trong phát hiện hoạt động giọng nói và độ trễ tổng thể. Đây đều là những phát biểu từ phía các công ty — thông báo không đưa ra số liệu độ trễ tính bằng mili giây hay tỷ lệ chuyển đổi để so sánh.
Nhà phát triển trong nước Trung Quốc có dùng được không
Gemini Enterprise và Live API được cung cấp dựa trên hạ tầng Google Cloud, nên nhà phát triển tại Trung Quốc đại lục không thể gọi trực tiếp; các đội ngũ hướng ra thị trường quốc tế có thể dùng điểm cuối tại Mỹ hoặc EU. Trong số 97 ngôn ngữ hỗ trợ có tiếng Trung, và các tình huống chăm sóc khách hàng, tư vấn mua sắm cho những thị trường đa ngôn ngữ như Đông Nam Á, Trung Đông là nơi ứng dụng trực tiếp nhất.
Ở Trung Quốc, dịch vụ khách hàng bằng người ảo (digital human) và người ảo livestream đã vận hành được vài năm, cách làm phổ biến là ghép nối nhận dạng giọng nói, mô hình lớn, tổng hợp giọng nói và người ảo khớp khẩu hình thành nhiều khâu riêng biệt — mỗi khâu đều có độ trễ riêng, và xử lý ngắt lời thường là điểm yếu. Lần này Google đưa nghe, nói, nhìn, gọi công cụ và xuất hình ảnh vào cùng một mô hình thời gian thực, đặt cược vào lợi thế của giải pháp đầu-cuối (end-to-end) về độ trễ và trải nghiệm khi bị ngắt lời. Hướng đi nào tiết kiệm hơn còn phụ thuộc vào cách tính phí cho đầu ra ảnh đại diện và chi phí xử lý đồng thời thực tế — hiện chưa có số liệu công khai để so sánh.
Những phần chưa được nói rõ
Về giá của Live Avatar, blog chỉ dẫn tới trang định giá chung mà không nêu riêng mức phí cho đầu ra video ảnh đại diện; điều kiện đăng ký và thời gian xét duyệt danh sách trắng cũng chưa được công bố. Công cụ phát hiện watermark SynthID mở cho những bên thứ ba nào cũng không được nói rõ trong lần này. Đây đều là những yếu tố ảnh hưởng trực tiếp tới chi phí và đánh giá tuân thủ khi doanh nghiệp cân nhắc có triển khai hay không.
Nguồn tham khảo: Blog chính thức của Google Cloud, Android Headlines, CocoLoop, Unite.AI; đã kiểm chứng số lượng ngôn ngữ hỗ trợ, giới hạn danh sách trắng và watermark, số cuộc gọi trung bình mỗi ngày của Equal AI cùng các phát biểu của khách hàng.