Ngày 23/9, Google ra mắt hai mô hình tổng hợp giọng nói: Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS. Mô hình đầu hướng đến các kịch bản sáng tạo cần kiểm soát ngữ điệu chi tiết và xây dựng nhân vật, mô hình sau tập trung vào khối lượng gọi lớn với chi phí thấp. Cả hai đều mở trên Gemini API và Google AI Studio ngay trong ngày, bản doanh nghiệp Gemini Enterprise sẽ theo sau.
Làm được những gì
Nguồn giọng nói có ba loại: 30 giọng gốc, hơn 2.000 giọng dựng sẵn có thể dùng thương mại trực tiếp, và giọng do người dùng tự tạo. Tạo giọng tùy chỉnh chỉ cần một đoạn ghi âm mẫu dài 30 giây, Google cho biết hỗ trợ hơn 100 ngôn ngữ và phương ngữ. Tính năng trộn giọng được ghi chú là "sắp ra mắt".
Về cách điều khiển, nhà phát triển có thể dùng ngôn ngữ tự nhiên để viết chỉ dẫn diễn xuất cho từng câu thoại, chẳng hạn câu nào cần hạ giọng, câu nào kèm tiếng cười. Mô hình hỗ trợ sẵn kịch bản hội thoại hai người, có thể chèn tiếng cười, tiếng thở dài, tiếng hít vào và các tiếng đệm kiểu "ừm", "đúng vậy" theo kịch bản. Google cũng cho biết khi tạo nội dung dài vài giờ, chất lượng âm thanh không suy giảm rõ rệt.
Hai mô hình này cũng có mặt ở phía người dùng cuối: Flash TTS được đưa vào Gemini Notebook, Flash-Lite TTS vào Google Vids, người dùng thông thường đều có thể sử dụng. Mười công ty gồm Agora, LiveKit, Pipecat, Vercel, Figma, HeyGen... là nhóm đối tác tích hợp đầu tiên.
Nhân bản giọng nói bị giới hạn theo khu vực
Google đặt ra nhiều lớp kiểm soát cho tính năng nhân bản: mọi âm thanh tạo ra đều gắn watermark SynthID, trước khi nhân bản phải xác minh sự đồng ý ủy quyền, kèm chứng nhận nội dung C2PA. Tính năng nhân bản hiện chưa khả dụng tại bang Illinois, Texas của Mỹ, cũng như Khu vực Kinh tế châu Âu, Anh, Thụy Sĩ và Ấn Độ. Trong đó Illinois và Texas đều có luật riêng bảo vệ thông tin sinh trắc học.
Về đánh giá, Google dẫn benchmark thiết kế âm sắc của Hume AI, cho biết Flash TTS đứng đầu bảng tổng và cũng đứng đầu về mô phỏng giọng địa phương (accent); trên Voice Arena, mô hình này nằm trong nhóm dẫn đầu ở các bảng xếp hạng tiếng Nhật, tiếng Bồ Đào Nha Brazil, tiếng Việt, tiếng Ả Rập chuẩn hiện đại, tiếng Tây Ban Nha Mexico và tiếng Hindi. Đây đều là kết quả xếp hạng của bên thứ ba do Google dẫn lại, thông báo không nêu riêng kết quả tiếng Trung.
Thử làm một phép tính
Theo trang giá của Gemini API, đầu ra âm thanh tính phí theo 25 token mỗi giây. Một giờ giọng nói tương đương 90.000 audio token. Ước tính theo giá mỗi triệu token đầu ra:
| Mô hình | Trước cuối năm 2026 | Từ 1/1/2027 |
|---|---|---|
| 3.8 Flash TTS (9 USD / 18 USD) | khoảng 0,81 USD/giờ | khoảng 1,62 USD/giờ |
| 3.8 Flash-Lite TTS (6 USD / 12 USD) | khoảng 0,54 USD/giờ | khoảng 1,08 USD/giờ |
| 2.5 Flash bản xem trước TTS (10 USD) | khoảng 0,90 USD/giờ | — |
Giá đầu vào văn bản trước cuối năm là 0,5 USD/triệu token, sang năm sau tăng lên 1 USD; lượng lời thoại trong một giờ chỉ vài chục nghìn ký tự nên phần này gần như không đáng kể. Xử lý theo lô (batch) còn được giảm thêm một nửa giá.
Tính theo cách này, hơn ba tháng còn lại của năm nay, các mô hình mới rẻ hơn bản xem trước cũ; nhưng từ năm sau, bản Flash sẽ đắt hơn khoảng 80% mỗi giờ, Flash-Lite cũng đắt hơn bản cũ. Google không giải thích vì sao chọn cấu trúc giá "nửa giá trước, tăng gấp đôi sau khi hết hạn". Với các mảng kinh doanh tiêu hao giọng nói theo giờ như sách nói, podcast, chăm sóc khách hàng, chi phí khoảng 1 USD/giờ vẫn thấp hơn nhiều so với thuê người lồng tiếng thật; yếu tố quyết định việc sử dụng nhiều khả năng vẫn là chất lượng âm thanh và hiệu quả nhân bản giọng, còn chênh lệch vài chục xu này ảnh hưởng không nhiều.
Nguồn tham khảo: blog chính thức của Google, trang giá Gemini API, CocoLoop, Hume AI; đã đối chiếu số lượng giọng, thời lượng mẫu nhân bản, giới hạn khu vực và giá đầu ra mỗi triệu audio token.