Google merilis dua model sintesis suara pada 23 September: Gemini 3.8 Flash TTS dan Gemini 3.8 Flash-Lite TTS. Model pertama ditujukan untuk kebutuhan kreatif yang butuh kontrol nada bicara secara detail dan pembentukan karakter, sedangkan yang kedua dirancang untuk pemanggilan dalam jumlah besar dengan biaya rendah. Keduanya sudah bisa diakses hari itu juga lewat Gemini API dan Google AI Studio, dan versi enterprise Gemini Enterprise akan menyusul.
Apa saja kemampuannya
Sumber suara ada tiga jenis: 30 suara bawaan, lebih dari 2.000 suara siap pakai yang boleh digunakan secara komersial, dan suara custom buatan pengguna sendiri. Membuat suara custom hanya perlu sampel rekaman 30 detik, dan Google mengklaim mendukung lebih dari 100 bahasa dan dialek. Fitur pencampuran suara masih berstatus "segera hadir".
Dari sisi kontrol, developer bisa menuliskan instruksi akting dalam bahasa alami untuk tiap baris dialog — misalnya kalimat mana yang suaranya perlu direndahkan atau diberi nada tertawa. Model ini secara native mendukung skenario percakapan dua orang, dan bisa menyisipkan tawa, helaan napas, tarikan napas kaget, serta respons singkat seperti "mm" atau "iya" sesuai skrip. Google juga mengklaim kualitas audio tidak menurun secara signifikan meski menghasilkan konten berdurasi beberapa jam.
Kedua model ini juga sudah masuk ke produk konsumen: Flash TTS terpasang di Gemini Notebook, dan Flash-Lite TTS ada di Google Vids, keduanya bisa dipakai pengguna umum. Sepuluh perusahaan — termasuk Agora, LiveKit, Pipecat, Vercel, Figma, dan HeyGen — menjadi mitra integrasi pertama.
Kloning suara punya batasan wilayah
Google memasang beberapa pengaman untuk fitur kloning: setiap audio yang dihasilkan diberi watermark SynthID, proses kloning mewajibkan verifikasi persetujuan terlebih dulu, dan hasilnya dilengkapi kredensial konten C2PA. Fitur kloning belum tersedia di Illinois, Texas, Kawasan Ekonomi Eropa (EEA), Inggris, Swiss, dan India. Illinois dan Texas sama-sama punya undang-undang khusus perlindungan data biometrik.
Soal pengujian, Google mengutip tolok ukur desain suara dari Hume AI, mengklaim Flash TTS menempati peringkat pertama secara keseluruhan dan juga pertama untuk pemodelan aksen. Model ini juga disebut masuk jajaran atas di Voice Arena untuk bahasa Jepang, Portugis Brasil, Vietnam, Arab Standar Modern, Spanyol Meksiko, dan Hindi. Semua ini adalah hasil peringkat pihak ketiga yang dikutip Google — pengumuman resminya tidak menyebutkan performa khusus untuk bahasa Mandarin.
Menghitung biayanya
Menurut halaman harga Gemini API, output audio dihitung 25 token per detik, sehingga satu jam audio setara 90.000 token audio. Perkiraan biaya per jam berdasarkan harga per satu juta token output:
| Model | Sampai akhir 2026 | Mulai 1 Januari 2027 |
|---|---|---|
| 3.8 Flash TTS ($9 / $18) | ~$0,81/jam | ~$1,62/jam |
| 3.8 Flash-Lite TTS ($6 / $12) | ~$0,54/jam | ~$1,08/jam |
| 2.5 Flash preview TTS ($10) | ~$0,90/jam | — |
Biaya input teks sampai akhir tahun ini $0,50 per satu juta token, lalu naik jadi $1 mulai tahun depan — karena skrip untuk satu jam audio paling banyak cuma puluhan ribu karakter, biaya ini nyaris bisa diabaikan. Pemrosesan batch mendapat diskon tambahan 50%.
Dengan hitungan ini, selama sisa tiga bulan lebih tahun ini model baru lebih murah dibanding versi preview lama; mulai tahun depan harga Flash naik sekitar 80% per jam, dan Flash-Lite pun jadi lebih mahal dari versi lama. Google tidak menjelaskan alasan di balik skema "harga setengah dulu, lalu dobel" ini. Untuk bisnis yang mengonsumsi suara berjam-jam seperti audiobook, podcast, atau layanan pelanggan, biaya sekitar satu dolar per jam tetap jauh lebih murah dibanding pengisi suara manusia — yang lebih menentukan pilihan tetaplah kualitas audio dan akurasi kloning, bukan selisih harga beberapa sen ini.
Sumber: blog resmi Google, halaman harga Gemini API, CocoLoop, Hume AI; diverifikasi dari jumlah suara, durasi sampel kloning, batasan wilayah, dan harga output per satu juta token audio.