Google Cloud mengumumkan pada 25 September bahwa Gemini 3.8 Live with Live Avatar kini tersedia secara umum (GA) di Gemini Enterprise. Versi ini menambahkan "wajah" yang bisa bicara ke model percakapan suara real-time yang sudah ada: avatar video yang dihasilkan dengan gerakan bibir yang sinkron dengan suara, ditujukan untuk layanan pelanggan, asisten belanja, dan penjelasan produk — skenario yang membutuhkan kesan seperti manusia. Fitur ini pertama kali dipratinjau di Google Cloud Next 2026.
Apa yang bisa dilakukan versi ini
Menurut postingan blog Google Cloud, Gemini 3.8 Live kali ini mengandalkan lima kemampuan utama:
- Avatar video: menghasilkan avatar percakapan dengan gerakan bibir yang sinkron;
- Suara ke suara: percakapan suara native yang memungkinkan pengguna menyela di tengah percakapan dan melanjutkan tanpa kehilangan konteks sebelumnya atau proses yang sedang berjalan di latar belakang;
- Pemanggilan tool asinkron: memanggil API atau mengecek CRM maupun ERP di latar belakang tanpa menghentikan percakapan;
- Dukungan multibahasa: bisa mendengar dan berbicara dalam 97 bahasa dengan deteksi bahasa otomatis;
- Visi real-time: memproses feed kamera, berbagi layar, dan audio secara bersamaan.
Dari sisi penerapan, tersedia dua endpoint yaitu AS dan Uni Eropa, mendukung provisioned throughput, serta menekankan kepatuhan dan tata kelola data untuk enterprise.
Ada dua batasan yang disebutkan dalam pengumuman. Avatar kustom saat ini hanya dibuka untuk klien yang masuk whitelist — perusahaan yang ingin memakai wujud atau juru bicara sendiri harus lolos tinjauan Google terlebih dahulu. Setiap aliran audio dan video yang dihasilkan disematkan watermark SynthID yang tidak terlihat mata telanjang. Selain itu, Gemini 3.8 Live Extended Thinking yang punya kemampuan penalaran lebih panjang masih dalam private preview dan belum ikut dirilis resmi bersama update ini.
Apa yang dilakukan klien dengan fitur ini
Pengumuman ini menyebutkan empat klien. Autotrader milik Cox Automotive memakainya sebagai asisten belanja mobil, di mana avatar berbicara sambil menyorot daftar mobil, membandingkan model, dan menjelaskan opsi pembiayaan di halaman web. Chief Product Officer Cox Automotive, Marianne Johnson, mengatakan:
"Shoppers increasingly expect to describe what they need in their own words rather than work through filters and menus."
(Maksudnya, pembeli semakin ingin menjelaskan kebutuhan mereka dengan kata-kata sendiri, bukan menelusuri filter dan menu satu per satu.)
Equal AI dari India menjalankan layanan asisten pribadi yang menangani lebih dari satu juta panggilan telepon real-time per hari dalam 9 bahasa India; CEO perusahaan tersebut menyebut versi baru ini meningkatkan keandalan dalam menangani interupsi, percakapan multibahasa, dan pemanggilan tool. Salesforce mengatakan sedang menggabungkan model ini dengan Agentforce, sementara Specs, platform asisten AI, menyebutkan perbaikan pada deteksi aktivitas suara (VAD) dan latensi secara keseluruhan. Semua ini adalah klaim dari masing-masing perusahaan — pengumuman tidak memberikan angka yang bisa dibandingkan seperti latensi dalam milidetik atau tingkat konversi.
Apakah bisa dipakai pengembang di Tiongkok daratan
Gemini Enterprise dan Live API berjalan di atas Google Cloud, sehingga pengembang di Tiongkok daratan tidak bisa mengaksesnya secara langsung; tim yang menyasar pasar luar negeri bisa memakai endpoint AS atau Uni Eropa. Bahasa Mandarin termasuk dalam 97 bahasa yang didukung, dan pemanfaatan paling langsung ada pada skenario layanan pelanggan dan asisten belanja untuk pasar multibahasa seperti Asia Tenggara dan Timur Tengah.
Layanan pelanggan berbasis manusia digital dan avatar live streaming di Tiongkok sudah berjalan selama beberapa tahun, dengan pendekatan umum menyambungkan pengenalan suara, model bahasa besar, sintesis suara, dan mesin manusia digital yang menggerakkan bibir secara terpisah. Setiap tahap punya latensinya sendiri, dan penanganan interupsi sering menjadi titik lemah. Langkah Google kali ini menggabungkan kemampuan mendengar, berbicara, melihat, memanggil tool, dan menghasilkan gambar ke dalam satu model real-time, dengan taruhan bahwa pendekatan end-to-end lebih unggul dalam hal latensi dan pengalaman interupsi. Pendekatan mana yang lebih hemat biaya bergantung pada skema harga output avatar dan biaya konkurensi aktual, dan saat ini belum ada angka publik yang bisa dibandingkan.
Google sebelumnya sudah merilis model sintesis suara Gemini 3.8 Flash TTS dan Flash-Lite TTS, dan pengumuman ini juga memasukkan Gemini 3.5 Transcribe serta Gemini 3.5 Live Translate ke dalam jajaran model audio enterprise-nya. Dengan percakapan real-time, transkripsi, terjemahan, sintesis suara, ditambah avatar video, lini produk suara enterprise Google kini praktis sudah lengkap.
Bagian yang belum dijelaskan
Untuk harga Live Avatar, blog resmi hanya memberikan tautan ke halaman harga tanpa merinci tarif khusus untuk output video avatar; syarat pengajuan whitelist dan lama waktu tinjauannya juga belum diumumkan. Pihak mana saja yang bisa mengakses alat deteksi watermark SynthID juga tidak dijelaskan kali ini. Poin-poin ini akan langsung memengaruhi penilaian biaya dan kepatuhan bagi perusahaan yang mempertimbangkan untuk menerapkannya.
Sumber: Blog resmi Google Cloud, Android Headlines, CocoLoop, Unite.AI; masih perlu diverifikasi: jumlah bahasa yang didukung, batasan whitelist dan watermark, volume panggilan harian Equal AI, serta kutipan masing-masing klien.