Google merilis Gemini 3.5 Transcribe pada 26 Agustus, model khusus ucapan-ke-teks yang terbagi dalam dua jalur: streaming real-time dan audio pra-rekaman.
Menurut pengukuran Artificial Analysis, rata-rata word error rate (WER) versi non-streaming adalah 2,6%, sementara versi streaming 4,0%. Pada benchmark multibahasa FLEURS, angkanya 5,50% untuk streaming dan 5,04% untuk non-streaming. Dibandingkan generasi sebelumnya, Chirp 3, waktu untuk menghasilkan transkrip akhir dipangkas 70%. Model ini mendukung lebih dari 85 bahasa dengan deteksi otomatis.
Yang Dihasilkan Adalah Naskah Jadi
Google memposisikan model ini untuk mengubah audio mentah langsung menjadi teks yang akurat, bersih, dan sudah diformat. Secara konkret ada tiga hal yang dilakukan: menangani koreksi diri pembicara (contoh resmi yang diberikan adalah "let's meet Tuesday—no, Wednesday", di mana model mempertahankan kata akhir "Wednesday"); menghapus kata pengisi seperti "um" dan "ah"; serta menerapkan pemformatan otomatis.
Model pengenalan suara tradisional menghasilkan aliran transkrip mentah, dan proses pembersihan semacam ini selama ini dilakukan di tahap hilir, ditangani model terpisah atau mesin aturan. Dengan melipat proses ini ke dalam model transkripsi itu sendiri, satu kali panggilan dan satu kali latensi bolak-balik bisa dihemat. Bagi tim yang membangun agen suara real-time, lapisan latensi ini sering kali menjadi pembeda antara terdengar seperti percakapan sungguhan atau tidak.
Model ini juga mendukung function calling, yang memungkinkan tugas kompleks dialihkan di tengah proses transkripsi. Selain itu tersedia kosakata khusus, pemisahan pembicara (diarization) — maksimal 3 orang untuk audio pra-rekaman, lebih dari itu masih bersifat eksperimental — timestamp per kata, dan pergantian bahasa di tengah panggilan.
Dua API, Dua Skenario
Versi real-time bernama gemini-3.5-transcribe-live, diakses lewat Live API dan ditujukan untuk aplikasi suara interaktif. Versi pra-rekaman bernama gemini-3.5-transcribe, diakses lewat Interactions API dan ditujukan untuk notulen rapat serta log panggilan.
Di sisi pengembang, model ini masuk pratinjau publik lewat Gemini API (Google AI Studio) dan Google Antigravity. Di sisi enterprise, tersedia lewat pratinjau Gemini Enterprise Agent Platform, yang selanjutnya akan terintegrasi ke Gemini Enterprise for Customer Experience. Bagi pengguna umum, saat ini ada tiga titik akses: aplikasi Gemini di macOS (hanya bahasa Inggris), Rambler di Android (di sejumlah negara dan bahasa terbatas), sementara dukungan Chrome masih menyusul.
Dua Pertanyaan di Balik Angka
Google belum mengumumkan harga. Transkripsi suara adalah bisnis dengan tarif per menit, dan jika word error rate 2,6% dibarengi harga di atas rata-rata pesaing, kecepatan adopsinya bisa melambat. Dalam dua tahun terakhir, kategori ini berganti generasi dengan cepat dan pelanggan sensitif terhadap biaya beralih — harga sering kali lebih menentukan keputusan pembelian dibanding selisih akurasi sepersekian persen.
Pemisahan pembicara hanya dijamin akurat untuk maksimal tiga orang. Batasan ini menyisihkan sejumlah skenario berfrekuensi tinggi: rapat multi-peserta, pengecekan kualitas layanan pelanggan, dan transkripsi podcast — yang semuanya lazim melibatkan lebih dari tiga pembicara. Dengan melabeli lebih dari tiga orang sebagai eksperimental, Google secara tidak langsung mengakui bagian ini belum stabil.
Hitungan kasar soal makna akurasi ini dalam praktik: word error rate 2,6% setara dengan sekitar 26 kata yang salah dalam rekaman rapat sepanjang 1.000 kata (perkiraan — distribusi sebenarnya sangat bergantung pada aksen dan kebisingan latar). Untuk skenario hukum atau medis yang butuh kutipan kata demi kata, tingkat ini masih memerlukan pemeriksaan manual; untuk menghasilkan ringkasan rapat atau memberi konteks ke agen, tingkat ini sudah cukup memadai. Garis pemisah antara kedua kebutuhan itu bukan pada modelnya, melainkan pada bagaimana teks ini dikonsumsi di tahap hilir.
Sektor suara bergerak intensif tahun ini, mulai dari OpenAI yang merilis tiga model suara sekaligus, hingga berbagai perusahaan yang menyisipkan API suara ke dalam stack agen mereka. Tolok ukur persaingan bergeser dari "seberapa akurat pengenalannya" menjadi "seberapa banyak usaha yang dihemat setelah terhubung ke alur kerja." Gemini 3.5 Transcribe, dengan memasukkan pembersihan dan pemformatan ke dalam model itu sendiri, bergerak ke arah yang sama.
Sumber: blog resmi Google, CocoLoop, Artificial Analysis, dokumentasi model DeepMind; word error rate, peningkatan latensi, dan jumlah bahasa diverifikasi berdasarkan halaman rilis resmi — harga belum diumumkan.