Google merilis tiga model Flash pada 21 Juli. Sekilas ini hanya pembaruan Gemini. Namun jika harga, kecepatan, dan tujuan pemakaiannya dibaca bersama, arahnya lebih jelas: Google ingin membuat AI agentik dan AI perusahaan berjalan lebih murah, cepat, dan sesuai jenis kerja.
Gemini 3.6 Flash menjadi model serbaguna, Gemini 3.5 Flash-Lite mengejar biaya rendah dan throughput tinggi, sedangkan Gemini 3.5 Flash Cyber diarahkan ke pekerjaan keamanan. Persaingan model mulai bergeser dari satu papan skor ke desain beban kerja.
Panggilan sering butuh model murah
Google mengatakan Flash-Lite baru memiliki output real-time 17% lebih cepat dari generasi sebelumnya dan mencapai sekitar 350 tokens/s dalam benchmark independen. Halaman model DeepMind mencantumkan harga $0,30 per satu juta token input dan $2,50 per satu juta token output.
Untuk chat biasa, kualitas jawaban paling terlihat. Untuk agent, routing layanan pelanggan, otomatisasi browser, dan pemrosesan dokumen massal, ratusan panggilan kecil harus tetap masuk batas latensi dan biaya.
Keamanan menjadi model tersendiri
Flash Cyber adalah bagian yang paling jelas. Google memosisikannya untuk analisis keamanan, riset kerentanan, analisis malware, dan respons insiden, bukan untuk chat umum.
DeepMind menampilkan hasil pada CTI-MCQ, CTI-RCM, MARS-EVAL, dan CyberSecEval. Google menyebut peningkatan hingga 65% dibanding 3.5 Flash pada beberapa benchmark keamanan siber. Angka itu harus dibaca sebagai angka benchmark; di perusahaan, metrik seperti false positive, temuan yang terlewat, dan biaya review manusia tetap perlu diuji.
CEO Google Sundar Pichai pernah menggambarkan peluang AI sebagai salah satu peluang terbesar.
Pelanggan membeli keseimbangan
Halaman model Google memuat kutipan dari pemimpin engineering Figma Vincent van der Meulen: saat mengevaluasi model untuk Figma Make, mereka mencari keseimbangan antara kualitas, kecepatan, dan biaya.
Itulah logika komersial Flash. Alat desain, asisten kode, analisis spreadsheet, dan sistem dukungan tidak selalu membutuhkan model yang sama untuk setiap langkah. Tahap yang murah, sering, dan mudah diperiksa dapat memakai model ringan; tugas sensitif dapat naik ke model lebih kuat.
Beban nyata akan menentukan
Angka 350 tokens/s pada Flash-Lite berasal dari konteks benchmark. Di produksi, latensi akan dipengaruhi panjang prompt, pemanggilan alat, jaringan, dan batas laju. Peningkatan 65% Flash Cyber juga terkait benchmark keamanan yang disebutkan.
Google tidak hanya merilis model yang lebih kuat. Ia membagi beban kerja berbeda menjadi produk berbeda. Persaingan berikutnya akan ditentukan oleh biaya, latensi, batas keamanan, dan kecocokan workflow.
Sumber: blog resmi Google, halaman model Google DeepMind, Axios, Business Insider, Artificial Analysis, CocoLoop; memeriksa peran tiga model Flash, cakupan tokens/s, harga per satu juta token, peningkatan benchmark keamanan siber, kutipan pelanggan, dan ketersediaan.