Google Luncurkan Model Gemini Termurah: Flash-Lite

Peluncuran terbaru Google, Gemini 3.1 Flash-Lite, memiliki satu daya tarik utama: harga yang terjangkau.

Dengan harga $0,25 per juta token input dan $1,50 per juta token output, model ini jauh lebih murah dibandingkan Gemini 3.1 Pro yang dibanderol $2,00 per juta token input dan $18,00 per juta token output — kira-kira seperdelapan dari harga Pro.

Ini menjadikannya model Gemini paling hemat biaya yang pernah ditawarkan Google.

Perubahan kecepatan dan harga

Flash-Lite pertama kali diperkenalkan sebagai pratinjau pada 3 Maret dan kini tersedia di Google AI Studio dan Vertex AI. Model ini dirancang untuk skenario throughput tinggi dan biaya rendah — jenis yang memproses ratusan ribu permintaan setiap hari.

Beberapa metrik kinerja utama meliputi:

  • Kecepatan generasi: 45% lebih cepat dari Gemini 2.5 Flash
  • Waktu ke token pertama: Peningkatan 2,5x
  • Throughput: Sekitar 207 token per detik
  • GPQA Diamond (tolok ukur penalaran ilmiah): 86,9%, peningkatan sekitar 14 poin persentase dibandingkan 2.5 Flash Lite

Skor GPQA ini cukup mengesankan. Angka 86,9% melampaui banyak model flagship, menjadikannya tawaran yang menarik pada titik harga tersebut.

Namun, perlu dicatat bahwa pada tolok ukur penalaran yang lebih menantang, HLA, Flash-Lite hanya mencapai skor 16%, dibandingkan dengan 44,4% pada 3.1 Pro. Tugas penalaran tingkat tinggi masih menjadi pembeda yang jelas.

Landasan teknis dan arsitektur

Flash-Lite dibangun di atas arsitektur Mixture-of-Experts (MoE) yang berasal dari model Gemini 3 Pro. Model ini mendukung:

  • Jendela konteks: 1 juta token
  • Modalitas input: Teks, gambar, audio, dan video
  • Panjang output: Hingga 64K token

Arsitektur MoE adalah kunci untuk mencapai kinerja ini dengan biaya rendah — lebih sedikit parameter yang diaktifkan berarti biaya per inferensi lebih rendah. Pendekatan ini sejalan dengan model seperti DeepSeek V3 dan Qwen3.

Kasus penggunaan yang ideal

Google telah menguraikan aplikasi yang sangat praktis untuk model ini:

  • Moderasi konten: Pemrosesan batch untuk deteksi pelanggaran
  • Ekstraksi data: Mengekstrak bidang dari teks tidak terstruktur
  • Perutean niat: Klasifikasi lapisan pertama dalam sistem multi-agen
  • Otomatisasi layanan pelanggan: Menanggapi pertanyaan standar
  • Penerjemahan dan transkripsi: Pemrosesan bahasa skala besar

Singkatnya, model ini dirancang untuk tugas yang tidak memerlukan penalaran mendalam tetapi bervolume tinggi, sensitif terhadap latensi, dan terbatas anggaran.

Kombinasi ini umum ditemukan di lingkungan perusahaan, di mana sebagian besar pengeluaran AI digunakan untuk tugas-tugas rutin namun esensial.

Perbandingan harga dengan pesaing

ModelInput ($/1M token)Output ($/1M token)
Gemini 3.1 Flash-Lite$0,25$1,50
Gemini 3.1 Pro$2,00$18,00
GPT-4o Mini~$0,15~$0,60
Claude 4.5 Haiku~$0,25~$1,25

Persaingan di kisaran harga ini sangat ketat. GPT-4o Mini lebih murah, dan Claude 4.5 Haiku berada di kisaran harga yang sama. Keunggulan Flash-Lite terletak pada kecepatannya (waktu ke token pertama 2,5x lebih cepat) dan jendela konteks 1 juta token, yang jarang ditemukan pada model dengan harga serupa.

Arti peluncuran ini

Dengan Flash-Lite, Google jelas menargetkan segmen pasar volume tinggi.

Bagi banyak pengembang kecil dan startup yang membangun purwarupa produk, kriteria utamanya adalah "cukup baik dan murah." Harga Gemini 3.1 Pro bisa menjadi hambatan nyata, tetapi harga Flash-Lite kemungkinan besar tidak akan menjadi masalah.

Pada saat yang sama, Google menggunakan model murah ini untuk mempertahankan pengembang dalam ekosistem Vertex AI. Strateginya adalah menarik lalu lintas dengan Flash-Lite, kemudian memigrasikan tugas produksi yang lebih berat ke Pro dan Ultra — jalur konversi yang telah divalidasi Google dengan banyak pelanggan.

Untuk skenario API yang sensitif terhadap biaya, kini ada opsi lain yang tersedia.

Sumber referensi: CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE); Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog); Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)