Gemini 3.1 Pro Raih 12 Peringkat Pertama dari 18 Tolok Ukur

Pada akhir Februari, Google DeepMind merilis Gemini 3.1 Pro. Setelah dirilis, satu angka menyebar luas di komunitas pengembang: dari 18 tolok ukur utama yang saat ini dilacak, 3.1 Pro meraih peringkat pertama di 12 di antaranya.

Yang lebih patut diperhatikan adalah ARC-AGI-2 — tes yang dirancang khusus untuk mengevaluasi kemampuan model dalam memecahkan "soal logika baru yang belum pernah dilihat," mencegah model menghafal data pelatihan untuk lulus. 3.1 Pro mencetak 77,1% pada tolok ukur ini.

Apa Arti Penggandaan Kemampuan Penalaran

Google secara resmi menyatakan bahwa kemampuan penalaran 3.1 Pro lebih dari dua kali lipat dibandingkan Gemini 3 Pro.

Pernyataan itu terdengar samar, tetapi meyakinkan jika dikombinasikan dengan hasil ARC-AGI-2. ARC-AGI menghadirkan soal yang sepenuhnya baru setiap kali, mengharuskan model menyimpulkan pola dari beberapa contoh dan menerapkannya — tidak mungkin mengandalkan jawaban hafalan, hanya penalaran sungguhan.

Peningkatan 2x secara kasar berarti: diberikan masalah multi-langkah yang kompleks, model dapat menguraikan, menyimpulkan, dan memverifikasi sendiri tanpa perlu dipandu langkah demi langkah dalam prompt. Level MEDIUM Thinking Level baru telah ditambahkan (sebelumnya hanya dua mode: hidup/mati), kini memungkinkan kontrol atas kedalaman penalaran — tidak semua tugas memerlukan penalaran terdalam, dapat disesuaikan sesuai kebutuhan.

Spesifikasi Teknis

Konteks dan Output:

  • Jendela konteks: 1 juta token
  • Output maksimum: 65K token

Format Input yang Didukung:

  • Teks dan kode
  • Gambar (hingga 3.000 per permintaan, maks 7MB masing-masing)
  • Audio (hingga 8,4 jam)
  • Video (sekitar 45 menit dengan audio, sekitar 1 jam tanpa audio)
  • PDF (hingga 3.000 halaman per permintaan, maks 50MB per file)

Apa yang bisa ditampung 1 juta token? Kira-kira seluruh basis kode proyek perangkat lunak besar, atau 900 halaman PDF, atau 8,4 jam audio podcast. Melemparkan seluruh proyek lalu bertanya secara langsung kini benar-benar dapat dilakukan.

Fitur Praktis

Selain penalaran, 3.1 Pro menambahkan beberapa fitur praktis:

  • Grounding with Google Search: dapat melakukan pencarian real-time saat merespons, mengurangi masalah akibat tanggal batas pengetahuan
  • Eksekusi kode: model dapat menjalankan kode untuk memverifikasi hasil, tidak hanya menghasilkan kode
  • Optimasi Finance dan Spreadsheet: dua skenario agen ini telah disetel secara khusus
  • Integrasi RAG Engine: koneksi ke basis pengetahuan perusahaan lebih mudah

Juga mendukung prediksi batch, dan biaya untuk tugas konteks panjang jauh lebih rendah jika menggunakan cache.

Harga

ItemHarga
Input$2,00/M token
Output$12,00/M token
Input mode Reasoning$12,00/M token
Baca cache$0,20/M token
Tulis cache$0,38/M token

Dibandingkan dengan Claude Opus 4.6 ($15/$75), ini jauh lebih murah, dan mendekati GPT-5.4 Pro. Dengan penggunaan cache yang intensif, biaya tugas konteks panjang dapat ditekan cukup rendah.

Saat ini dalam pratinjau publik, dengan tanggal batas pengetahuan Januari 2025.

Tapi Bukan Pemimpin Keseluruhan

Sejujurnya: pada peringkat tolok ukur keseluruhan, GPT-5.4 Pro mencetak 92 (BenchLM.ai), Gemini 3.1 Pro 87, dan Claude Opus 4.6 85.

Menang di 12/18 tes individu, tetapi masih tertinggal di beberapa dimensi kemampuan kunci. Khususnya untuk tugas pengkodean, kinerja SWE-bench Claude Opus 4.6 masih lebih kuat.

Google telah menyerahkan jawaban ini dalam penalaran dan pemrosesan multimodal, tetapi kepemimpinan keseluruhan belum tercapai.

Apakah Layak Beralih?

Jika bisnis Anda terutama melibatkan:

  • Pemrosesan dokumen panjang (kontrak, laporan, tinjauan basis kode)
  • Input multimodal (memproses gambar + teks + audio secara bersamaan)
  • Anggaran terbatas tetapi membutuhkan kemampuan penalaran setara Opus

3.1 Pro adalah opsi serius dengan efektivitas biaya yang kompetitif.

Namun, jika kebutuhan inti adalah menulis kode atau membangun agen, Claude masih lebih matang. Dengan rilis ini, Google mencetak 77,1% di ARC-AGI-2, menunjukkan bahwa kemampuan penalaran benar-benar meningkat, bukan sekadar mengejar skor. Namun untuk sepenuhnya menggantikan Claude dan GPT-5.4, masih ada jarak yang harus ditempuh.

Sumber: Google's new Gemini Pro model has record benchmark scores — again (TechCrunch); CocoLoop, Gemini 3.1 Pro: A smarter model for your most complex tasks (Google DeepMind Blog); Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks (Galaxy.ai); Gemini 3.1 Pro | Google Cloud Vertex AI Documentation