Google Luncurkan Gemini 4 Argon, Dibuka Dulu untuk Tim Keamanan

Google merilis model generasi terbaru Gemini 4 Argon pada 30 September, dengan akses awal dibatasi untuk tim pertahanan keamanan siber yang tergabung dalam program Fairwind. Google menetapkan tiga cakupan kerja untuk model ini: rekayasa perangkat lunak, pekerjaan pengetahuan perusahaan seperti hukum dan keuangan, serta pertahanan keamanan siber. Pelanggan API berbayar dan pelanggan Google AI Ultra akan mendapat akses pada gelombang berikutnya, sementara peluncuran publik yang lebih luas belum memiliki jadwal.

Pemberian akses lebih dulu ke tim keamanan berkaitan dengan arah pelatihan model ini. Google mengklaim Argon dilatih secara khusus untuk pertahanan siber, mampu menemukan, memverifikasi, dan menambal kerentanan perangkat lunak kritis secara mandiri. Bagi pihak pertahanan tepercaya di Fairwind dan tim internal Google, Argon disediakan tanpa pembatas keamanan siber; pengguna lain mendapat versi yang dilengkapi perlindungan anti-penyalahgunaan, pertahanan terhadap prompt injection, dan pemantauan keselarasan (alignment monitoring).

Rapor resmi

Beberapa skor benchmark yang diumumkan Google:

BenchmarkFokusSkor Argon
DeepSWE v1.1Rekayasa perangkat lunak dunia nyata77,9%
CWE-bench v1Perbaikan kerentanan68% (setara peringkat pertama)
AutomationBenchTugas otomatisasi51,3% (peringkat pertama)
LVBenchPemahaman video panjang91,7%

Dua hasil lain hanya diumumkan sebagai peringkat: untuk Vals Index yang mencakup keuangan, coding, hukum, dan pajak, Google menyatakan Argon memimpin; pada uji indirect prompt injection dari Gray Swan, Google mengklaim ketahanannya paling baik. Semua angka ini dilaporkan sendiri oleh vendor, dan hanya ada satu pengujian ulang pihak ketiga yang tersedia pada hari peluncuran.

Panjang output menjadi perubahan mencolok lainnya. Batas output tunggal Gemini generasi sebelumnya adalah 64 ribu token, sementara Argon menaikkannya menjadi 1 juta token, sama dengan ukuran jendela konteksnya yang juga 1 juta token.

Harga dan pengujian pihak ketiga

Selama periode peluncuran, API dikenakan harga promo: 2 dolar AS per juta token input dan 10 dolar AS per juta token output, dengan diskon tambahan 95% untuk input yang kena cache hit. Setelah masa promo berakhir, harga kembali ke 4 dolar AS untuk input dan 20 dolar AS untuk output; Google tidak menjelaskan berapa lama masa promo ini berlangsung.

Lembaga evaluasi independen Artificial Analysis merilis hasil pengujiannya pada hari yang sama. Argon meraih 53 poin pada Indeks Intelijen mereka, setara dengan tingkat penalaran tertinggi GPT-6 Astra, satu poin lebih tinggi dari tingkat tertinggi GPT-6.1 Sol, dan 23 poin lebih tinggi dari skor 30 milik Gemini 3.1 Pro Preview generasi sebelumnya.

Membandingkan biaya per tugas menggunakan indeks yang sama:

  • Dengan harga promo, Argon menghabiskan sekitar 1,99 dolar AS per tugas, sementara GPT-6 Astra 3,26 dolar AS;
  • Setelah promo berakhir, biaya Argon naik menjadi sekitar 3,98 dolar AS, sekitar 20% lebih mahal dari Astra;
  • GPT-6.1 Sol hanya sekitar 0,72 dolar AS per tugas dengan skor cuma 1 poin lebih rendah, membuat harga promo Argon sekitar 2,8 kali lipat harga Sol.

Selisih ini terutama disebabkan oleh penggunaan token. Menurut data Artificial Analysis, Argon rata-rata menghasilkan sekitar 62 ribu token output per tugas, sementara GPT-6 Astra sekitar 27 ribu, lebih dari dua kali lipat. Dengan harga per token dipangkas setengah tetapi volume output berlipat dua, keunggulan harga dari diskon hampir sepenuhnya hilang pada harga normal. Argon mendukung mekanisme yang disebut "long decode continuation", yang memungkinkan proses penalarannya menulis hingga 1 juta token output, menjelaskan mengapa penggunaannya lebih tinggi pada uji indeks ini.

Untuk siapa pembatas keamanan dilonggarkan

Pada minggu yang sama, OpenAI membatalkan rencana peluncuran GPT-6.1 Astra dengan alasan belum memenuhi standar keamanan, lalu merilis Sol yang lebih murah sebagai gantinya. Pendekatan Google adalah menempatkan versi terkuatnya lebih dulu dalam daftar terbatas. Kedua perusahaan menangani hal ini secara berbeda, namun menghadapi tantangan yang sama: semakin kuat kemampuan model menemukan kerentanan dan menulis tambalan, semakin besar pula risiko kemampuan itu disalahgunakan untuk menyerang.

Blog peluncuran Google tidak menjelaskan lembaga mana saja yang masuk daftar Fairwind, kriteria penyaringannya, atau bagaimana mencegah kebocoran versi tanpa pembatas keamanan tersebut. Bagi pengembang di Tiongkok daratan, Argon untuk saat ini juga sulit dijangkau: Fairwind bersifat undangan, waktu pembukaan langganan Ultra dan API berbayar belum ditentukan, dan Gemini API sendiri tidak tersedia untuk Tiongkok daratan.

Sumber: blog resmi Google, laporan evaluasi Artificial Analysis, CocoLoop, VentureBeat; skor benchmark mengikuti laporan Google sendiri, sementara biaya per tugas dan penggunaan token mengikuti metodologi Indeks Intelijen Artificial Analysis.