Grok 4.20 Tekan Tingkat Halusinasi dari 12% ke 4,2% dengan Multi-Agen

Pada bulan Februari tahun ini, xAI meluncurkan Grok 4.20 — bukan Grok 5, melainkan sesuatu yang secara struktural sangat berbeda: empat agen dengan peran berbeda berjalan di dalam satu model yang sama, saling mempertanyakan dan berdebat, lalu menyintesis satu jawaban akhir.

Gagasan ini terdengar agak abstrak, tetapi di baliknya terdapat rancangan teknik yang konkret.

Empat peran, satu otak

Pertama soal struktur: Grok 4.20 bukanlah empat model terpisah, melainkan satu basis MoE dengan sekitar 3 triliun parameter, yang mengaktifkan sekitar 500 miliar parameter per inferensi. Keempat agen berjalan di atas basis ini melalui lapisan adaptor ringan bergaya LoRA — pada dasarnya empat "kepribadian" dari model yang sama.

Keempat peran tersebut adalah:

  • Grok (Kapten): penguraian tugas, strategi keseluruhan, keluaran sintesis akhir
  • Harper (Peneliti): pencarian real-time dan verifikasi fakta, mengakses aliran informasi platform X secara ekstensif
  • Benjamin (Pakar Logika): penalaran bertahap, perhitungan matematis, pembuatan dan verifikasi kode
  • Lucas (Pihak Oposisi): secara khusus mencari celah — mengidentifikasi bias, mempertanyakan kesimpulan, mencegah terlalu percaya diri

Setiap kali muncul masalah yang cukup kompleks, keempat agen menjalani alur: penguraian tugas → analisis paralel (berbagi cache KV) → debat beberapa putaran → sintesis akhir.

Debat bukanlah pertunjukan. Lucas ada justru untuk memutus bias konfirmasi yang mungkin muncul pada Grok dan Benjamin.

Angka halusinasi yang mencolok

Tingkat halusinasi turun dari 12% pada Grok 4.1 menjadi 4,2%, penurunan sebesar 65%.

Angka 4% tergolong cukup rendah di antara model besar saat ini. Model flagship OpenAI dan Anthropic berada di kisaran 5-8%.

Metrik lainnya:

MetrikGrok 4.20
IFBench (kepatuhan instruksi)83%, peringkat pertama
Kecepatan inferensi220,5 token/detik
SWE-bench (coding)75%
Intelligence IndexPeringkat ke-8, skor 48
Jendela konteks2 juta token

Di bidang coding, angka 75% masih sedikit di bawah Claude Opus 4.6 yang mencapai 80,8%. Peringkat keseluruhan adalah ke-8; GPT-5.4 mendapat skor 57, selisih yang cukup besar. Jadi Grok 4.20 tidak menjadi yang teratas dalam dimensi "paling cerdas", tetapi kompetitif dalam hal "paling dapat diandalkan dalam berbicara".

Mengapa basis bersama lebih unggul daripada kolaborasi multi-model

Kerangka multi-agen bukanlah penemuan Grok 4.20 — LangGraph, AutoGen, dan lainnya sudah ada sejak lama. Namun pendekatan xAI memiliki perbedaan kunci: alih-alih membuat beberapa model independen berkolaborasi, ia menjalankan beberapa peran di atas basis yang sama.

Keuntungannya:

  • Berbagi cache KV, latensi jauh lebih rendah
  • Tidak perlu meneruskan konteks besar antar-model, mengurangi kehilangan informasi
  • Semua agen memiliki pemahaman dasar yang sama terhadap masukan yang sama

Dengan kata lain, "multi-agen" sebelumnya seperti beberapa orang bekerja sama memecahkan masalah; Grok 4.20 adalah satu orang yang menjalankan empat mode berpikir secara bersamaan di dalam kepalanya.

Infrastruktur

Sistem ini berjalan di superkomputer Colossus milik xAI di Memphis: lebih dari 300.000 GPU, konsumsi daya 2 gigawatt, bandwidth memori 194 PB/s. Jendela konteks 2 juta token dapat menampung basis kode besar beserta dokumentasi selama beberapa tahun.

Sebuah detail: xAI belum mengungkapkan apakah jumlah putaran debat bersifat tetap atau adaptif — bagian rekayasa ini masih berupa kotak hitam.

Harga dan akses

  • API: masukan $2/M, keluaran $6/M
  • Pengguna biasa: langganan SuperGrok (sekitar $30/bulan) atau X Premium+

Harganya lebih mahal daripada Claude Opus 4.6 dan sedikit lebih murah daripada GPT-5.4.

Arah ini layak diteliti

Penurunan tajam tingkat halusinasi menunjukkan bahwa mekanisme "mempertanyakan diri sendiri" pada AI efektif secara rekayasa. Ini mungkin merupakan arah yang lebih layak untuk diinvestasikan daripada sekadar menumpuk parameter.

Namun masih ada beberapa pertanyaan yang belum terjawab: Apa logika kontrol untuk putaran debat? Apakah pertanyaan Lucas dapat menyebabkan konservatisme yang berlebihan? xAI belum mengungkapkan hal-hal ini.

Yang dapat diungkapkan tentang arsitekturnya adalah bahwa ini adalah produk komersial pertama yang diketahui yang menerapkan debat empat agen dalam satu basis terpadu dengan cache KV bersama — jika pendekatan ini terbukti efektif, hanya masalah waktu sebelum pemain besar lainnya mengikutinya.

Sumber referensi: Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models (Medium, Engineer at Heart); CocoLoop, Grok 4.20 Beta Launch: 4-Agent AI System Launches (adwaitx.com); HOW THE XAI GROK 4.20 AGENTS WORK (NextBigFuture.com); Master the 5 Core Capabilities of Grok 4.20 (Apiyi.com)