SpaceXAI merilis Grok 4.7 pada 21 September, menyebutnya sebagai "model paling mumpuni" mereka untuk coding dan pekerjaan berbasis pengetahuan. Harga dan kecepatan API sama dengan Grok 4.6: 2 dolar AS per juta token input dan 6 dolar AS per juta token output, ditambah satu tingkatan versi cepat dengan harga dan kecepatan output dua kali lipat. Model ini sudah tersedia di Cursor, Grok Build, konsol API, dan platform pihak ketiga.
"our most capable model for coding and knowledge work."
Begitulah SpaceXAI memosisikan Grok 4.7: untuk coding dan pekerjaan berbasis pengetahuan.
Menurut SpaceXAI, model baru ini memakai basis yang lebih besar dari 4.6 dan menjalani pelatihan reinforcement learning yang lebih panjang, dengan fokus pada tugas yang berjalan berjam-jam. Perusahaan mengklaim model ini lebih andal memeriksa dirinya sendiri, menangani konteks yang lebih panjang, dan kini terhubung native dengan Grok Bot.
Skor Resmi dan Evaluasi Pihak Ketiga
Beberapa angka yang dipublikasikan SpaceXAI sendiri: DeepSWE v1.1 71,0%, CursorBench 4.0 46,3%, Terminal-Bench 4.0 37,6%, dan EEBench (bidang teknik elektro) 64,0%. Soal keamanan, SpaceXAI mengklaim kemampuan menolak permintaan berbahaya dan ketahanan terhadap jailbreak terdepan di industri, dengan tingkat lolos peringatan risiko sebesar 3,3% pada HackerBench v0.3; akses red team dibuka lewat undangan, terbatas untuk sebagian mitra keamanan siber.
Lembaga evaluasi pihak ketiga Artificial Analysis mencatat indeks kecerdasan gabungan Grok 4.7 sebesar 46 poin, dua poin lebih tinggi dari 4.6; digabung dengan Grok Build, indeks agen coding-nya 56 poin, sembilan poin lebih tinggi dari 4.6. Per kategori, DeepSWE v1.1 naik dari 65% ke 73%, Terminal-Bench 4.0 dari 18% ke 33%, dan SWE-Atlas-QnA dari 58% ke 63%. Berdasarkan evaluasi ini, Grok 4.7 plus Grok Build menempati posisi keempat di antara agen coding, di bawah Claude Fable 5.1, GPT-6 Astra, dan Claude Opus 5. Pada AA-Briefcase, tolok ukur pekerjaan pengetahuan jangka panjang, Grok 4.7 meraih 1657 Elo, 111 poin lebih tinggi dari 4.6.
Halaman rilis resmi SpaceXAI tidak memberikan perbandingan langsung dengan kompetitor, dan SpaceXAI belum menanggapi soal peringkatnya dalam evaluasi pihak ketiga.
Menghitung Biaya Pemakaian
Daftar harga tidak berubah, tapi konsumsi token yang dicatat Artificial Analysis berubah: pada tingkatan xhigh, Grok 4.7 rata-rata menghasilkan sekitar 81.000 token output per tugas, sementara 4.6 pada tingkatan yang sama hanya sekitar 38.000 token — naik 125%. Kecepatan output sekitar 188 token per detik, dengan rata-rata satu tugas selesai dalam 7,1 menit.
Dengan perhitungan kasar hanya dari sisi output, satu tugas di 4.6 menghabiskan sekitar 0,23 dolar AS, sedangkan di 4.7 sekitar 0,49 dolar AS. Harga di daftar tetap sama, tapi biaya per tugas naik lebih dari dua kali lipat — sebagian besar kenaikan skor sebenarnya "dibeli" dengan waktu berpikir yang lebih lama.
Dibandingkan dengan pergerakan harga minggu ini, hitungan ini makin terasa. Sehari setelah Grok 4.7 diluncurkan, Claude Opus 5.5 dari Anthropic dan GPT-6 Sol dari OpenAI sama-sama dirilis: Opus 5.5 dibanderol 4 dolar AS per juta token input dan 20 dolar AS untuk output, sementara GPT-6 Sol turun ke 2 dolar AS dan 10 dolar AS. Dilihat dari harga per juta token, tarif output Grok 4.7 masih yang termurah di antara ketiganya; seberapa besar selisih itu menyusut jika dihitung dari pengeluaran riil per tugas akan bergantung pada konsumsi token dua model lainnya, dan data pihak ketiga untuk bagian ini belum lengkap.
Belum genap dua hari sejak skor 46 poin Grok 4.7 muncul, Opus 5.5 dan GPT-6 — dua model generasi baru — sudah masuk antrean evaluasi Artificial Analysis. Bagian atas papan peringkat tampaknya masih akan berubah.
Sumber: halaman rilis resmi SpaceXAI, CocoLoop, laporan evaluasi Artificial Analysis. Harga API dan skor resmi diverifikasi lewat halaman rilis SpaceXAI; indeks kecerdasan, indeks agen coding, dan data konsumsi token mengikuti metodologi Artificial Analysis; biaya output per tugas merupakan estimasi kasar berdasarkan harga resmi.