OpenAI Naikkan Skor ARC ke 38,3%

OpenAI menerbitkan catatan teknis pada 29 Juli tentang ARC-AGI-3. Model yang sama, GPT-5.6 Sol, mendapat 13,3% pada set publik dengan harness resmi. Dengan reasoning dipertahankan dan compaction diaktifkan di Responses API, skornya menjadi 38,3%, sementara output token turun sekitar 6x.

Kenaikannya ada di memori

ARC-AGI-3 meminta agen menjelajahi gim 2D yang belum dikenal, tanpa instruksi eksplisit, lalu menebak tujuan dan bertindak efisien. OpenAI menyoroti bahwa harness resmi membuang private reasoning setelah setiap aksi dan memakai rolling truncation saat konteks melewati 175.000 karakter.

OpenAI menulis: “Benchmarks rarely measure AI models in isolation.” Artinya, benchmark juga mengukur setelan API, manajemen konteks, dan desain harness. Retained reasoning menyimpan rencana sebelumnya, sedangkan compaction menjaga observasi lama dalam bentuk ringkas.

Angkanya perlu konteks

13,3%, 38,3%, dan estimasi manusia 48% semuanya adalah RHAE pada tugas publik ARC-AGI-3. Itu bukan skor private leaderboard dan bukan akurasi biasa. Makalah ARC menyebut manusia menyelesaikan 100% lingkungan saat rilis, sedangkan sistem AI frontier berada di bawah 1%.

Bagi pengembang, pelajarannya sederhana: evaluasi agen panjang harus memakai perilaku memori dan konteks yang sama dengan produksi. Jika tidak, tes bisa mengukur amnesia paksa, bukan kemampuan model.

Evaluasi agen menjadi kerja sistem

Hasil ini tidak membuktikan GPT-5.6 Sol telah menyelesaikan ARC-AGI-3. Ia juga tidak membatalkan nilai ARC. Yang terlihat adalah bahwa benchmark agen kini mencakup sistem sekelilingnya: memori, umpan balik tool, pemulihan gagal, dan kompresi konteks. Langkah berikutnya adalah aturan perbandingan ARC, replikasi oleh lab lain, dan hasil pada set privat.

Sumber: riset OpenAI, makalah ARC Prize Foundation, dokumentasi ARC, CocoLoop, Hugging Face gameplay logs; memverifikasi cakupan RHAE ARC-AGI-3, GPT-5.6 Sol 13,3% pada harness resmi dan 38,3% pada Responses API harness, estimasi manusia 48% pada tugas publik, output token sekitar 1/6, serta pengaturan jendela konteks 175k.