OpenAI Klaim Capai Target Magang Riset Otomatis, Setara 3.1 Hari Kerja

Dalam laporan berjudul "Research acceleration: The view inside OpenAI" yang dirilis pada 6 September, OpenAI mengumumkan bahwa perusahaan telah mencapai target internal berupa "magang riset otomatis" (automated research intern). Laporan itu mendefinisikannya sebagai sistem yang mampu menyelesaikan tugas riset dengan spesifikasi jelas di bawah arahan manusia, termasuk tugas yang biasanya butuh waktu berhari-hari bagi peneliti berpengalaman.

Klaim ini didukung oleh sekumpulan data penggunaan internal. Hingga pertengahan Agustus, agent AI mencatatkan setara 3.1 hari kerja agent untuk setiap satu hari kerja standar delapan jam milik seorang peneliti manusia. Pada periode yang sama, median biaya inferensi harian per peneliti melebihi 600 dolar AS, sementara pengguna di persentil ke-90 menghabiskan lebih dari 7.000 dolar AS per hari. Jumlah peneliti yang menjalankan empat agent atau lebih secara bersamaan terus bertambah. Laporan juga menyebutkan bahwa jumlah eksperimen per peneliti aktif pada Agustus 2026 adalah yang tertinggi sejak OpenAI mulai mencatat metrik ini pada Januari 2025.

Batasan yang diakui sendiri oleh laporan ini

Dokumen ini tidak melebih-lebihkan hasilnya. Tingkat keberhasilan hanya dihitung untuk tugas yang punya ground truth yang jelas; pekerjaan riset tanpa jawaban benar-salah yang objektif tidak dimasukkan. Untuk tugas dengan kompleksitas empat hingga delapan jam, lebih dari separuhnya masih membutuhkan campur tangan manusia untuk diselesaikan. Laporan menulis secara langsung bahwa "the measurements are preliminary" (pengukuran ini masih bersifat awal), dan memperingatkan bahwa berbagai hambatan potensial bisa membuat laju riset secara keseluruhan tidak mengimbangi kenaikan pada satu metrik tertentu saja.

Soal titik akhirnya, laporan ini blak-blakan: "We do not yet know how to safely get all the way to aligned, full RSI" — perusahaan mengakui belum tahu cara aman untuk mencapai self-improvement rekursif penuh yang selaras (aligned).

Angka 3.1 ini untuk saat ini tidak bisa diverifikasi dari luar. Angka itu bergantung pada cara konversi internal OpenAI untuk "hari kerja agent", dan metode konversi tersebut belum dipublikasikan.

Target waktu terakhir diberikan sebelas bulan lalu

Kedua titik waktu ini bukan hal baru. Dalam sebuah siaran langsung pada Oktober 2025, Sam Altman pernah berkata:

"we think it is plausible that by September of next year, we have an intern-level AI research assistant and that by March 2028, we have a legitimate AI researcher."

(Intinya: mereka menilai ada kemungkinan pada September tahun berikutnya sudah punya asisten riset AI setara magang, dan pada Maret 2028 punya peneliti AI yang benar-benar layak disebut demikian.)

Menurut penuturan OpenAI sendiri, target pertama tercapai tepat pada bulan yang dijanjikan. Target kedua masih tetap di Maret 2028; laporan menggambarkannya sebagai peneliti AI otomatis yang bisa memajukan riset deep learning dan alignment di bawah pengawasan manusia serta mendukung perbaikan berulang (iterative improvement), bukan sekadar asisten yang hanya bisa menangani tugas sempit.

Dua peristiwa yang tidak semulus itu dari rentang waktu yang sama juga tercatat dalam laporan ini. Pada 20 Juli, layanan container perusahaan sempat dihentikan sementara setelah terjadi masalah keamanan. Pada 7 Agustus, Astra ditandai telah memiliki kemampuan keamanan siber yang kritis. Rangkaian perangkat internal yang mendongkrak throughput riset ini, ternyata juga memunculkan persoalan keamanan yang harus ditangani.

Tagihannya juga ikut membengkak

Angka biaya inferensi ini lebih mudah diverifikasi arah tren-nya dibanding angka 3.1. Median 600 dolar AS per hari per peneliti berarti tim riset berisi seratus orang akan menghabiskan sekitar 60 juta dolar AS setahun hanya untuk pemanggilan agent, dengan asumsi kasar 250 hari kerja setahun dan belum termasuk biaya training. Untuk pengguna di persentil ke-90 dengan 7.000 dolar AS per hari, satu peneliti saja bisa menghabiskan hampir 2 juta dolar AS per tahun.

Sifat uang ini berbeda dari biaya komputasi untuk training. Training adalah pengeluaran sekali jalan yang menghasilkan model yang bisa dipakai berulang kali; sementara peneliti yang memakai agent untuk eksperimen adalah konsumsi murni — begitu dipakai, hilang — dan makin lancar seseorang memakainya, makin besar pula pengeluarannya. Pengamatan dalam laporan bahwa makin banyak orang menjalankan empat agent atau lebih secara bersamaan, langsung menunjuk pada kemiringan kurva pengeluaran itu.

Bagi pengamat dari luar, Maret 2028 adalah titik berikutnya yang bisa dijadikan patokan untuk mencocokkan klaim ini. Sampai saat itu tiba, satu-satunya materi publik yang bisa dipakai untuk verifikasi silang tetap laporan yang diterbitkan OpenAI sendiri.

Sumber: laporan resmi Research acceleration dari OpenAI, CocoLoop, unite.ai; rasio 3.1 hari kerja agent, median dan persentil ke-90 biaya inferensi, proporsi tugas empat hingga delapan jam yang membutuhkan intervensi manusia, serta kutipan asli Altman soal kedua target waktu telah diverifikasi pada halaman laporan OpenAI.