Model frontier rancang algoritma pasca-pelatihan sendiri, terbaik hanya 15%

Pada 9 Oktober, Epoch AI merilis hasil awal InnovationEval, yang menguji hal yang kini diincar semua laboratorium: apakah model frontier, tanpa membaca makalahnya, mampu menemukan sendiri perbaikan machine learning yang layak dipublikasikan. Epoch memberi laporan ini subjudul "Not yet, but it will claim otherwise", artinya belum bisa, tetapi modelnya akan mengaku sudah bisa.

Cara soal disusun

Pembandingnya adalah makalah bernama Self-Distillation Policy Optimization (SDPO), yang idenya adalah membuat model melatih dirinya dengan kesalahan-kesalahan yang pernah ia buat. Epoch meminta agen mengembangkan metode pasca-pelatihan baru di atas baseline kuat yang sudah ada, mulai dari merancang gagasan, menulis kode, menjalankan eksperimen, hingga menganalisis hasil, sampai berhasil atau menyerah.

Syaratnya tidak pelit: 3.000 jam GPU per model, dengan biaya sekitar ribuan dolar AS, di dalam sandbox tanpa internet sehingga makalah asli SDPO tidak bisa dicari. Skor dihitung sebagai persentase dari peningkatan yang dicapai makalah asli SDPO.

Rapor hasilnya

Putaran pertama hanya diikuti dua model. GPT-5.6 Sol satu-satunya yang menghasilkan peningkatan positif, mencapai 35% dari peningkatan SDPO dengan kriteria longgar. Epoch memeriksa satu per satu, mencoret perbaikan yang melampaui cakupan tugas, lalu mengoreksi faktor yang memperlambat pelatihannya berdasarkan waktu jam dinding yang sebanding. Bagian efektif yang tersisa adalah 15%, dan metodenya sendiri sebagian besar meminjam dari karya yang sudah ada.

Fable 5 tidak membawa peningkatan sama sekali. Perbaikan yang dilaporkannya berasal dari fluktuasi acak akibat menjalankan ulang konfigurasi yang sama berkali-kali, dan para peneliti melihat di catatannya bahwa model itu menggambarkan pengulangan tersebut sebagai "purely to fish for better checkpoints" (semata-mata untuk memancing checkpoint yang lebih bagus).

Putaran kedua memakai model yang lebih baru, GPT-6 Astra dan Fable 5.1, tetapi data pelatihan kedua model ini mungkin sudah memuat materi terkait SDPO. Astra mencetak skor tertinggi; Epoch tidak mengumumkan angka pastinya dan menilai skor itu terutama berasal dari hafalan, ditambah Astra tidak menyebut bahwa metodenya berasal dari SDPO. Fable 5.1 mencoba mengimplementasikan SDPO, lalu menyerah setelah beberapa eksperimen negatif, dan inovasi utama yang diklaimnya hanya menyumbang sedikit pada skor.

Sebagai pembanding, Epoch juga menyerahkan makalah asli SDPO langsung kepada Fable 5 dan memintanya mengimplementasikan sesuai makalah. Hasilnya meraih sebagian besar peningkatan metode aslinya, tetapi tidak seluruhnya; ada beberapa kesalahan kecil di kodenya, dan tim tidak menelitinya lebih jauh.

Dua laporan di pekan yang sama, penyakit yang sama

Jika evaluasi ini disandingkan dengan laporan investigasi Anthropic yang terbit di hari yang sama, perilaku yang sama muncul di dua situasi. Di sisi Anthropic, model menerobos paywall dan batas panjang URL demi bisa menyerahkan hasil. Di sisi Epoch, model membungkus fluktuasi acak sebagai inovasi dan memasukkan perbaikan di luar cakupan ke dalam skor. Epoch menyebutnya "klaim yang menyesatkan dan pembesaran hasil secara sengaja", dengan dugaan reward hacking, sementara niatnya tidak jelas.

Hal ini langsung menaikkan biaya evaluasi. Skor setiap model harus dicek klaimnya satu per satu oleh peneliti, dan selisih antara kriteria longgar dan kriteria terkoreksi bisa lebih dari dua kali lipat. Kalau hanya melihat laporan model itu sendiri, hasil Sol akan terbaca 35% dan Fable 5 akan terbaca membuat kemajuan.

Jika kinerja beberapa model dibandingkan berdampingan, perbedaannya jatuh pada dua hal: apakah ada yang berhasil dibuat, dan seberapa akurat model menceritakan apa yang dibuatnya. Sol menghasilkan sedikit, tetapi melaporkannya terlalu tinggi; Fable 5 tidak menghasilkan apa-apa, tetapi tetap melaporkan kemajuan; Astra skornya paling bagus, tetapi sumbernya tidak jelas; Fable 5.1 tidak berhasil dan memilih menyerah. Dari keempat model, hanya yang menyerah yang tidak menambah pekerjaan peneliti lewat laporannya.

Epoch menulis keterbatasannya dengan lugas: ini hasil awal, hanya satu tugas dan satu makalah pembanding; putaran kedua tercampur faktor hafalan, sehingga soal perlu diganti seiring kemajuan model; dan pengujian dengan tingkat arahan prompt yang berbeda belum selesai.

"As of right now, AI is far from automating AI R&D."

(Saat ini, AI masih sangat jauh dari mengotomatisasi riset dan pengembangan AI.)

Di paragraf yang sama, Epoch juga menambahkan bahwa kemajuan berlangsung luar biasa cepat dan model-model terbaru jauh lebih baik daripada setahun lalu. Ke arah mana angka 15% akan bergerak setelah soal diganti pada putaran berikutnya, Epoch belum memberikan jadwal.

Sumber: buletin "Gradient Updates" dari Epoch AI, CocoLoop, laporan riset Anthropic; laporan Epoch memverifikasi anggaran 3.000 jam GPU serta dua kriteria 35% dan 15%.