OpenAI Rilis 722 Manuskrip Matematika Hasil AI

Pada 6 Oktober, OpenAI merilis sekumpulan hasil riset matematika yang dihasilkan oleh model internal mutakhirnya di GitHub, dalam repositori bernama openai/math, dengan lisensi Apache 2.0. Repositori ini memuat 722 manuskrip yang dikelompokkan ke dalam 372 "keluarga" riset—kumpulan pembuktian, generalisasi, dan revisi berbeda untuk masalah yang sama.

Menurut OpenAI, selama proses riset model ini diberi sekitar 4.000 soal. Setiap hasil yang diterima rata-rata menghabiskan daya komputasi setara dengan tiga jam mode berpikir ChatGPT Pro.

Bidang apa saja yang dicakup

Manuskrip ini mencakup teori bilangan, kompleksitas komputasi, fisika matematika, geometri, dan ilmu komputer teoretis. Contoh yang disebut media antara lain soal terkait ukuran irasionalitas π, beberapa masalah NP-hard, konjektur Mahler, barisan aritmetika, faktor grup bebas, serta feromagnet Heisenberg kuantum dan persamaan Vlasov-Maxwell relativistik.

Banyak pembuktian dilengkapi versi formal dalam Lean, bahasa pemrograman yang memungkinkan komputer memeriksa logika pembuktian langkah demi langkah; lolos formalisasi berarti tidak ada celah dalam rangkaian penalarannya. Namun tidak semua manuskrip memiliki berkas Lean yang sesuai, dan OpenAI cukup terbuka soal ini dalam catatannya:

"some of the unformalized results could have issues"

Artinya, hasil yang belum diformalkan mungkin masih mengandung kesalahan. Perusahaan berkomitmen untuk memperbaiki kesalahan yang ditemukan dan secara bertahap menambahkan lebih banyak pembuktian formal. Repositori ini juga dilengkapi proses revisi makalah dan aturan sitasi, sehingga peneliti bisa melacak berapa kali suatu hasil direvisi dan versi mana yang harus dikutip.

Merangkai babak-babak sebelumnya

Rilis ini datang lebih dari empat bulan setelah momen besar terakhir OpenAI di bidang matematika. Pada Mei lalu, model OpenAI memecahkan masalah Erdős yang telah terbuka sekitar 80 tahun—saat itu berupa satu terobosan yang dilaporkan satu per satu. Pada Oktober, bentuknya berubah menjadi ratusan manuskrip yang masuk ke repositori sekaligus, dan cara perilisannya sendiri menjadi bagian dari beritanya.

Formatnya juga berubah. Sebelum rilis ini, OpenAI berkonsultasi dengan "Kelompok Penasihat Matematika dan AI" independen yang dibentuk oleh Institute for Advanced Study (IAS) Princeton. Kelompok ini baru merilis sejumlah rekomendasi pada 29 September, setelah menerima lebih dari 600 masukan dari komunitas matematika, yang menuntut agar hasil matematika buatan AI mengungkapkan nama model, prompt yang digunakan, ringkasan penalaran, biaya komputasi, serta tingkat kegagalan model pada soal-soal sejenis.

Dibandingkan dengan daftar itu, kali ini OpenAI memberikan angka biaya komputasi (rata-rata tiga jam mode berpikir Pro), jumlah total soal (sekitar 4.000), dan sejumlah besar pembuktian Lean; model itu sendiri tetap tidak diungkap, pengumumannya hanya menyebut "model internal" dan menyatakan sedang menuju pembukaan yang bertanggung jawab. Berapa banyak dari sekitar 4.000 soal itu yang tidak terpecahkan, dan mana yang ditinggalkan di tengah jalan, tidak terlihat dari materi publik yang ada.

Komunitas matematika sudah lama mengkhawatirkan volume produksi seperti ini. Terence Tao secara terbuka membahas isu ini dua kali, pada Agustus dan September, dengan intinya bahwa AI bisa membuat produksi pembuktian jauh melampaui kemampuan manusia untuk menelaahnya, dan soal-soal sulit yang bagus pun akan cepat "ditambang" habis. Dengan 722 manuskrip dirilis sekaligus, siapa yang akan menanggung beban penelaahan ini belum ada yang memberikan jawabannya.

Rencana selanjutnya

OpenAI menyatakan akan mendanai lokakarya terkait dan program khusus untuk membantu komunitas matematika memahami dan mencerna hasil-hasil buatan AI ini. Perusahaan belum memberikan rencana konkret apakah manuskrip-manuskrip ini bisa masuk ke jurnal resmi atau bagaimana kepenulisannya akan ditangani, dan hasil pemeriksaan manuskrip satu per satu oleh matematikawan independen pun belum dipublikasikan.

Sumber: Blog resmi OpenAI, Interesting Engineering, CocoLoop, Unite.AI; jumlah manuskrip, total soal, dan angka biaya komputasi mengikuti pernyataan publik OpenAI, sementara isi rekomendasi kelompok penasihat mengikuti dokumen publik kelompok IAS.