Kabar matematika Claude kali ini tidak layak dibaca sebagai AI yang langsung memecahkan masalah berusia lebih dari satu abad.
Pada 10 Agustus, Anthropic menerbitkan materi riset tentang versi Claude yang belum dirilis. Model itu diminta mencoba hipotesis Riemann secara serius. Ia gagal membuktikannya, tetapi Anthropic mengatakan model tersebut memperbaiki hasil terkait: batas bawah proporsi nol fungsi zeta Riemann yang diketahui memenuhi hipotesis naik dari 41,6% menjadi 67,2%.
Batas klaimnya jelas
Hipotesis Riemann tetap terbuka. Hasil Claude menyentuh pertanyaan yang lebih sempit tentang berapa banyak nol yang dapat dibuktikan berada pada garis kritis.
Bukti yang dipublikasikan berlapis: halaman riset, makalah teknis yang ditulis Claude, catatan singkat untuk pakar, dan formalisasi Lean yang lolos pemeriksa standar. Anthropic menyebut dua matematikawannya menelaah hasil itu, sementara Brian Conrey dan Dan Goldston juga memeriksa makalah tersebut dalam waktu singkat.
Prompt awalnya berbunyi
“Take a real stab at the Riemann hypothesis.”
Artinya, Claude diminta benar-benar mencoba masalah itu.
Asal angka 67,2%
Angka 41,6% adalah batas sebelumnya, 67,2% adalah batas baru Claude, sedangkan 1859 dan hadiah satu juta dolar menjelaskan posisi masalah utama.
Skala prosesnya besar. Claude awalnya mencoba 650 ide tanpa hasil. Putaran kedua berlangsung satu setengah hari, melibatkan sekitar 60 subagen Claude, 2.400 perintah shell, ratusan skrip Python, dan 54 makalah arXiv untuk mengecek apakah hasil itu sudah ada. Total keluarannya 31 juta token.
Matematikawan tetap perlu
Peran manusia tidak hilang. Model memperluas ruang pencarian, matematikawan membaca kaitannya dengan riset lama, dan Lean mengubah sebagian argumen menjadi objek yang dapat dicek mesin.
Ujian berikutnya
Langkah berikutnya adalah tinjauan publik independen, cakupan formalisasi Lean, dan apakah alur kerja ini dapat menghasilkan temuan baru di masalah lain.
Sumber: Anthropic Research, makalah teknis Claude, repositori formalisasi Lean, Clay Mathematics Institute, CocoLoop, makalah arXiv terkait; verifikasi mencakup batas bawah 41,6% dan 67,2%, 31 million output tokens, 650 ideas, 60 subagents, 2400 shell commands, 54 papers, serta status Lean comparator.