Claude đẩy cận zeta lên 67%

Câu chuyện toán học mới của Claude không nên được hiểu là AI đã giải xong một bài toán thế kỷ.

Ngày 10 tháng 8, Anthropic công bố tài liệu về một bản Claude nghiên cứu chưa phát hành được yêu cầu thử nghiêm túc giả thuyết Riemann. Mô hình không giải được giả thuyết, nhưng theo Anthropic, nó cải thiện một kết quả liên quan: cận dưới tỷ lệ nghiệm của hàm zeta Riemann thỏa giả thuyết tăng từ 41,6% lên 67,2%.

Ranh giới kết quả

Giả thuyết Riemann vẫn chưa được chứng minh. Kết quả của Claude nói về câu hỏi hẹp hơn: có thể chứng minh tối thiểu bao nhiêu nghiệm nằm trên đường tới hạn.

Tập tài liệu gồm bài nghiên cứu, bản thảo kỹ thuật do Claude viết, ghi chú ngắn cho chuyên gia và hình thức hóa Lean qua trình kiểm tra tiêu chuẩn. Anthropic nói hai nhà toán học nội bộ đã thẩm định, còn Brian Conrey và Dan Goldston kiểm tra bản thảo trong thời gian ngắn.

Câu lệnh ban đầu là

“Take a real stab at the Riemann hypothesis.”

Nói đơn giản, Claude được yêu cầu thử thật sự.

67,2% đến từ đâu

41,6% là cận trước đó, 67,2% là cận mới, còn năm 1859 và giải một triệu đô la mô tả vị trí của bài toán lớn.

Quy mô thực hiện đáng chú ý. Claude thử 650 ý tưởng đầu tiên nhưng thất bại. Lần sau kéo dài một ngày rưỡi, phối hợp khoảng 60 Claude subagent, chạy 2400 lệnh shell, viết hàng trăm script Python và tải 54 bài arXiv để kiểm tra kết quả đã tồn tại chưa. Tổng đầu ra là 31 triệu token.

Nhà toán học vẫn ở trung tâm

Vai trò con người không biến mất. Mô hình mở rộng vùng tìm kiếm, nhà toán học đọc kết nối với công trình cũ, còn Lean biến một phần lập luận thành thứ máy có thể kiểm tra.

Bài kiểm tra tiếp theo

Các mốc cần theo dõi là đánh giá độc lập công khai, phạm vi Lean bao phủ và việc quy trình này có tạo thêm kết quả ở các bài toán khác hay không.

Nguồn: Anthropic Research, bài kỹ thuật Claude, kho hình thức hóa Lean, Clay Mathematics Institute, CocoLoop, các bài arXiv liên quan; đối chiếu cận dưới 41,6% và 67,2%, 31 million output tokens, 650 ideas, 60 subagents, 2400 shell commands, 54 papers và trạng thái Lean comparator.