Trước hết, hãy làm rõ 10 bài toán này là gì.
Không phải bài thi toán, không phải bài toán kinh điển khó. Đây là những bài toán nghiên cứu chưa được công bố, đến từ thử thách FirstProof – nơi các thí sinh bao gồm nhà toán học chuyên nghiệp và nghiên cứu sinh tiến sĩ toán học. Yêu cầu của những bài toán này là: đáp án phải đúng và phải kèm theo chứng minh toán học chặt chẽ, có thể vượt qua phản biện đồng nghiệp.
Aletheia, AI toán học mới nhất của DeepMind, đã giải được 6 trong số đó.
5 bài được các chuyên gia bên ngoài đánh giá là "có thể công bố ngay sau khi chỉnh sửa nhỏ". Điều này có nghĩa là gì? Chất lượng của những lời giải này đã đạt đến tiêu chuẩn của một bài báo học thuật thực thụ.
Cách Aletheia hoạt động
Mô hình nền tảng của Aletheia là Gemini 3 Deep Think, cải thiện hiệu suất thông qua việc kéo dài thời gian tính toán khi kiểm tra. Nhưng nó không chỉ đơn thuần chạy một mô hình lớn, mà là một khung đa tác tử (multi-agent framework):
- Generator: Tạo ra hướng giải ban đầu
- Verifier: Xác minh các bước chứng minh có lỗ hổng logic hay không
- Reviser: Sửa đổi chứng minh dựa trên phản hồi từ Verifier
- Tích hợp Google Search để truy cập các tài liệu toán học mới nhất
Ý tưởng của kiến trúc này là: việc xác minh chứng minh dễ hơn việc tạo ra nó. Trong chứng minh toán học, mỗi bước suy luận hoặc đúng hoặc sai – đó là một đánh giá tương đối khách quan, dễ dàng hơn nhiều so với việc tạo ra nội dung. Vì vậy, để Verifier làm nhiệm vụ kiểm soát, có thể giảm bớt phần nào các trường hợp "trông có vẻ đúng nhưng thực tế có lỗ hổng".
Một điều đáng chú ý khác về Aletheia: khi gặp những bài toán thực sự không giải được, nó sẽ chủ động xuất ra "không tìm thấy lời giải" hoặc hết thời gian, thay vì cố gắng đưa ra một câu trả lời sai. Thiết kế "biết mình không biết" này quan trọng hơn nhiều so với việc cố gắng tạo ra ảo giác (hallucination) trong bối cảnh toán học.
So sánh với OpenAI
Trong thử thách FirstProof, OpenAI cũng có một mô hình nội bộ tham gia.
Ban đầu có báo cáo rằng mô hình của OpenAI cũng giải được 6 bài. Sau khi xem xét lại, bài toán số 2 được phát hiện có lỗ hổng logic, bị hạ xuống còn 5 bài.
Trong cùng điều kiện, Aletheia: 6 bài, thông qua đánh giá của chuyên gia bên ngoài, 5 bài được đánh giá là có thể công bố.
| Hệ thống | Số bài giải được | Kết quả đánh giá chuyên gia |
|---|---|---|
| Aletheia (DeepMind) | 6 | 5 bài "có thể công bố" |
| Mô hình nội bộ của OpenAI | 5 (giảm 1 sau khi xem xét lại) | Không được tiết lộ chi tiết |
Khoảng cách này không lớn, nhưng hướng đi thì rõ ràng: AI toán học đang bước vào phạm vi có thể đối thoại với các nhà nghiên cứu hàng đầu.
91,9% trên IMO-ProofBench
Ngoài FirstProof, Aletheia đạt tỷ lệ chính xác 91,9% trên IMO-ProofBench (chuẩn chứng minh dựa trên các bài toán Olympic Toán học Quốc tế).
Để so sánh: tỷ lệ vượt qua các bài toán IMO của sinh viên đại học chuyên ngành toán thường dưới 20%; nghiên cứu sinh tiến sĩ toán học xuất sắc đạt 40-60%; chỉ những thí sinh đạt huy chương bạc IMO trở lên mới có thể ổn định trên 70%.
91,9% đã vượt qua đại đa số thí sinh IMO là con người.
Thành thật mà nói, nhóm nghiên cứu cũng không quá phấn khích. Trong bài báo có một câu đáng được trích dẫn nguyên văn:
"Ngay cả với cơ chế Verifier, tỷ lệ sai sót của Aletheia vẫn cao hơn so với các chuyên gia con người."
Đây là một sự trung thực hiếm thấy: điểm số của chúng tôi rất tốt, nhưng còn xa mới có thể "thay thế các nhà toán học".
Đường ranh giới này đang dịch chuyển về đâu
Vài năm trước, hiệu suất của các mô hình ngôn ngữ lớn trong toán học là: làm đúng bài dễ, làm sai bài khó, không thể chứng minh.
Bây giờ, tình hình là: giải được 60% các bài toán nghiên cứu khó, trong đó phần lớn chứng minh đủ chất lượng để công bố.
Đây không phải là "tốt hơn con người", mà là "bắt đầu bước vào phạm vi có thể thảo luận vấn đề với các chuyên gia con người". Phản ứng của cộng đồng toán học tinh tế hơn cộng đồng AI – một số người coi đây là công cụ, một số khác bắt đầu suy nghĩ nghiêm túc về ý nghĩa của nó.
Điều thú vị về toán học là tiêu chuẩn đúng sai của nó mang tính khách quan. Bạn hoặc đã chứng minh được, hoặc chưa. Chất lượng của mã code có thể còn tranh cãi, nhưng lỗ hổng logic trong chứng minh toán học có thể được máy móc phát hiện.
Vì vậy, toán học rất có thể là một trong những lĩnh vực đầu tiên mà câu hỏi "AI thực sự hiểu hay chỉ là thống kê tương quan" sẽ được trả lời rõ ràng.
Thành tích 6/10 lần này của Aletheia là một cột mốc trong hành trình trả lời đó. Không phải là điểm kết thúc.
Nguồn tham khảo: DeepMind's Aletheia Solves 6 Out of 10 Unpublished Research-Level Math Problems (InfoQ, CocoLoop, ngày 19 tháng 4 năm 2026)