AI tốn chưa đến 8.000 USD hạ gục kỳ thủ Stratego số một

Các nhà nghiên cứu từ MIT, Đại học Carnegie Mellon (CMU), Đại học New York và Đại học Stanford đã công bố một bài báo trên tạp chí Nature ngày 30 tháng 9, giới thiệu hệ thống AI mang tên Ataraxos. Hệ thống này đã đánh bại Pim Niemeijer, người được coi là kỳ thủ có thành tích lừng lẫy nhất trong lịch sử trò chơi cờ chiến thuật Stratego, với tỷ số 15 thắng, 1 thua, 4 hòa.

Chi phí thấp đến bất ngờ. Theo cấu hình mà bài báo công bố, mô hình học tăng cường được huấn luyện trên 16 GPU H100 trong một tuần, còn mô hình niềm tin dùng để suy đoán danh tính quân cờ của đối thủ được huấn luyện trên 4 GPU H100 trong bốn ngày. Tính theo giá thuê năm 2025, tổng chi phí chưa đến 8.000 USD.

Cái khó của Stratego nằm ở đâu

Stratego là trò chơi cờ quân sự hai người chơi, mỗi bên có 40 quân cờ. Khi bắt đầu ván, mặt sau của quân cờ quay về phía đối thủ, ai là tư lệnh, quân nào là bom, lá cờ giấu ở đâu, đối phương hoàn toàn không biết, chỉ lộ ra khi giao chiến. Nhóm nghiên cứu ước tính số cách bố trí quân cờ khả dĩ vượt quá 10 mũ 66.

Điều này khác với cờ vây hay cờ vua, hai trò chơi thông tin đầy đủ, nơi mọi thứ trên bàn cờ đều hiện rõ. Stratego đòi hỏi vừa đoán quân bài của đối thủ, vừa kiểm soát lượng thông tin mình để lộ, lại phải biết tung hỏa mù. Dạng trò chơi thông tin không đầy đủ này, về cấu trúc, gần với các vấn đề thực tế như đàm phán, đấu giá hay tấn công - phòng thủ mạng hơn, và cũng là điểm khó lâu năm của nghiên cứu AI.

Gabriele Farina, tác giả cấp cao của bài báo và là giảng viên Khoa Kỹ thuật điện và Khoa học máy tính tại MIT, mô tả lối chơi của Ataraxos như sau:

"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."

(Tạm dịch: Ataraxos tính toán rủi ro theo cách mà con người không làm được... nó không phản ứng thái quá đến mức tự để lộ bí mật của mình.)

Đặt cạnh DeepNash

Chuẩn mực trước đó trên Stratego là DeepNash của DeepMind, ra mắt năm 2022. Hệ thống này dựa vào huấn luyện tự đối đấu quy mô lớn, lọt vào top 3 lịch sử trên nền tảng Stratego trực tuyến Gravon, và khi đó được xem là dấu mốc AI chinh phục trò chơi này.

Hướng đi của Ataraxos khác hẳn. Ngoài huấn luyện, nó còn bổ sung lập kế hoạch tại thời điểm ra quyết định, tức là mỗi nước đi đều dựa trên suy đoán về quân cờ của đối thủ để thực hiện một vòng tìm kiếm trước khi đặt quân. Theo các nhà nghiên cứu, hệ thống không đoán mò mà tìm nước đi an toàn nhất trong tất cả các tình huống khả dĩ.

So sánh chi phí huấn luyện giữa hai hệ thống:

Chỉ sốAtaraxos so với công trình trước đó
Chi phí tính toán huấn luyện học tăng cườngKhoảng 1/500
Số ván tự đối đấuKhoảng 1/30
Số mẫu huấn luyệnKhoảng 1/100

Về thành tích, ngoài tỷ số 15-1-4 trước Niemeijer, Ataraxos có tổng thành tích 39 thắng, 2 thua khi đối đầu các kỳ thủ hàng đầu đẳng cấp giải vô địch thế giới.

Từ AlphaGo đến DeepNash, các thành tựu AI chơi game của những phòng thí nghiệm lớn trong vài năm qua thường gắn liền với hàng nghìn chip và nhiều tháng huấn luyện, khiến các nhóm nghiên cứu ở trường đại học khó theo kịp. Ataraxos đã đưa hóa đơn huấn luyện cho cùng loại bài toán xuống mức mà một khoản kinh phí nghiên cứu quy mô vừa cũng có thể chi trả, cho thấy ở dạng bài toán này, tìm kiếm ở giai đoạn suy luận có thể thay thế phần lớn năng lực tính toán dồn vào giai đoạn huấn luyện. Đây cũng là hướng đi tương tự xu hướng "chuyển năng lực tính toán từ huấn luyện sang suy luận" đang diễn ra trong lĩnh vực mô hình ngôn ngữ lớn những năm gần đây.

Các tác giả đứng tên trong bài báo gồm Samuel Sokota của CMU (tác giả chính), Zico Kolter, Gabriele Farina và Zhiyuan Fan của MIT, Eugene Vinitsky của Đại học New York, và Hengyuan Hu của Stanford. Thông cáo báo chí của MIT không đề cập việc mã nguồn và trọng số mô hình có được công bố hay không, cũng như hiệu suất trên các trò chơi thông tin không đầy đủ khác, nội dung này sẽ được cập nhật theo tài liệu bổ sung của bài báo và công bố từ các tác giả.

Nguồn tham khảo: bài báo trên Nature, Văn phòng Báo chí MIT, Tech Xplore, CocoLoop; cấu hình huấn luyện, cách tính chi phí và thành tích thi đấu được kiểm chứng theo bài báo, số liệu so sánh với DeepNash lấy theo nội dung bài báo.