MIT, 카네기멜런대학교(CMU), 뉴욕대학교, 스탠퍼드대학교 연구진은 9월 30일 학술지 《네이처》(Nature)에 논문을 발표했다. 논문은 '아타락소스(Ataraxos)'라는 이름의 AI 시스템을 소개하며, 전략 보드게임 '스트라테고(Stratego)'에서 이 게임 역사상 가장 뛰어난 전적을 가진 선수로 꼽히는 핌 니메이어(Pim Niemeijer)를 15승 1패 4무로 꺾었다고 밝혔다.
비용은 놀라울 정도로 낮았다. 논문이 제시한 구성에 따르면 강화학습 모델은 H100 16장으로 일주일, 상대 말의 정체를 추론하는 '신념 모델(belief model)'은 H100 4장으로 나흘간 학습했다. 2025년 가격 기준으로 환산하면 총비용은 8000달러 미만이었다.
스트라테고가 어려운 이유
스트라테고는 두 명이 겨루는 전쟁 보드게임으로, 양측은 각각 40개의 말을 가진다. 대국이 시작되면 모든 말은 뒷면이 상대를 향해 놓여, 누가 사령관이고 어떤 말이 지뢰인지, 깃발이 어디에 숨어 있는지는 실제로 전투가 벌어지기 전까지 상대방에게 보이지 않는다. 연구진의 추산에 따르면 가능한 말 배치의 경우의 수는 10의 66제곱을 넘는다.
이는 바둑이나 체스와 다른 점이다. 바둑과 체스는 판 위의 모든 정보가 공개된 완전 정보 게임이다. 스트라테고는 상대의 숨겨진 패를 추측하는 동시에 자신의 정보를 얼마나 드러낼지 조절해야 하고, 때로는 허세도 부릴 줄 알아야 한다. 이런 불완전 정보 게임은 협상, 경매, 사이버 공방 같은 현실 문제와 구조적으로 더 가까우며, AI 연구에서 오랫동안 난제로 꼽혀 왔다.
논문의 교신저자이자 MIT 전기공학·컴퓨터과학과 교수인 가브리엘레 파리나(Gabriele Farina)는 아타락소스의 플레이 스타일을 이렇게 설명했다.
"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."
(아타락소스는 인간이 할 수 없는 방식으로 위험을 계산하는 데 능하다……과잉 반응해서 자신의 패를 드러내는 일도 없다)
딥내시(DeepNash)와 비교하면
스트라테고에서 이전까지의 기준점은 2022년 딥마인드가 내놓은 '딥내시(DeepNash)'였다. 대규모 자가대국으로 학습한 이 AI는 스트라테고 온라인 플랫폼 '그라본(Gravon)'에서 역대 상위 3위 안에 들었고, 당시 AI가 이 게임을 정복한 상징적 사례로 평가받았다.
아타락소스의 접근법은 다르다. 학습 외에 '결정 시점 계획(decision-time planning)'을 더했다는 점이 특징이다. 한 수를 둘 때마다 상대 말에 대한 추론을 바탕으로 탐색을 한 차례 거친 뒤 착수한다. 연구진은 아타락소스가 무작정 추측하는 게 아니라, 가능한 모든 국면 가운데 가장 안전한 수를 찾는다고 설명한다.
| 지표 | 아타락소스(기존 연구 대비) |
|---|---|
| 강화학습 훈련 연산 비용 | 약 1/500 |
| 자가대국 횟수 | 약 1/30 |
| 학습 샘플 수 | 약 1/100 |
성적 면에서는 니메이어와의 15승 1패 4무 외에도, 세계선수권급 상위 선수들을 상대로 한 전체 전적이 39승 2패였다.
알파고부터 딥내시까지, 지난 몇 년간 대형 연구기관의 게임 AI 성과는 대개 수천 개의 칩과 몇 달에 걸친 학습이 뒤따랐고, 대학 연구팀이 따라가기 어려웠다. 아타락소스는 이런 유형의 문제에 드는 학습 비용을 중간 규모 연구비로 감당할 수 있는 수준까지 끌어내렸다. 이는 추론 단계의 탐색이 학습 단계의 연산 자원 상당 부분을 대체할 수 있음을 보여주며, 최근 몇 년간 거대언어모델 분야에서 나타난 '연산을 학습에서 추론으로 옮기는' 흐름과 같은 방향이다.
논문 저자로는 CMU의 새뮤얼 소코타(Samuel Sokota, 제1저자)와 지코 콜터(Zico Kolter), MIT의 가브리엘레 파리나와 지위안 판(Zhiyuan Fan), 뉴욕대의 유진 비니츠키(Eugene Vinitsky), 스탠퍼드의 헝위안 후(Hengyuan Hu)가 이름을 올렸다. 코드와 모델 가중치 공개 여부, 다른 불완전 정보 게임에서의 성능에 대해서는 MIT 보도자료에 언급이 없었으며, 논문 보충자료와 저자들의 추후 공개를 지켜봐야 한다.
참고 출처: 《네이처》 논문, MIT 뉴스 오피스, Tech Xplore, CocoLoop; 학습 구성과 비용 산정 근거, 대국 전적은 논문을 기준으로 확인했으며, 딥내시 비교 수치는 논문에 기재된 내용을 따랐다.