Pesquisadores do MIT, da Carnegie Mellon University (CMU), da New York University e de Stanford publicaram em 30 de setembro, na revista Nature, um artigo apresentando um sistema de IA chamado Ataraxos. No jogo de estratégia Stratego, o sistema derrotou Pim Niemeijer, considerado o jogador humano com o melhor histórico na história do jogo, por 15 vitórias, 1 derrota e 4 empates.
O custo surpreende pelo tamanho reduzido. Segundo a configuração descrita no artigo, o modelo de aprendizado por reforço foi treinado por uma semana em 16 GPUs H100, enquanto o modelo de crenças, usado para inferir a identidade das peças do adversário, foi treinado por quatro dias em 4 GPUs H100. A preços de 2025, o custo total ficou abaixo de US$ 8 mil.
Onde está a dificuldade do Stratego
Stratego é um jogo de tabuleiro militar para dois jogadores, cada um com 40 peças. No início da partida, o verso das peças fica voltado para o adversário, quem é o marechal, quais peças são bombas e onde está a bandeira permanecem ocultos, só sendo revelados em combate. A equipe de pesquisa estima que existam mais de 10 elevado a 66 configurações possíveis de peças.
Isso é diferente do Go e do xadrez, jogos de informação completa, em que tudo no tabuleiro está visível. O Stratego exige adivinhar as cartas ocultas do adversário e, ao mesmo tempo, controlar quanto de informação própria é revelada, além de saber blefar. Esse tipo de jogo de informação incompleta se assemelha, em estrutura, a problemas reais como negociações, leilões e ataques e defesas cibernéticas, e é há muito tempo um dos grandes desafios da pesquisa em IA.
Gabriele Farina, autor sênior do artigo e professor do departamento de Engenharia Elétrica e Ciência da Computação do MIT, descreveu assim o estilo de jogo do Ataraxos:
"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."
(Em tradução livre: o Ataraxos calcula riscos de um jeito que os humanos não conseguem... ele não reage de forma exagerada a ponto de revelar seus próprios segredos.)
Comparando com o DeepNash
O principal marco anterior em Stratego era o DeepNash, do DeepMind, lançado em 2022. Treinado por meio de autojogo em grande escala, ele alcançou o top 3 histórico na plataforma online de Stratego Gravon, sendo visto na época como um marco da conquista do jogo pela IA.
O caminho do Ataraxos é diferente. Além do treinamento, ele adiciona planejamento em tempo de decisão: a cada jogada, o sistema primeiro realiza uma rodada de busca com base em suposições sobre as peças do adversário, para só então jogar. Segundo os pesquisadores, ele não chuta às cegas, mas busca o movimento mais seguro entre todas as posições possíveis.
Comparando o custo de treinamento dos dois sistemas:
| Indicador | Ataraxos em relação a trabalhos anteriores |
|---|---|
| Custo computacional do treinamento por aprendizado por reforço | cerca de 1/500 |
| Número de partidas de autojogo | cerca de 1/30 |
| Número de amostras de treinamento | cerca de 1/100 |
Em termos de resultados, além do placar de 15-1-4 contra Niemeijer, o Ataraxos tem um histórico geral de 39 vitórias e 2 derrotas contra os principais jogadores de nível de campeonato mundial.
Do AlphaGo ao DeepNash, os avanços em IA para jogos produzidos por grandes laboratórios nos últimos anos costumavam exigir milhares de chips e meses de treinamento, algo fora do alcance de equipes universitárias. O Ataraxos reduziu o custo de treinamento para esse tipo de problema a um patamar que cabe no orçamento de uma pesquisa de porte médio, o que sugere que, nesse tipo de tarefa, a busca em tempo de inferência pode substituir boa parte do poder computacional antes concentrado no treinamento. Essa é a mesma direção da tendência vista nos últimos anos em modelos de linguagem de grande porte, de deslocar poder computacional do treinamento para a inferência.
Entre os autores do artigo estão Samuel Sokota, da CMU (primeiro autor), Zico Kolter, Gabriele Farina e Zhiyuan Fan, do MIT, Eugene Vinitsky, da New York University, e Hengyuan Hu, de Stanford. O comunicado do MIT não especifica se o código e os pesos do modelo serão disponibilizados, nem como o sistema se comporta em outros jogos de informação incompleta, informações que devem ser esclarecidas nos materiais suplementares do artigo e em futuras divulgações dos autores.
Fontes: artigo na Nature, Escritório de Imprensa do MIT, Tech Xplore, CocoLoop; a configuração de treinamento, os critérios de custo e o histórico de partidas foram verificados com base no artigo, e os dados comparativos com o DeepNash seguem o que foi descrito no próprio artigo.