Una IA entrenada por menos de 8000 dólares vence al número uno de Stratego

Investigadores del MIT, la Universidad Carnegie Mellon (CMU), la Universidad de Nueva York y Stanford publicaron el 30 de septiembre, en la revista Nature, un artículo que presenta un sistema de IA llamado Ataraxos. En el juego de estrategia Stratego, el sistema venció a Pim Niemeijer, considerado el jugador humano con el historial más brillante en la historia del juego, con un marcador de 15 victorias, 1 derrota y 4 empates.

El costo resulta sorprendentemente bajo. Según la configuración descrita en el artículo, el modelo de aprendizaje por refuerzo se entrenó durante una semana en 16 GPU H100, mientras que el modelo de creencias, usado para inferir la identidad de las piezas del rival, se entrenó durante cuatro días en 4 GPU H100. A precios de 2025, el costo total fue de menos de 8000 dólares.

Dónde está la dificultad de Stratego

Stratego es un juego de tablero militar para dos jugadores, cada uno con 40 piezas. Al inicio de la partida, el reverso de las piezas queda orientado hacia el rival, por lo que quién es el mariscal, cuáles piezas son bombas y dónde está escondida la bandera permanece oculto y solo se revela al combatir. El equipo de investigación estima que existen más de 10 elevado a 66 configuraciones posibles de piezas.

Esto difiere del go y el ajedrez, juegos de información completa en los que todo en el tablero es visible. Stratego exige adivinar las cartas ocultas del rival mientras se controla cuánta información propia se revela, además de saber blofear. Este tipo de juego de información incompleta se asemeja, en su estructura, a problemas reales como las negociaciones, las subastas o los ataques y defensas cibernéticas, y constituye desde hace tiempo uno de los grandes retos de la investigación en IA.

Gabriele Farina, autor principal del artículo y profesor del departamento de Ingeniería Eléctrica y Ciencias de la Computación del MIT, describió así el estilo de juego de Ataraxos:

"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."

(Traducción: Ataraxos calcula el riesgo de una manera que los humanos no pueden... no sobrecorrige ni revela sus propios secretos.)

En comparación con DeepNash

El referente anterior en Stratego era DeepNash, de DeepMind, lanzado en 2022. Entrenado mediante autojuego a gran escala, se ubicó entre los tres mejores de la historia en la plataforma en línea de Stratego Gravon, lo que en su momento se consideró un hito de la IA en este juego.

El enfoque de Ataraxos es distinto. Además del entrenamiento, incorpora planificación en el momento de decidir: en cada jugada, primero realiza una ronda de búsqueda basada en conjeturas sobre las piezas del rival, y solo después mueve. Según los investigadores, el sistema no adivina a ciegas, sino que busca el movimiento más seguro entre todas las posiciones posibles.

Comparando el costo de entrenamiento de ambos sistemas:

IndicadorAtaraxos frente a trabajos anteriores
Costo computacional del entrenamiento por aprendizaje por refuerzoaproximadamente 1/500
Número de partidas de autojuegoaproximadamente 1/30
Número de muestras de entrenamientoaproximadamente 1/100

En cuanto a resultados, además del 15-1-4 ante Niemeijer, el historial total de Ataraxos frente a los mejores jugadores de nivel de campeonato mundial es de 39 victorias y 2 derrotas.

Desde AlphaGo hasta DeepNash, los avances en IA para juegos de los grandes laboratorios en los últimos años han estado ligados a miles de chips y meses de entrenamiento, algo difícil de igualar para los equipos universitarios. Ataraxos redujo el costo de entrenamiento para este tipo de problema hasta un nivel que puede cubrir un presupuesto de investigación de tamaño mediano, lo que indica que, en este tipo de tareas, la búsqueda en el momento de la inferencia puede sustituir gran parte de la potencia de cómputo que antes se concentraba en el entrenamiento. Esto va en la misma dirección que la tendencia de los últimos años en los grandes modelos de lenguaje de trasladar cómputo del entrenamiento a la inferencia.

Entre los autores del artículo figuran Samuel Sokota, de la CMU (primer autor), Zico Kolter, Gabriele Farina y Zhiyuan Fan, del MIT, Eugene Vinitsky, de la Universidad de Nueva York, y Hengyuan Hu, de Stanford. El comunicado del MIT no precisa si el código y los pesos del modelo se harán públicos, ni cómo se comporta el sistema en otros juegos de información incompleta; eso quedará a la espera de los materiales suplementarios del artículo y de futuras publicaciones de los autores.

Fuentes: artículo en Nature, Oficina de Noticias del MIT, Tech Xplore, CocoLoop; la configuración de entrenamiento, los criterios de costo y el historial de partidas fueron verificados con base en el artículo, y los datos comparativos con DeepNash siguen lo descrito en el propio artículo.