Des chercheurs du MIT, de l'université Carnegie Mellon (CMU), de l'université de New York et de Stanford ont publié le 30 septembre, dans la revue Nature, un article présentant un système d'IA appelé Ataraxos. Sur le jeu de stratégie Stratego, il a battu Pim Niemeijer, considéré comme le joueur humain au palmarès le plus brillant de l'histoire de ce jeu, sur le score de 15 victoires, 1 défaite et 4 nuls.
Le coût est étonnamment faible. Selon la configuration donnée dans l'article, le modèle d'apprentissage par renforcement a été entraîné pendant une semaine sur 16 GPU H100, tandis que le modèle de croyance, utilisé pour déduire l'identité des pièces de l'adversaire, a été entraîné pendant quatre jours sur 4 GPU H100. Aux prix de 2025, le coût total s'élève à moins de 8 000 dollars.
Pourquoi Stratego est si difficile
Stratego est un jeu de plateau militaire à deux joueurs, chacun disposant de 40 pièces. Au début de la partie, le dos des pièces est tourné vers l'adversaire : qui est le maréchal, quelles pièces sont des bombes, où se cache le drapeau, tout cela reste invisible pour l'autre camp et n'est révélé qu'au moment du combat. L'équipe de recherche estime qu'il existe plus de 10 puissance 66 configurations de pièces possibles.
Cela diffère du go ou des échecs, des jeux à information complète où tout ce qui se trouve sur le plateau est visible. Stratego exige à la fois de deviner les cartes cachées de l'adversaire, de contrôler la quantité d'informations que l'on révèle soi-même, et de savoir bluffer. Ce type de jeu à information incomplète se rapproche, par sa structure, de problèmes réels comme les négociations, les enchères ou les attaques et défenses informatiques, et constitue depuis longtemps l'un des grands défis de la recherche en IA.
Gabriele Farina, auteur principal de l'article et enseignant au département de génie électrique et d'informatique du MIT, décrit ainsi le style de jeu d'Ataraxos :
"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."
(Traduction : Ataraxos calcule le risque d'une manière dont les humains sont incapables... il ne surcorrige pas au point de révéler ses propres secrets.)
Face à DeepNash
La référence précédente sur Stratego était DeepNash, développé par DeepMind en 2022. Entraîné par auto-apprentissage à grande échelle, il s'était classé parmi les trois meilleurs de l'histoire sur la plateforme en ligne de Stratego, Gravon, ce qui était alors considéré comme le signe que l'IA avait conquis ce jeu.
Ataraxos emprunte une voie différente. En plus de l'entraînement, il ajoute une planification au moment de la décision : à chaque coup, il effectue d'abord une recherche fondée sur des hypothèses concernant les pièces de l'adversaire, avant de jouer. Selon les chercheurs, le système ne devine pas au hasard, mais recherche le coup le plus sûr parmi toutes les positions possibles.
En comparant le coût d'entraînement des deux systèmes :
| Indicateur | Ataraxos par rapport aux travaux précédents |
|---|---|
| Coût de calcul de l'entraînement par renforcement | environ 1/500 |
| Nombre de parties d'auto-apprentissage | environ 1/30 |
| Nombre d'échantillons d'entraînement | environ 1/100 |
Côté résultats, outre le score de 15-1-4 contre Niemeijer, le bilan global d'Ataraxos face aux meilleurs joueurs de niveau championnat du monde est de 39 victoires et 2 défaites.
D'AlphaGo à DeepNash, les avancées en IA de jeu des grands laboratoires ces dernières années étaient généralement associées à des milliers de puces et des mois d'entraînement, hors de portée des équipes universitaires. Ataraxos ramène la facture d'entraînement pour ce type de problème à un niveau que peut couvrir un budget de recherche de taille moyenne, ce qui montre que, pour ce genre de tâche, la recherche au moment de l'inférence peut remplacer une grande partie de la puissance de calcul auparavant concentrée sur l'entraînement. C'est la même direction que la tendance observée ces dernières années dans les grands modèles de langage, consistant à déplacer la puissance de calcul de l'entraînement vers l'inférence.
Parmi les auteurs de l'article figurent Samuel Sokota, de CMU (premier auteur), Zico Kolter, Gabriele Farina et Zhiyuan Fan, du MIT, Eugene Vinitsky, de l'université de New York, et Hengyuan Hu, de Stanford. Le communiqué du MIT ne précise pas si le code et les poids du modèle seront rendus publics, ni comment le système se comporte sur d'autres jeux à information incomplète ; ces points devront être confirmés par les documents complémentaires de l'article et par de futures publications des auteurs.
Sources : article dans Nature, bureau de presse du MIT, Tech Xplore, CocoLoop ; la configuration d'entraînement, le mode de calcul des coûts et le bilan des parties ont été vérifiés à partir de l'article, et les données comparatives avec DeepNash suivent ce qui est décrit dans l'article lui-même.