KI für unter 8.000 Dollar schlägt Stratego-Spitzenspieler

Forscher von MIT, der Carnegie Mellon University (CMU), der New York University und der Stanford University haben am 30. September in der Fachzeitschrift Nature eine Studie veröffentlicht, die ein KI-System namens Ataraxos vorstellt. Im Strategiebrettspiel Stratego besiegte es Pim Niemeijer mit 15 Siegen, 1 Niederlage und 4 Unentschieden. Niemeijer gilt als der erfolgreichste menschliche Spieler in der Geschichte des Spiels.

Die Kosten sind erstaunlich niedrig. Laut der im Paper angegebenen Konfiguration wurde das Reinforcement-Learning-Modell eine Woche lang auf 16 H100-GPUs trainiert, das Glaubensmodell zur Einschätzung der gegnerischen Figuren vier Tage lang auf 4 H100-GPUs. Zu Preisen von 2025 lagen die Gesamtkosten bei unter 8.000 Dollar.

Warum Stratego so schwierig ist

Stratego ist ein Brettspiel für zwei Personen, bei dem jede Seite 40 Figuren besitzt. Zu Beginn zeigen die Figuren ihre Rückseite zum Gegner, wer Marschall ist, wo die Bomben liegen und wo die Flagge versteckt ist, bleibt verborgen und wird erst beim Aufeinandertreffen aufgedeckt. Das Forschungsteam schätzt, dass es mehr als 10 hoch 66 mögliche Aufstellungen gibt.

Das unterscheidet Stratego von Go oder Schach, zwei Spielen mit vollständiger Information, bei denen alles auf dem Brett offen sichtbar ist. Bei Stratego muss man gleichzeitig die verdeckten Karten des Gegners erraten, die eigenen preisgegebenen Informationen kontrollieren und bluffen können. Solche Spiele mit unvollständiger Information ähneln strukturell realen Problemen wie Verhandlungen, Auktionen oder Cyberangriffen und -verteidigung, und sie gelten seit Langem als eine der großen Herausforderungen der KI-Forschung.

Gabriele Farina, leitender Autor der Studie und Dozent am Fachbereich Elektrotechnik und Informatik des MIT, beschreibt die Spielweise von Ataraxos so:

"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."

(Übersetzung: Ataraxos berechnet Risiken auf eine Weise, wie es Menschen nicht können ... es überkorrigiert nicht und verrät damit nicht seine eigenen Geheimnisse.)

Im Vergleich zu DeepNash

Der bisherige Maßstab bei Stratego war DeepNash von DeepMind aus dem Jahr 2022. Es wurde durch umfangreiches Self-Play-Training trainiert und schaffte es auf der Online-Plattform Gravon unter die historisch besten drei Spieler, was damals als Meilenstein für die KI-Beherrschung dieses Spiels galt.

Ataraxos verfolgt einen anderen Ansatz. Zusätzlich zum Training setzt es auf Planung zur Entscheidungszeit: Bei jedem Zug führt es zunächst, basierend auf Vermutungen über die gegnerischen Figuren, eine Suchrunde durch, bevor es zieht. Laut den Forschern rät das System nicht blind, sondern sucht unter allen möglichen Stellungen nach dem sichersten Zug.

Im direkten Vergleich der Trainingskosten:

KennzahlAtaraxos im Vergleich zu früheren Arbeiten
Rechenkosten für das Reinforcement-Learning-Trainingetwa 1/500
Anzahl der Self-Play-Partienetwa 1/30
Anzahl der Trainingsbeispieleetwa 1/100

Neben dem 15:1:4 gegen Niemeijer liegt die Gesamtbilanz von Ataraxos gegen Spitzenspieler auf Weltmeisterschaftsniveau bei 39 Siegen und 2 Niederlagen.

Von AlphaGo bis DeepNash waren die Spiel-KI-Erfolge großer Labore in den vergangenen Jahren meist an Tausende Chips und monatelanges Training gekoppelt, was Universitätsteams kaum nachvollziehen konnten. Ataraxos drückt die Trainingskosten für dieselbe Art von Problem auf ein Niveau, das ein mittelgroßes Forschungsbudget abdecken kann, und zeigt damit, dass bei dieser Art von Aufgabe Suche zur Inferenzzeit einen Großteil der in der Trainingsphase aufgewendeten Rechenleistung ersetzen kann. Das entspricht dem Trend der vergangenen Jahre im Bereich großer Sprachmodelle, Rechenleistung vom Training in die Inferenz zu verlagern.

Zu den Autoren der Studie zählen Samuel Sokota von der CMU (Erstautor), Zico Kolter, Gabriele Farina und Zhiyuan Fan vom MIT, Eugene Vinitsky von der New York University sowie Hengyuan Hu von Stanford. Ob Code und Modellgewichte veröffentlicht werden und wie das System bei anderen Spielen mit unvollständiger Information abschneidet, geht aus der Pressemitteilung des MIT nicht hervor, dazu sollen die ergänzenden Materialien der Studie und künftige Veröffentlichungen der Autoren Aufschluss geben.

Quellen: Nature-Studie, MIT News Office, Tech Xplore, CocoLoop; Trainingskonfiguration, Kostenberechnung und Spielbilanz wurden anhand der Studie geprüft, die Vergleichsdaten zu DeepNash stammen aus der Studie selbst.