KI besiegt Top-Stratego-Spieler mit Echtzeitplanung
Ein Forschungsteam der MIT, der Carnegie Mellon University, der New York University und der Stanford University hat ein KI-System namens Ataraxos entwickelt, das bei Stratego, einem klassischen Strategiespiel mit verdeckten Informationen, menschliche Weltmeister deutlich schlägt. Die Ergebnisse der Studie, veröffentlicht in der Fachzeitschrift Nature, markieren einen Durchbruch im Bereich des maschinellen Lernens für Situationen mit unvollständiger Informationslage. Im Gegensatz zu Spielen wie Schach, bei denen alle Spielzustände offengelegt sind, erfordert Stratego das Abwägen von Risiken bei geheimen Gegnerinformationen. Die möglichen Konfigurationen übersteigen bei Weitem die von Schach und stellen damit hohe Anforderungen an Rechenleistung und Algorithmen. Bisherige Ansätze, darunter das System DeepNash von Google DeepMind, waren rechenintensiv und kostspielig in der Trainingsphase. Ataraxos übertrifft diese Modelle nicht nur in der Spielstärke, sondern benötigt weniger als ein Prozent der Trainingsbeispiele und weniger als ein Dreißigstel der Selbstspiel-Simulationen. Die hohe Effizienz beruht auf einer Kombination aus selbstspielerendem Verstärkungslernen und einer neuen Technik namens Planen zum Entscheidungszeitpunkt. Das System erlernt zunächst eine robuste Grundstrategie, optimiert seine Züge jedoch während des Spiels dynamisch durch ein generatives Modell. Dieses schätzt Wahrscheinlichkeiten für die versteckten Figuren des Gegners ab und simuliert Folgezüge, bevor es eine finale Entscheidung trifft. Diese Architektur ermöglichte Ataraxos, den stärksten menschlichen Spieler mit 15:1:4 und die Spitzenrunden der Weltmeisterschaft mit 39:2 zu besiegen. Gabriele Farina von der MIT-Electrical Engineering and Computer Science Abteilung betont, dass solche Algorithmen in realen Szenarien mit verdeckten Informationen, wie etwa Cybersecurity, Wirtschaftsverhandlungen oder militärischen Manövern, entscheidende Vorteile bieten könnten. Da die möglichen Pfade in der Realität nicht vollständig durchrechnet werden können, ermögliche Ataraxos eine zuverlässige Risikokalkulation ohne die typische menschliche Überreaktion bei exponierten Positionen. Das System ließ sich erfolgreich auf weitere Spiele mit unvollständiger Information wie Barrage-Stratego, Hanabi und Dou dizhu übertragen, wobei durchgängig übermenschliche Leistungen erzielt wurden. Diese Generalisierbarkeit unterstreicht das Potenzial der zugrunde liegenden Methodik für komplexe Entscheidungskontexte. Für die zukünftige Entwicklung planen die Forscher, Interpretierbarkeitsmechanismen in Ataraxos zu integrieren. Damit soll sichergestellt werden, dass KI-Entscheidungen für menschliche Stakeholder nachvollziehbar und auditierbar bleiben. Laut Farina muss der Mensch stets die finale Entscheidungsgewalt behalten, weshalb transparente Modelle eine Voraussetzung für den späteren Einsatz in kritischen Realwelt-Anwendungen sind. Die Forschung stellt damit ein Fundament für die nächste Generation von KI-gestützten Strategiehilfen dar.
