Detailansicht
Esports trainer
Klavio Tarka
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Informatik
Betreuer*in
Helmut Hlavacs
DOI
10.25365/thesis.81926
URN
urn:nbn:at:at-ubw:1-21950.89957.613087-9
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)
Abstracts
Abstract
(Deutsch)
Real-Time Strategy (RTS) ist ein Genre von Videospielen, das nicht in Runden ablaeuft; dies impliziert, dass das Spiel standardmaessig in Echtzeit gespielt wird. RTS-Spiele erfordern kontinuierliche, sofortige Entscheidungsfindungen, was sich von Brettspielen wie Schach oder Go unterscheidet, bei denen Spieler Zeit haben, ihren naechsten Zug in einer statischen Umgebung zu berechnen. Die Spieler muessen ihre Wirtschaft verwalten, Ressourcen pluendern, Gebaeude errichten und Einheiten befehligen, waehrend der Gegner genau dasselbe in Echtzeit tut. Dieser Zeit- und Aktionsfluss schafft eine schwierige Umgebung, die durch massive Zustandsraeume, unvollstaendige Informationen (oft durch den Kriegsnebel verborgen, den diese Arbeit nicht behandeln wird) und die Notwendigkeit zur Optimierung von Strategien fuer das kurz- und langfristige Gameplay gekennzeichnet ist. Aufgrund dieser Eigenschaften ist bekannt, dass diese Spiele mit kuenstlicher Intelligenz schwer zu loesen sind. Um diese Umgebungen erfolgreich zu navigieren, kann sich ein Agent nicht einfach auf Brute-Force-Suchalgorithmen verlassen, da der Verzweigungsfaktor moeglicher Aktionen in einem RTS-Spiel ungewoehnlich gross ist. Deshalb erfordern Reinforcement Learning (RL)-Agenten, die gegeneinander antreten, Setups, die optimales Verhalten durch Versuch und Irrtum lehren, waehrend die Suchtiefe pro Spielzustand begrenzt ist. Reinforcement Learning hat eine Geschichte der Eroberung immer komplexerer Spiele, angefangen bei Atari-Titeln bis hin zur Meisterung von Brettspielen wie dem beruehmten GO (Baduk). Der Uebergang von klassischen rundenbasierten Spielen zu kontinuierlichen Multi-Agenten-RTS-Spielen erfordert voellig andere Ansaetze. Die Agenten muessen lernen, ihre unmittelbaren Belohnungen und ihre verzoegerten Belohnungen abzuwaegen, wie zum Beispiel den Gewinn eines kleinen Scharmuetzels, aber den Verlust der Basis, oder die Investition in eine staerkere Wirtschaft, die ein paar Minuten spaeter im Spiel eine staerkere Armee hervorbringen wird. Diese Arbeit befasst sich mit den wichtigsten Herausforderungen bei der Anwendung von RL in diesem Bereich, einschliesslich der dynamischen Ein-/Ausgabe-Repraesentation, der rechnerischen Effizienz sowie der Integration und dem Vergleich von Reinforcement-Learning-Modellen in einem benutzerdefinierten Echtzeit-Strategie-Framework. Die Ziele dieser Arbeit lassen sich wie folgt zusammenfassen: zu dem Aufbau eines zugaenglichen Werkzeugs, das Strategielernen von Reinforcement-Learning-Agenten ermoeglicht, die Bereitstellung eines RTS-Werkzeugs, bei dem das Experimentieren nicht an ein kommerzielles Produkt gebunden ist, und die Praesentation einer kleinen Umfrage darueber, wie dieses Werkzeug menschlichen Spielern helfen kann, neue Strategien speziell in RTS-Spielen zu erlernen. Dies geschieht durch die Implementierung von zwei grundlegend unterschiedlichen Reinforcement-Learning-Algorithmen, respektive Deep Q-Networks (DQN) und Proximal Policy Optimization (PPO). DQN repraesentiert einen wertbasierten, Off-Policy-Ansatz, bei dem der Agent lernt, die zukuenftigen Belohnungen spezifischer Aktionen in spezifischen Zustaenden zu schaetzen. PPO ist ein On-Policy-Actor-Critic-Algorithmus, der die Richtlinie (Policy) selbst direkt optimiert und Aktualisierungen glaettet (durch Begrenzung der Aktualisierungsrate), um ein stabiles Lernen zu gewaehrleisten. Der Vergleich und die Implementierung dieser beiden Algorithmen in dieser Umgebung dienen als zentrale Studie fuer diese Arbeit, analysierend, wie sie gegeneinander abschneiden, spezifisch hinsichtlich ihrer Platzkomplexitaet, ihrem rechnerischen Aufwand und der gesamten strategischen Leistung. Reinforcement Learning wurde bereits in mehreren anderen Arbeiten auf RTS-Spiele angewendet, am namhaftesten in Arbeiten, die sich auf StarCraft II konzentrieren, wie das AlphaStar-Projekt und anschliessende gross angelegte Offline-RL-Studien wie AlphaStar Unplugged. Die meisten dieser hochkaraetigen Arbeiten zeigen jedoch keinen direkten Vergleich von zwei voellig unterschiedlichen algorithmischen Paradigmen. Stattdessen fokussieren sie sich auf die Skalierung eines einzelnen Algorithmus durch das Hinzufuegen zusaetzlicher Tweaks, riesiger Mengen an Rechenleistung und komplexer Liga-Trainingssysteme, die den Forscher dazu verpflichten, Zugriff auf eine massive Datenbank von Trainingsdaten zu haben. Ein weiteres Problem in der aktuellen Landschaft der RTS-KI-Forschung ist der statische Zustand der Umgebungen. In grossen kommerziellen Titeln, die fuer die Forschung genutzt werden, kann man die Zustandsdarstellungen, die Kernmechaniken oder die Aktionen, die im Spiel vollzogen werden, nicht fundamental aendern. Dies fuehrt dazu, dass sowohl die Umgebung als auch der Agent etwas fixiert sind, da diese kommerziellen Spiele nicht Open Source sind und stark durch die bereitgestellten APIs eingeschraenkt werden. Diese Arbeit versucht, solchen Einschraenkungen zu entkommen. Sie versucht nicht nur, ein Werkzeug bereitzustellen, das zum Strategielernen und zur Beantwortung der Leistungsfrage zwischen diesen beiden Reinforcement-Learning-Agenten verwendet werden kann, sondern auch eine Plattform fuer andere Experimente zu bieten, ohne dass Trainingsdaten notwendig sind. Durch die Nutzung einer Umgebung, in der Forscher Testdaten erstellen und die Spielmechaniken grundlegend aendern koennen, kann dieses Framework manipuliert werden, um spezifische Experimentanforderungen zu erfuellen. Ueber den technischen Vergleich der Algorithmen hinaus, wie erwaehnt, ist ein weiteres wichtiges Ziel dieser Arbeit das Beobachten einer Umfrage, die von Teilnehmern ausgefuellt wurde, die fragt, ob das Betrachten dieser Simulation dazu fuehren kann, neue Strategien von der KI, die das Spiel spielt, zu lernen? Menschen, die mit Videospielen interagieren, generieren im Allgemeinen etwas, das man Metas oder optimale Spielweisen nennt, durch Stunden des Sammelns von Wissen und des Machens von Fehlern. Jedoch sind diese Metas im Allgemeinen voreingenommen und nur optimal basierend darauf, was funktioniert hat oder basierend auf der Gewinnrate. In Videospielen wie RTS, in denen die Strategien beinahe unbegrenzt sind, koennen Metas nur basierend auf Strategien definiert werden, die getestet und bewiesen wurden. RL-Agenten versuchen, eine Belohnung zu maximieren, was nur durch Versuch und Irrtum von zuvor getesteten Strategien und die Erforschung neuer Strategien getan werden kann. Sie erforschen den Zustands-Aktions-Raum rein mathematisch, was oft dazu fuehrt, dass sie bizarre, aber optimale Strategien entdecken (dies koennte eine gute oder eine schlechte Sache sein). Wie im Experimente-Abschnitt zu sehen sein wird, waehlen die Agenten waehrend des Tests mit dem Belohnungssystem, nur fuer Gold zu farmen ohne es zu benutzen oder rein anzugreifen, selbst wenn die Einheiten sterben. Zu beobachten, ob menschliche Spieler einen Wert aus diesen Simulationen extrahieren koennen, ist eine interessante Idee. Das Erlernen neuer Strategien durch das Beobachten einer KI-Simulation spart immense Mengen an Zeit, die manuell fuer das Experimentieren oder das Auswendiglernen neuer Strategien aufgewendet wuerden. Zusaetzlich lehrt es Spieler neue Wege, auf ungewoehnliche, Out-of-the-Box-Taktiken zu reagieren, denen sie in echten kompetitiven Spielen gegen andere Spieler begegnen koennten. Wenn ein RL-Agent eine bisher ungesehene Einheitszusammensetzung oder ein unkonventionelles Pathing-Manoever entdeckt, das die aktuelle menschliche Meta bricht, kann dieses Wissen direkt zu den Spielern zurueckuebertragen werden. Um die oben skizzierten Ziele anzugehen, wird diese Arbeit von den folgenden Forschungsfragen geleitet und die erwarteten Ergebnisse als die Hypothesen unten dargelegt: RQ1: Algorithmische Leistung in RTS-Umgebungen. Wie vergleichen sich wertbasierte (DQN) und Policy-Gradient (PPO) Reinforcement-Learning-Algorithmen in Bezug auf Anpassungsfaehigkeit, Trainingsstabilitaet, Leistung und allgemeine Gewinnrate innerhalb einer hochkomplexen, Echtzeit-Strategie-Umgebung? H1: Hypothese eins ist, dass PPO signifikant besser als DQN sowohl in der Gewinnrate als auch in der strategischen Anpassungsfaehigkeit abschneiden wird. PPOs stochastische Politik und das geclippte Surrogat-Ziel sind theoretisch besser ausgeruestet, um die massiven Zustands-Aktions-Raeume, verzoegerten Belohnungen und subtilen Umweltverschiebungen (wie randomisierte Zugfolgen), die RTS-Spielen innewohnen, zu handhaben, wohingegen DQNs deterministische Natur sich als zu sproede erweisen wird. RQ2: RL-Agenten als Esports-Lerner. Kann eine agentengetriebene Strategie-GUI menschlichen Spielern neue, mathematisch optimale Strategien beibringen? H2: Hypothese zwei besagt, dass das Aussetzen der Echtzeit-Wahrscheinlichkeitsverteilungen des Aktionsraums eines RL-Agenten durch eine dedizierte GUI es menschlichen Beobachtern ermoeglichen wird, effektiv Strategien leicht zu identifizieren, zu verstehen und in ihrem eigenen Gameplay zu implementieren.
Abstract
(Englisch)
Real-time strategy (RTS) is a genre of video games that does not progress in turns; this implicitly means that the game is played in real time by default. RTS games demand continuous immediate decision-making which differs from board games such as Chess or Go, where players have time to calculate their next move in a static environment. Players must manage their economies, loot resources, build buildings, and command units while the opponent is doing the exact same thing in real-time fashion. This flow of time and action creates a difficult environment, characterized by massive state spaces, imperfect information (often hidden by a fog of war, which this thesis will not cover), and the need for optimization of strategies for short and long term gameplay. Because of these characteristics, these games are known to be difficult to solve using artificial intelligence. To successfully navigate these environments, an agent cannot simply rely on brute-force search algorithms as the branching factor of possible actions in an RTS game is abnormally large. That is why reinforcement learning (RL) agents competing against each other require setups that teach optimal behavior through trial and error while the depth of search per game state is capped. Reinforcement learning has a history of conquering increasingly complex games, transitioning from Atari titles to mastering board games such as the famous GO (Baduk) game. Shifting from classic turn-based games to continuous, multi-agent RTS games requires completely different approaches. The agents must learn to balance their immediate rewards and their delayed rewards, such as winning a small skirmish but losing their base, or investing in a stronger economy that will give a stronger army a few minutes further into the game. This thesis addresses key challenges to applying RL in this domain, including dynamic input/output representation, computational efficiency, and the integration and comparison of reinforcement learning models in a custom real-time strategy framework. The objectives of this work can be summarized as follows: to build an accessible tool that allows for strategy learning from reinforcement learning agents, providing an RTS tool where experimentation is not bound to a commercial product and presenting a small survey on how this tool can help human players to learn new strategies specifically in RTS games. This is done by implementing two distinctly different core reinforcement learning algorithms, respectively Deep Q-Networks (DQN) and Proximal Policy Optimization (PPO). DQN represents a value-based, off-policy approach, where the agent learns to estimate the future rewards of specific actions in specific states. PPO is an on-policy, actor-critic algorithm that directly optimizes the policy itself, smoothing out updates (by capping the update rate) to ensure stable learning. The comparison and implementation of these two algorithms in this environment serves as a central study for this thesis, analyzing how they perform against one another, specifically regarding their space complexity, computational overhead, and overall strategic performance. Reinforcement learning has already been applied to RTS games in several other papers, most notably in works focusing on StarCraft II, such as the AlphaStar project and subsequent large-scale offline RL studies like AlphaStar Unplugged. However, most of these high-profile papers do not actually showcase a direct comparison of two completely different algorithmic paradigms. Instead, they focus on scaling a single algorithm by adding extra tweaks, vast amounts of compute, and complex league-training systems which require the researcher to have access to a massive database of training data. Another problem in the current landscape of RTS AI research is the static state of the environments. In major commercial titles used for research, you cannot fundamentally change the state representations, the core mechanics, or the actions taken in the game. This leads to both the environment and the agent being somewhat fixed, as these commercial games are not open source and are heavily restricted by their provided APIs. This work attempts to escape such constraints. It tries not only to provide a tool that can be used for strategy learning and answering the question of performance between these two reinforcement learning agents, but also to provide a platform for other experiments to be conducted without the need for training data. By utilizing an environment where researchers can create test data and fundamentally change the game mechanics, this framework can be manipulated to fit specific experiment requirements. Beyond the technical comparison of algorithms, as mentioned, another important objective for this thesis is observing a survey completed by participants that asks whether viewing this simulation can lead to learning new strategies from the AI playing the game? People interacting with video games generally generate something called metas or optimal ways to play a game through hours of collecting knowledge and making mistakes. However, these metas are generally biased and are only optimal based on what has worked or based on win rate. In video games like RTS where the strategies are almost unlimited metas can only be defined based on strategies that have been tested and proven. RL agents try to maximize a reward which can only be done via trial and error of previously tested strategies and exploration of new strategies. They explore the state-action space solely mathematically, which often leads them to discover bizarre, but optimal strategies (this could be a good thing or a bad thing). As will be seen in the experiments section where the agents during testing with the reward system, choose to farm only for gold without using it or purely attack even if the units die. Observing if human players can extract value from these simulations is an interesting idea. Learning new strategies from observing an AI simulation saves immense amounts of time that would be spent manually experimenting with or memorizing new strategies. Additionally, it teaches players new ways to react to unusual, out-of-the-box tactics they might encounter in real competitive matches against other players. If an RL agent discovers a previously unseen unit composition or an unconventional pathing maneuver that breaks the current human meta, that knowledge can be directly transferred back to the players. To address the objectives outlined above, this thesis is guided by the following research questions and the expected results laid out as the hypotheses below: RQ1: Algorithmic Performance in RTS Environments. How, do value-based (DQN) and policy-gradient (PPO) reinforcement learning algorithms compare in terms of adaptability, training stability, performance and overall win rate within a highly complex, real-time strategy environment? H1: Hypothesis one is that PPO will significantly outperform DQN in both win rate and strategic adaptability. PPO's stochastic policy and clipped surrogate objective are theoretically better equipped to handle the massive state-action spaces, delayed rewards, and subtle environmental shifts (such as randomized turn orders) inherent to RTS games, whereas DQN's deterministic nature will prove too brittle. RQ2: RL agents acting as an esports learner. Can an agent-driven strategy GUI teach human players new, mathematically optimal strategies? H2: Hypothesis two that exposing the real-time probability distributions of an RL agent's action space through a dedicated GUI will allow human observers to easily identify, understand and implement effective strategies in their own gameplay.
Schlagwörter
Schlagwörter
(Deutsch)
RL Reinforcement learning PPO DQN
Schlagwörter
(Englisch)
DQN PPO Reinforcement learning RL
Autor*innen
Klavio Tarka
Haupttitel (Englisch)
Esports trainer
Publikationsjahr
2026
Umfangsangabe
72 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Helmut Hlavacs
Klassifikation
54 Informatik > 54.72 Künstliche Intelligenz
AC Nummer
AC18026489
Utheses ID
82176
Studienkennzahl
UA | 066 | 921 | |
