Detailansicht

Understanding policy churn
susceptibility, exploration and plasticity loss
Thomas Geier
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Informatik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Data Science
Betreuer*in
Sebastian Tschiatschek
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.82102
URN
urn:nbn:at:at-ubw:1-23302.51484.401960-8
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Wertbasierte Deep-Reinforcement-Learning-Agenten wie DQN und Double DQN lernen eine neuronale Schätzung von Aktionswerten und wählen Aktionen typischerweise "greedy" auf Grundlage dieser Schätzung. Da bereits kleine Veränderungen in den Q-Werten die ausgewählte greedy Action verändern können, kann das Training Policy Churn hervorrufen: häufige Veränderungen der greedy Policy über den Trainingsverlauf hinweg. Dieses Phänomen ist für Exploration relevant, da wechselnde greedy Actions den Agenten auch ohne zusätzliche zufällige Aktionen neuen Trajektorien aussetzen können. Zudem kann Policy Churn mit der Plastizität des Netzwerks zusammenhängen, da die Fähigkeit eines Netzwerks, auf neue Lernsignale zu reagieren, beeinflussen kann, wie sich seine Policy während des Trainings verändert. In dieser Arbeit führen wir eine systematische empirische Untersuchung von Policy Churn im wertbasierten Reinforcement Learning durch, unter Verwendung von Double DQN in MiniGrid- und Atari-Umgebungen. Wir analysieren Policy Churn im Zusammenhang mit Exploration, Netzwerkkapazität, Plasticity Loss und Lernstabilität. Unsere Ergebnisse zeigen, dass Policy Churn häufig beobachtet wird und Exploration in einfachen MiniGrid-Umgebungen unterstützen kann, dieser Effekt jedoch fragil und seed-abhängig ist. In stärker strukturierten Umgebungen wie MiniGrid FourRooms erzeugt Policy Churn nicht zuverlässig das zeitlich kohärente Verhalten, das für Deep Exploration erforderlich ist. In Atari, insbesondere in Qbert und Phoenix, wird Policy Churn durch die Lerndynamik und plastizitätsbezogene Eigenschaften des Netzwerks geprägt. Interventionen zur Erhaltung der Plastizität wie Shrink & Perturb, Weight Resets und Layer Normalization verändern die Churn-Dynamik und können die Lernstabilität oder die langfristige Performance verbessern. Insgesamt deuten die Experimente darauf hin, dass Policy Churn allein kein verlässlicher Ersatz für strukturierte Deep Exploration ist. Vielmehr lässt sich Policy Churn am besten als diagnostisches Signal der zugrunde liegenden Lerndynamik interpretieren, insbesondere im Hinblick auf Netzwerkplastizität und Trainingsstabilität.
Abstract
(Englisch)
Value-based deep reinforcement learning agents, such as DQN and Double DQN, learn a neural estimate of action values and typically act greedily with respect to this estimate. Since even small changes in Q-values can alter the selected greedy action, training can induce policy churn: frequent changes in the greedy policy over time. This phenomenon is relevant for exploration, because changing greedy actions can expose the agent to new trajectories even without additional random actions. It may also be related to network plasticity, since a network's ability to respond to new learning signals can influence how its policy changes during training. In this thesis, we conduct a systematic empirical study of policy churn in value-based reinforcement learning using Double DQN across MiniGrid and Atari environments. We analyse policy churn in relation to exploration, network capacity, plasticity loss, and learning stability. Our results show that policy churn is commonly observed and can support exploration in simple MiniGrid environments, but this effect is brittle and seed-dependent. In more structured environments such as MiniGrid FourRooms, churn does not reliably produce the temporally coherent behaviour required for deep exploration. In Atari, particularly in Qbert and Phoenix, churn is shaped by learning dynamics and plasticity-related properties of the network. Plasticity-preserving interventions such as Shrink & Perturb, weight resets, and Layer Normalization reshape churn dynamics and can improve learning stability or long-term performance. Overall, the experiments indicate that policy churn alone is not a reliable substitute for structured deep exploration. Rather, churn is best interpreted as a diagnostic signal of the underlying learning dynamics, especially network plasticity and training stability.

Schlagwörter

Schlagwörter
(Deutsch)
Reinforcement Learning Machine Learning Policy Churn Plasticity Loss Deep Exploration
Autor*innen
Thomas Geier
Haupttitel (Englisch)
Understanding policy churn
Hauptuntertitel (Englisch)
susceptibility, exploration and plasticity loss
Publikationsjahr
2026
Umfangsangabe
viii, 56 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Sebastian Tschiatschek
Klassifikationen
31 Mathematik > 31.73 Mathematische Statistik ,
54 Informatik > 54.72 Künstliche Intelligenz
AC Nummer
AC18051099
Utheses ID
81279
Studienkennzahl
UA | 066 | 645 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1