Detailansicht

Edge of stability for neural networks
extending current research to stochastic adaptive optimizers
Jakob Fabian Rohner
Art der Arbeit
Masterarbeit
Universität
Universität Wien
Fakultät
Fakultät für Mathematik
Studiumsbezeichnung bzw. Universitätlehrgang (ULG)
Masterstudium Mathematik
Betreuer*in
Philipp Christian Petersen
Volltext in Browser öffnen
Alle Rechte vorbehalten / All rights reserved
DOI
10.25365/thesis.82112
URN
urn:nbn:at:at-ubw:1-28907.04617.219427-3
Link zu u:search
(Print-Exemplar eventuell in Bibliothek verfügbar)

Abstracts

Abstract
(Deutsch)
Die Trainingsdynamik moderner neuronaler Netze wird stark durch die Phänomene des progressive sharpening und der Edge of Stability (EoS) beeinflusst. Diese Arbeit bietet einen umfassenden Überblick der EoS für ein breites Spektrum von Optimierungsalgorithmen sowohl deterministischer als auch stochastischer Natur. Sowohl die genauen Bedingungen, unter denen diese Phänomene auftreten, als auch die dahinterstehenden Mechanismen werden untersucht. Während die Stabilitätsschwellen sowohl für stochastische Methoden wie SGD als auch für adaptive Methoden wie Adam im full batch Fall in der aktuellen Literatur gut dokumentiert sind, bleiben die Stabilisierungsmechanismen von stochastischen adaptiven Optimierern wie mini-batch Adam, ein sehr beliebter Optimierungsalgorithmus für reale neuronale Netze, weitgehend unerforscht. Diese Arbeit stellt heuristisch neue Instabilitätskriterien für diese stochastischen adaptiven Methoden auf: die effective batch sharpness für scalar RMSProp und standard RMSProp sowie die momentum effective batch sharpness für Adam. Aufbauend auf diesen neu etablierten Metriken präsentieren wir einen rigorosen Beweis: Überschreitet Adams modified batch sharpness den theoretischen Schwellenwert der maximum stable sharpness, wächst die erwartete Root-Mean-Square-Norm des Momentumvektors exponentiell an und löst eine lokale Instabilität sowie einen Katapulteffekt aus. Die in dieser Arbeit durchgeführten numerischen Experimente zeigen, dass für scalar RMSProp und standard RMSProp die gefundenen sharpness Werte wachsen, bis sie die prognostizierte Stabilitätsschwelle erreichen. Die effective batch sharpness ist somit ein valides Instabilitäötskriterion für scalar RMSProp und standard RMSProp. Adam verhält sich in den Experimenten grundlegend anders. Adams interne Mechanismen unterdrücken die Bewegung der Parameter entlang der Eigenvektoren mit der höchsten sharpness. Dadurch bleibt die momentum effective batch sharpness für Adam weit unterhalb der von uns abgeleiteten theoretischen Instabilitätsschwelle.
Abstract
(Englisch)
The training dynamics of modern neural networks are heavily influenced by the phenomena of progressive sharpening and the Edge of Stability (EoS). This thesis provides a comprehensive overview of the EoS across a wide spectrum of optimization algorithms of both deterministic and stochastic nature. Both the precise conditions under which these phenomena occur as well as the mechanisms behind them are explored. While the stability thresholds for both stochastic methods like SGD and adaptive methods like Adam in the full batch case are well documented in current literature, the stabilization mechanisms of stochastic adaptive optimizers like mini-batch Adam, which is a very popular optimizer for real world neural networks, remain largely unexplored. This work heuristically derives new instability criteria for these stochastic adaptive methods: the effective batch sharpness for scalar RMSProp and standard RMSProp, and the momentum effective batch sharpness for Adam. Building upon these newly established metrics, we present a rigorous theoretical proof demonstrating that if Adam's modified batch sharpness exceeds the theoretical maximum stable sharpness threshold, the expected root-mean-square norm of the momentum vector will grow exponentially, triggering local instability and a catapult effect. The numerical experiments conducted in this thesis demonstrate that for scalar RMSProp and standard RMSProp, the found sharpness values grow until they reach the projected stability threshold, making them a valid instability criterion. Adam behaves fundamentally differently in the experiments. It's internal mechanics suppress its movement along the sharpest eigenvectors, allowing it to consistently plateau well below the theoretical instability threshold we derived.

Schlagwörter

Schlagwörter
(Deutsch)
maschinelles Lernen neuronale Netzwerke künstliche Intelligenz Optimierung Nichtlineare Optimierung
Schlagwörter
(Englisch)
progressive sharpening Edge of Stability sharpness batch sharpness central flow Adam gradient descent stochastic gradient descent
Autor*innen
Jakob Fabian Rohner
Haupttitel (Englisch)
Edge of stability for neural networks
Hauptuntertitel (Englisch)
extending current research to stochastic adaptive optimizers
Paralleltitel (Deutsch)
Edge of stability für neuronale Netzwerke
Paralleluntertitel (Deutsch)
Erweiterung der aktuellen Forschung auf stochastische adaptive Optimierungsalgorithmen
Publikationsjahr
2026
Umfangsangabe
86 Seiten : Illustrationen
Sprache
Englisch
Beurteiler*in
Philipp Christian Petersen
Klassifikation
31 Mathematik > 31.76 Numerische Mathematik
AC Nummer
AC18051461
Utheses ID
82829
Studienkennzahl
UA | 066 | 821 | |
Universität Wien, Universitätsbibliothek, 1010 Wien, Universitätsring 1