📉 Gradientenabstieg-Visualisierer — Optimierer-Pfade auf Verlustlandschaften
Visualisiere, wie SGD, Momentum, RMSprop und Adam eine 2D-Verlustlandschaft navigieren. Passe Lernrate und Rauschen an und beobachte, wie unterschiedliche Optimierer zum Minimum konvergieren oder stecken bleiben.
Über diese Simulation
Diese Simulation visualisiert Gradientenabstieg, den grundlegenden Optimierungsalgorithmus hinter dem Training neuronaler Netze. Ein Punkt bewegt sich über eine 2D-Verlustlandschaft in Richtung des steilsten Abstiegs, und du kannst zwischen den Optimierern SGD, Momentum, RMSprop und Adam wechseln, um ihre unterschiedlichen Konvergenzpfade direkt zu vergleichen.
🔬 Was sie zeigt
Jeder Optimierer folgt demselben Gradienten der Verlustlandschaft, aktualisiert die Position aber nach unterschiedlichen Regeln — SGD folgt direkt dem Gradienten, Momentum akkumuliert Schwung, RMSprop passt die Schrittweite pro Richtung an, und Adam kombiniert beide Ideen.
🎮 Bedienung
Wähle einen Optimierer, stelle Lernrate und Rauschen ein und klicke auf die Landschaft, um einen neuen Startpunkt zu setzen und den Konvergenzpfad zu beobachten.
💡 Wussten Sie schon?
Adam, veröffentlicht 2015 von Kingma und Ba, kombiniert Momentum und adaptive Lernraten und ist seither einer der am häufigsten verwendeten Optimierer im Deep Learning, weil er in der Praxis über viele verschiedene Architekturen hinweg zuverlässig gut funktioniert.
Häufig gestellte Fragen
Was ist Gradientenabstieg?
Gradientenabstieg ist ein iterativer Optimierungsalgorithmus, der eine Funktion minimiert, indem er wiederholt einen Schritt in Richtung des negativen Gradienten macht, also in die Richtung des steilsten Abstiegs. Im maschinellen Lernen wird er verwendet, um die Parameter eines Modells so anzupassen, dass der Verlust minimiert wird.
Wie unterscheiden sich SGD, Momentum, RMSprop und Adam?
SGD folgt direkt dem aktuellen Gradienten. Momentum akkumuliert einen gleitenden Durchschnitt vergangener Gradienten, um Schwung aufzubauen und Oszillationen zu dämpfen. RMSprop passt die Schrittweite für jede Richtung anhand der jüngsten Gradientengröße an. Adam kombiniert Momentum und die adaptive Schrittweite von RMSprop zu einem einzigen Optimierer.
Was bewirken die Regler für Lernrate und Rauschen?
Die Lernrate stellt die Schrittgröße bei jeder Aktualisierung ein — zu hoch führt zu Überschwingen und Instabilität, zu niedrig zu langsamer Konvergenz. Der Rauschregler fügt dem Gradienten zufällige Störungen hinzu, was den stochastischen Charakter von echtem Mini-Batch-Training simuliert.
Ist diese Simulation mathematisch exakt?
Ja, alle vier Optimierer implementieren ihre exakten Standard-Aktualisierungsformeln, wie sie in der Fachliteratur zum maschinellen Lernen definiert sind. Die Verlustlandschaft selbst ist eine vereinfachte 2D-Funktion, gewählt, um interessante Merkmale wie lokale Minima und Sattelpunkte visuell verständlich zu zeigen.
Warum bleiben Optimierer manchmal stecken oder verhalten sich seltsam?
Optimierer können in lokalen Minima oder auf flachen Plateaus stecken bleiben, wo der Gradient nahe null ist, oder um enge Täler oszillieren, wenn die Lernrate zu hoch gewählt ist. Adaptive Methoden wie Adam und RMSprop mildern manche dieser Probleme, indem sie die effektive Schrittweite pro Richtung anpassen, sind aber nicht immun dagegen.