📉 Descenso de Gradiente — Superficie de Pérdida 3D y Optimizadores
Recorre un paisaje de pérdida en 3D (Rosenbrock, Rastrigin, Himmelblau) con SGD, Momentum, RMSprop y Adam. Observa las trayectorias y compara las velocidades de convergencia.
Acerca de esta simulación
Esta simulación coloca cuatro optimizadores — SGD, Momentum, RMSprop y Adam — sobre la misma superficie de pérdida en 3D y te permite ver cómo compiten hacia un mínimo. Elige entre cuatro funciones clásicas de prueba de optimización (Rosenbrock, Rastrigin, Himmelblau, Beale), cada una con su propia trampa conocida para los métodos basados en gradiente, desde valles estrechos y curvados hasta campos de mínimos locales. Cada optimizador parte del mismo punto y toma su regla de actualización de las fórmulas reales usadas para entrenar redes neuronales, así que las trayectorias de colores que ves son un comportamiento algorítmico genuino, no una animación guionizada. Los gradientes se calculan numéricamente con una diferencia finita centrada en lugar de simbólicamente, tal como lo haría una implementación desde cero.
🔬 Qué muestra
Una malla 3D en vivo de una función de pérdida elegida (Rosenbrock, Rastrigin, Himmelblau o Beale), coloreada por altura, con cuatro esferas — una por optimizador — descendiendo en paralelo. Cada esfera deja una estela de color (rojo SGD, verde azulado Momentum, amarillo RMSprop, verde Adam) para que puedas comparar trayectorias, velocidad y si un optimizador queda atrapado en un mínimo local u oscila a través de un valle.
🎮 Cómo usarlo
Elige una superficie de pérdida en el menú desplegable, luego ajusta la tasa de aprendizaje (escala logarítmica), Momentum β₁, Adam β₂ y pasos/fotograma. Activa o desactiva cualquiera de los cuatro optimizadores para aislar su comportamiento, arrastra para orbitar la escena en 3D, desplázate para acercar, y usa Pausa/Reinicio para congelar la ejecución o reiniciar todos los optimizadores desde su punto de partida compartido.
💡 ¿Sabías que...?
Adam (Estimación Adaptativa de Momentos) fue presentado por Kingma y Ba en 2014 y combina las ideas detrás de Momentum y RMSprop: hace un seguimiento de un promedio móvil tanto del gradiente como de su cuadrado, y luego los corrige por sesgo para que los primeros pasos no estén sesgados hacia cero. Esa combinación es la razón por la que Adam es el optimizador predeterminado para la mayor parte del aprendizaje profundo actual.
Preguntas frecuentes
¿Qué es el descenso de gradiente?
El descenso de gradiente es un algoritmo iterativo de optimización que minimiza una función de pérdida moviendo repetidamente los parámetros en la dirección del gradiente negativo. Es la columna vertebral del entrenamiento de redes neuronales y de la mayoría de los modelos de aprendizaje automático.
¿Cómo afecta la tasa de aprendizaje a la convergencia?
La tasa de aprendizaje controla el tamaño del paso dado en la dirección del gradiente negativo. Una tasa demasiado grande hace que el optimizador se pase de los mínimos y diverja; una tasa demasiado pequeña hace que el entrenamiento sea muy lento. Los métodos adaptativos como Adam ajustan automáticamente las tasas de aprendizaje efectivas por parámetro.
¿Cuál es la diferencia entre SGD y Adam?
SGD (Descenso de Gradiente Estocástico) actualiza los parámetros restando una fracción fija del gradiente. Adam (Estimación Adaptativa de Momentos) mantiene promedios móviles exponenciales tanto de los gradientes como de sus cuadrados, dando a cada parámetro su propia tasa de aprendizaje adaptativa con corrección de sesgo, lo que normalmente converge mucho más rápido en superficies complejas.
¿Qué es la función de Rosenbrock, y por qué es una prueba difícil?
La función de Rosenbrock f(x,y) = (1−x)² + 100(y−x²)² tiene su mínimo global en (1,1), dentro de un valle estrecho y curvado. El gradiente a lo largo del fondo del valle es diminuto comparado con el gradiente que lo atraviesa, por lo que el SGD puro tiende a zigzaguear lentamente por las paredes del valle mientras Momentum y Adam lo atraviesan mucho más rápido.
¿Por qué Momentum a veces supera a Adam, y a veces no?
Momentum acumula un vector de velocidad, por lo que sigue acelerando en direcciones donde el gradiente apunta de forma consistente hacia el mismo lado, lo que favorece a valles suaves como el de Rosenbrock. Adam además normaliza el paso de cada parámetro mediante una estimación continua de su gradiente al cuadrado, lo que ayuda más en paisajes con curvaturas muy distintas en diferentes direcciones, como los muchos pequeños montículos de Rastrigin.
Recorre un paisaje de pérdida en 3D (Rosenbrock, Rastrigin, Himmelblau) con SGD, Momentum, RMSprop y Adam. Observa las trayectorias y compara las velocidades de convergencia.
3D · Renderizador Three.js / WebGL · Objetivo de 60 FPS · se ejecuta enteramente en el cliente, sin instalación