InicioIA y aprendizaje automáticoVisualizador de Descenso de Gradiente

📉 Visualizador de Descenso de Gradiente

Observa cómo SGD, Adam, Momentum y RMSprop recorren un paisaje de pérdida en 3D en tiempo real. Compara la velocidad de convergencia y la forma del recorrido entre optimizadores. Ajusta la tasa de aprendizaje, el momentum y el ruido.

IA y aprendizaje automático3DFácil60 FPS
gradient-descent ↗ Abrir independiente

Acerca de esta simulación

Este visualizador coloca uno o más optimizadores sobre un paisaje de pérdida en 3D y anima la trayectoria iterativa que cada uno traza hacia un mínimo. En cada paso se calcula analíticamente el gradiente real de una función de prueba elegida, se inyecta ruido opcional, y la regla de actualización de parámetros de SGD, Momentum, RMSprop o Adam mueve el marcador cuesta abajo. Ver las cuatro trayectorias competir sobre superficies como el valle de Rosenbrock revela por qué los métodos adaptativos manejan la curvatura, los barrancos estrechos y los puntos de silla de forma tan diferente.

🔬 Qué muestra

Un campo de altura renderizado de un banco de pruebas clásico de optimización (Rosenbrock, una silla, la función de Beale o Himmelblau). Puntos de colores lo descienden usando ecuaciones de actualización reales: SGD puro (x ← x − lr·g), Momentum, el escalado por gradiente al cuadrado por eje de RMSprop, y Adam con sus momentos de primer y segundo orden con corrección de sesgo (β₁, β₂ = 0.999). La ★ blanca marca el mínimo global que persigue cada trayectoria.

🎮 Cómo usarlo

Elige un optimizador (o "Los cuatro" para comparar) y una función de pérdida en los menús desplegables. El deslizador de tasa de aprendizaje (0.001–0.2), el de Momentum / β₁ (0–0.99) y el de ruido de gradiente (0–0.5) remodelan la dinámica en vivo. Usa Reiniciar para empezar de nuevo, Pausa para congelar la imagen, y arrastra para rotar o desplázate para acercar la cámara. El panel de telemetría muestra el número de pasos, la pérdida, la norma del gradiente y el desplazamiento por paso.

💡 ¿Sabías que...?

La función "plátano" de Rosenbrock tiene un mínimo global en (1, 1) que se encuentra dentro de un valle largo, curvado y casi plano. Seguir el gradiente te lleva al valle casi al instante, pero avanzar poco a poco por su fondo hasta el mínimo real es notoriamente lento, y por eso se convirtió en una prueba de esfuerzo estándar para los algoritmos de optimización.

Preguntas frecuentes

¿Qué es el descenso de gradiente?

El descenso de gradiente es un método iterativo para minimizar una función dando pasos repetidos en la dirección de máximo decrecimiento, el gradiente negativo. Cada actualización es parámetro ← parámetro − tasa_de_aprendizaje × gradiente. En el aprendizaje automático es el motor que ajusta los pesos del modelo para reducir una pérdida, y esta página hace visible ese proceso sobre una superficie de entrada 2D dibujada en 3D.

¿En qué se diferencian SGD, Momentum, RMSprop y Adam?

SGD da un paso de tamaño fijo a lo largo del gradiente puro. Momentum acumula una velocidad, por lo que gana rapidez en direcciones consistentes y amortigua la oscilación. RMSprop divide cada paso por un promedio móvil de los gradientes al cuadrado, dando a cada eje su propia escala adaptativa. Adam combina el momentum con el escalado tipo RMSprop y corrección de sesgo, por lo que suele converger más rápido aquí.

¿Qué hacen los deslizadores de tasa de aprendizaje y ruido?

La tasa de aprendizaje determina cuánto avanza cada paso; si es demasiado pequeña la convergencia es muy lenta, y si es demasiado grande el marcador se pasa de largo o diverge. El ruido de gradiente añade una perturbación aleatoria proporcional a la magnitud del gradiente, imitando los gradientes estocásticos del entrenamiento por mini-lotes y mostrando cómo cada optimizador se adapta a estimaciones de dirección imperfectas.

¿Es la simulación matemáticamente precisa?

Sí, en cuanto a la mecánica principal. Los gradientes de las cuatro funciones de pérdida están codificados analíticamente, y las cuatro reglas de actualización implementan las ecuaciones estándar, incluidos los momentos con corrección de sesgo de Adam con β₂ fijado en 0.999. Es un modelo didáctico fiel de dos parámetros, no una red profunda completa, por lo que omite mini-lotes, decaimiento de peso y programaciones de tasa de aprendizaje.

¿Por qué los optimizadores a veces se atascan o se comportan de forma extraña?

En la superficie de silla el gradiente casi desaparece a lo largo de una dirección, por lo que el SGD puro puede estancarse mientras los métodos adaptativos escapan más rápido. En Himmelblau hay cuatro mínimos separados, por lo que el punto de partida decide en qué cuenca cae cada trayectoria. Estos comportamientos ilustran que el descenso de gradiente encuentra un mínimo local cerca de donde comienza, no necesariamente el global.

⚙ Bajo el capó

Observa cómo SGD, Momentum, RMSprop y Adam recorren un paisaje de pérdida en 3D en tiempo real. Compara la velocidad de convergencia y la forma de la trayectoria. Ajusta la tasa de aprendizaje, el momentum y el ruido de gradiente.

Canvas 2DOptimizaciónAprendizaje automáticoSGDAdam

3D · Renderizador Three.js / WebGL · Objetivo de 60 FPS · se ejecuta enteramente en el cliente, sin instalación

¿Qué encontraste?

Añadir pasos de reproducción (opcional)