🧠 Convolutional Neural Network
Visualiza cómo una red neuronal convolucional (CNN) procesa imágenes capa por capa. Observa cómo los filtros de convolución se deslizan sobre una imagen, las activaciones ReLU y el max-pooling en tiempo real.
Acerca del Visualizador de Convolutional Neural Network
Esta simulación recorre una pequeña imagen a través de una CNN capa por capa. Una entrada de 8×8 píxeles se convoluciona con un núcleo de 3×3: en cada posición el filtro se multiplica elemento a elemento con el parche subyacente y se suma para formar un mapa de características. Ese mapa pasa entonces por una activación ReLU, f(x)=max(0,x), un paso de max-pooling de 2×2, una segunda convolución y una activación final, reflejando cómo las CNN reales construyen características de forma jerárquica.
Los controles te permiten elegir un patrón de entrada (Dígito 7, marca X, círculo, borde o tablero de ajedrez), elegir el núcleo de la Capa 1 (borde horizontal, borde vertical, enfocar o desenfocar), ajustar la velocidad de escaneo y recorrer las pestañas de Ver Capa (Entrada, Conv1, ReLU, Pool, Conv2, Salida). Las CNN construidas exactamente sobre estas operaciones impulsan la clasificación de imágenes, la detección de rostros, el análisis de escáneres médicos y los sistemas de visión de los coches autónomos.
Preguntas Frecuentes
¿Qué es una red neuronal convolucional?
Una red neuronal convolucional, o CNN, es un modelo de aprendizaje profundo diseñado para datos en forma de rejilla como las imágenes. En lugar de conectar cada píxel con cada neurona, desliza pequeños filtros aprendibles sobre la entrada para detectar patrones locales como bordes y texturas, y luego los apila en características más profundas y abstractas.
¿Cómo funciona el paso de convolución en esta simulación?
Se posiciona un núcleo de 3×3 sobre cada píxel de la entrada de 8×8. Los nueve pesos del núcleo se multiplican por los nueve píxeles debajo de ellos y los productos se suman en un único valor de salida. Repetir esto en toda la imagen produce un mapa de características de sumas ponderadas sin procesar, que puede ser negativo donde un núcleo de bordes ve una transición invertida. ReLU actúa sobre esos valores sin procesar; solo la escala de grises mostrada en pantalla se reescala de 0 a 1 para su visualización.
¿Qué hacen realmente los cuatro botones de filtro?
Cada botón carga un núcleo de 3×3 distinto. Edge H detecta transiciones horizontales de brillo, Edge V detecta las verticales, Sharpen realza el detalle fino restando el promedio local del píxel central, y Blur es un filtro de caja que promedia los píxeles vecinos para suavizar la imagen.
¿Por qué es necesaria la activación ReLU?
ReLU aplica f(x)=max(0,x), fijando en cero todo valor negativo. Esto introduce no linealidad, lo que permite a la red representar fronteras de decisión complejas y curvas en lugar de solo combinaciones lineales de píxeles. Sin una activación no lineal, apilar muchas capas colapsaría en una única transformación lineal.
¿Qué logra el max-pooling?
La capa de max-pooling de 2×2 toma el valor más grande en cada ventana de 2×2 sin solapamiento, reduciendo a la mitad el ancho y el alto. Esto conserva las activaciones más fuertes, reduce el cómputo y da a la red cierto grado de invariancia a la traslación, de modo que una característica se reconoce incluso si se desplaza uno o dos píxeles.
¿Los filtros de esta demostración son aprendidos o fijos?
Son núcleos fijos, elegidos a mano, usados para hacer visibles las matemáticas. En una CNN entrenada, los pesos del núcleo se aprenden automáticamente mediante retropropagación y descenso de gradiente, de modo que la red descubre los filtros que mejor minimizan su pérdida en los datos de entrenamiento en lugar de depender de núcleos clásicos de bordes o desenfoque.
¿Por qué el mapa de características se hace más pequeño tras el pooling?
El pooling combina cuatro valores vecinos en uno, de modo que un mapa de 8×8 se convierte en uno de 4×4. Reducir las dimensiones espaciales mientras aumenta el número de canales de características es el patrón central de las CNN: las capas más profundas ven una rejilla más pequeña y más gruesa, pero representan conceptos más ricos y de mayor nivel, como esquinas y curvas.
¿Qué significan estadísticas como Scan X y Scan Y?
Scan X y Scan Y muestran la columna y fila actuales del núcleo mientras recorre la entrada durante la animación de Conv1. Kernel Weights es 9, los nueve números del único núcleo de 3×3 que usa esta demostración (se reutiliza en Conv1 y Conv2, sin sesgos y sin entrenamiento), y Feature Maps es 1, porque un núcleo produce exactamente un mapa por capa. Una CNN de producción usaría un banco de muchos núcleos por capa y por tanto produciría muchos mapas.
¿Es esta una representación precisa de una CNN real?
Las operaciones son fieles: convolución genuina, ReLU, max-pooling y una segunda convolución en el orden correcto. Está simplificada para mayor claridad, usando una única imagen pequeña, núcleos fijados a mano, valores de visualización normalizados y sin entrenamiento real, por lo que enseña la mecánica en lugar de reproducir la escala de una red de producción.
¿Dónde se usan las CNN en el mundo real?
Las CNN sustentan la mayor parte de la visión por computadora moderna. Clasifican objetos en fotos, leen dígitos escritos a mano, detectan tumores en escáneres médicos, reconocen rostros, potencian los filtros de realidad aumentada y alimentan los sistemas de percepción de los vehículos autónomos. Los mismos bloques de convolución, activación y pooling mostrados aquí escalan hasta estas aplicaciones.
Un filtro escanea una imagen de 8×8 capa por capa — observa cómo la convolución, la activación ReLU y el max-pooling construyen mapas de características en tiempo real.
3D · Renderizador Three.js / WebGL · objetivo 60 FPS · funciona totalmente en el cliente, sin instalación