🔬 Структура нейронних мереж
Перцептрон
Найпростіша мережа: один шар з вагами. Обчислює зважене суму входів + bias, застосовує активаційну функцію. Може навчатися лінійні функції. Обмеження: тільки лінійно роздільні задачі.
Багатошарові мережі (MLP)
Вхідний шар → приховані шари → вихідний шар. Кожен нейрон з'єднаний з усіма нейронами наступного шару (fully connected). Більше шарів → складніші функції. Можуть наближати будь-яку неперервну функцію.
Ваги та bias
Ваги визначають силу зв'язків, bias зміщує активаційну функцію. Параметри навчаються з даних. Велика кількість параметрів у глибоких мережах (мільйони-мільярди).
🎯 Навчання
Forward Propagation
Обчислення виходу: дані проходять через шари, кожен нейрон обчислює зважене суму, застосовує активацію. Результат: передбачення моделі.
Backpropagation
Обчислення градієнтів: помилка поширюється назад через шари, обчислюються градієнти для кожної ваги. Chain rule для обчислення. Критично для навчання.
Gradient Descent
Оновлення ваг у напрямку негативного градієнта для мінімізації втрат. Learning rate визначає розмір кроку. Варианти: SGD, Adam, AdamW. Ітеративний процес до збіжності.
💻 Активаційні функції
ReLU
f(x) = max(0, x). Найпоширеніша, вирішує vanishing gradient, швидке обчислення. Недолік: "dying ReLU" (нульовий градієнт для негативних). Варианти: Leaky ReLU, ELU.
Sigmoid
f(x) = 1/(1+e^(-x)). Вихід 0-1, добра для ймовірностей. Використовується у вихідному шарі для бінарної класифікації. Недолік: vanishing gradient у глибоких мережах.
Tanh
f(x) = tanh(x). Вихід -1 до 1, симетрична. Краща за sigmoid для прихованих шарів у деяких випадках. Також має vanishing gradient.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Hash Function Avalanche Visualizer