🔬 Основні концепції
Markov Decision Process (MDP)
Формальна модель RL: стани S, дії A, переходи P(s'|s,a), винагороди R(s,a,s'), discount factor γ. Markov property: майбутнє залежить тільки від поточного стану. Фундамент RL теорії.
Policy
Стратегія вибору дій: π(a|s) — ймовірність дії a у стані s. Може бути детерміністичною або стохастичною. Оптимальна policy максимізує очікувану винагороду. Навчання = пошук оптимальної policy.
Value Functions
V^π(s) — очікувана винагорода з стану s при policy π. Q^π(s,a) — очікувана винагорода від дії a у стані s. Використовуються для оцінки policy, пошуку оптимальної. Bellman рівняння для обчислення.
Reward Signal
Фітбек від середовища про якість дій. Може бути негативним (покарання) або позитивним. Критично для навчання: агент максимізує суму винаград. Дизайн винагороди — важливий інжиніринг.
🎯 Алгоритми
Q-Learning
Value-based: навчає Q-function (очікувана винагорода), потім вибирає дію з максимальним Q. Off-policy (не потребує слідувати policy). Q(s,a) ← Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)]. Табличний або з функцій наближення.
Policy Gradient
Policy-based: безпосередньо оптимізує policy через градієнт очікуваної винагороди. REINFORCE, Actor-Critic. Переваги: безперервні дії, стохастичні policy. Недолік: висока дисперсія, повільне навчання.
Actor-Critic
Комбінований: Actor (policy) та Critic (value function) навчаються разом. Critic зменшує дисперсію policy gradient. Більш стабільне навчання. A3C, PPO, SAC популярні варіанти.
Deep RL
RL з нейронними мережами для наближення value functions або policy. DQN (Deep Q-Network), DDPG, PPO. Дозволяє RL для складних середовищ (зображення, високовимірні стани). AlphaGo, AlphaZero.
💻 Exploration vs Exploitation
Epsilon-Greedy
З ймовірністю ε вибирає випадкову дію (exploration), інакше найкращу (exploitation). Простий, але неефективний. ε зменшується з часом (більше exploitation).
UCB (Upper Confidence Bound)
Балансує exploration/exploitation через confidence bounds. Досліджує невивчені області більше. Математично обґрунтований, краща збіжність за ε-greedy.
Thompson Sampling
Bayesian підхід: sampling з posterior distribution. Ефективніший exploration, адаптивний. Популярний для багатоarm bandits, RL.
🏭 Застосування
Ігри
AlphaGo, AlphaZero (шахи, го), Dota 2, StarCraft II. RL досягає надлюдської продуктивності через багато ігор, навчання стратегій. Можливість для складних стратегій.
Робототехніка
Навчання локомоції, маніпуляції, навігації. Симуляції для безпеки, потім transfer на реальних роботів. Виклики: sample efficiency, безпека, reality gap.
Автономні системи
Автономні автомобілі, дрони, навігація. RL для decision making, планування маршрутів. Безпека критична, виклики з надійністю.
Рекомендаційні системи
Персоналізація, оптимізація engagement. RL для динамічного вибору рекомендацій. Multi-armed bandits як спрощений RL.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Hash Function Avalanche Visualizer