ГоловнаСтаттіComputer Science

Навчання з підкріпленням

Навчання через взаємодію з середовищем

mysimulator teamОновлено — липень 2026≈ 3 хв читання▶ Відкрити симуляцію

🔬 Основні концепції

Markov Decision Process (MDP)

Формальна модель RL: стани S, дії A, переходи P(s'|s,a), винагороди R(s,a,s'), discount factor γ. Markov property: майбутнє залежить тільки від поточного стану. Фундамент RL теорії.

Policy

Стратегія вибору дій: π(a|s) — ймовірність дії a у стані s. Може бути детерміністичною або стохастичною. Оптимальна policy максимізує очікувану винагороду. Навчання = пошук оптимальної policy.

Value Functions

V^π(s) — очікувана винагорода з стану s при policy π. Q^π(s,a) — очікувана винагорода від дії a у стані s. Використовуються для оцінки policy, пошуку оптимальної. Bellman рівняння для обчислення.

Reward Signal

Фітбек від середовища про якість дій. Може бути негативним (покарання) або позитивним. Критично для навчання: агент максимізує суму винаград. Дизайн винагороди — важливий інжиніринг.

🎯 Алгоритми

Q-Learning

Value-based: навчає Q-function (очікувана винагорода), потім вибирає дію з максимальним Q. Off-policy (не потребує слідувати policy). Q(s,a) ← Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)]. Табличний або з функцій наближення.

Policy Gradient

Policy-based: безпосередньо оптимізує policy через градієнт очікуваної винагороди. REINFORCE, Actor-Critic. Переваги: безперервні дії, стохастичні policy. Недолік: висока дисперсія, повільне навчання.

Actor-Critic

Комбінований: Actor (policy) та Critic (value function) навчаються разом. Critic зменшує дисперсію policy gradient. Більш стабільне навчання. A3C, PPO, SAC популярні варіанти.

Deep RL

RL з нейронними мережами для наближення value functions або policy. DQN (Deep Q-Network), DDPG, PPO. Дозволяє RL для складних середовищ (зображення, високовимірні стани). AlphaGo, AlphaZero.

жива демонстрація · пов'язана симуляція● LIVE

💻 Exploration vs Exploitation

Epsilon-Greedy

З ймовірністю ε вибирає випадкову дію (exploration), інакше найкращу (exploitation). Простий, але неефективний. ε зменшується з часом (більше exploitation).

UCB (Upper Confidence Bound)

Балансує exploration/exploitation через confidence bounds. Досліджує невивчені області більше. Математично обґрунтований, краща збіжність за ε-greedy.

Thompson Sampling

Bayesian підхід: sampling з posterior distribution. Ефективніший exploration, адаптивний. Популярний для багатоarm bandits, RL.

🏭 Застосування

Ігри

AlphaGo, AlphaZero (шахи, го), Dota 2, StarCraft II. RL досягає надлюдської продуктивності через багато ігор, навчання стратегій. Можливість для складних стратегій.

Робототехніка

Навчання локомоції, маніпуляції, навігації. Симуляції для безпеки, потім transfer на реальних роботів. Виклики: sample efficiency, безпека, reality gap.

Автономні системи

Автономні автомобілі, дрони, навігація. RL для decision making, планування маршрутів. Безпека критична, виклики з надійністю.

Рекомендаційні системи

Персоналізація, оптимізація engagement. RL для динамічного вибору рекомендацій. Multi-armed bandits як спрощений RL.

Спробуйте наживо

Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.

▶ Відкрити симуляцію Hash Function Avalanche Visualizer

Що ви знайшли?

Додати кроки відтворення (опційно)