Навчання з Підкріпленням
Інтерактивна симуляція Q-learning алгоритму, яка показує як агенти навчаються через взаємодію з середовищем
Інтерактивна Симуляція
Керування
Статистика
Як працює навчання з підкріпленням?
🎯 Основні компоненти
Навчання з підкріпленням складається з агента, який взаємодіє з середовищем, отримуючи нагороди за свої дії та навчаючись оптимальній стратегії.
Агент → Дія → Середовище → Нагорода
Q(s,a) = Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)]
🧠 Q-Learning алгоритм
Q-Learning - це алгоритм без моделі, який навчається оптимальну Q-функцію через взаємодію з середовищем та оновлення Q-значень.
Q(s,a) ← Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)]
π(s) = argmax Q(s,a)
⚖️ Exploration vs Exploitation
1. Exploration (ε-greedy)
Агент випадково вибирає дії з ймовірністю ε для дослідження нових стратегій та знаходження кращих рішень.
2. Exploitation
Агент вибирає найкращу відому дію з ймовірністю 1-ε, використовуючи накопичені знання для максимізації нагороди.
3. Баланс
Правильний баланс між дослідженням та використанням критично важливий для ефективного навчання.
🎮 Типи навчання з підкріпленням
Value-based методи
Навчають value-функції (Q-функцію) для оцінки якості дій у станах
Policy-based методи
Безпосередньо оптимізують політику агента без оцінки value-функції
Actor-Critic методи
Поєднують value-based та policy-based підходи для кращої продуктивності