RL

Симуляція Навчання з Підкріпленням

Навчання з Підкріпленням

Інтерактивна симуляція Q-learning алгоритму, яка показує як агенти навчаються через взаємодію з середовищем

Інтерактивна Симуляція

Керування

0.1
0.9
0.1

Статистика

Епізод: 0
Кроки: 0
Загальна нагорода: 0
Середня нагорода: 0.00

Як працює навчання з підкріпленням?

🎯 Основні компоненти

Навчання з підкріпленням складається з агента, який взаємодіє з середовищем, отримуючи нагороди за свої дії та навчаючись оптимальній стратегії.

Агент → Дія → Середовище → Нагорода
Q(s,a) = Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)]

🧠 Q-Learning алгоритм

Q-Learning - це алгоритм без моделі, який навчається оптимальну Q-функцію через взаємодію з середовищем та оновлення Q-значень.

Q(s,a) ← Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)]
π(s) = argmax Q(s,a)

⚖️ Exploration vs Exploitation

1. Exploration (ε-greedy)

Агент випадково вибирає дії з ймовірністю ε для дослідження нових стратегій та знаходження кращих рішень.

2. Exploitation

Агент вибирає найкращу відому дію з ймовірністю 1-ε, використовуючи накопичені знання для максимізації нагороди.

3. Баланс

Правильний баланс між дослідженням та використанням критично важливий для ефективного навчання.

🎮 Типи навчання з підкріпленням

Value-based методи

Навчають value-функції (Q-функцію) для оцінки якості дій у станах

Policy-based методи

Безпосередньо оптимізують політику агента без оцінки value-функції

Actor-Critic методи

Поєднують value-based та policy-based підходи для кращої продуктивності

Часті запитання