ГоловнаАвтономні системиОптимізація світлофора: адаптивне керування — Q-навчання

🚦 Оптимізація світлофора: адаптивне керування — Q-навчання

Спостерігайте, як справжній агент Q-навчання тренується наживо, щоб керувати перехрестям із чотирма напрямками, навчаючись із довжин черг, аби перевершити фіксований графік світлофора й скоротити середній час очікування.

Автономні системи2DСкладний60 FPS
traffic-signal-optimization ↗ Відкрити окремо

Про оптимізацію світлофора

Ця симуляція відтворює перехрестя з чотирма напрямками у справжньому 3D і дозволяє порівняти дві справді різні стратегії керування. Керування з фіксованим часом циклічно перемикає фази північ-південь і схід-захід за наперед встановленим графіком, точно як найпростіші контролери світлофорів, розгорнуті з 1920-х років. Адаптивне керування — це справжній табличний агент Q-навчання: він дискретизує довжину черги на кожному підході в стан, обирає фазу як свою дію, і оновлює Q-таблицю наживо з нагороди, яку спостерігає — негативної загальної довжини черги — використовуючи стандартне оновлення Беллмана.

Розгорнуті адаптивні системи, як-от SCOOT (Велика Британія) та SCATS (Австралія), використовують подібні контури зворотного зв'язку на основі черг та завантаженості для перевстановлення часу сигналів у реальних містах, зазвичай скорочуючи середню затримку на 10-25% порівняно з фіксованими графіками, особливо за асиметричного чи мінливого попиту.

Часті запитання

Який стан, дію та нагороду використовує агент Q-навчання?

Стан — це довжина черги на кожному з чотирьох підходів, дискретизована в кошики (0, 1-2, 3-5, 6+ автомобілів) і об'єднана в єдиний індекс стану. Дія — яку з двох фаз запустити наступною — зелений північ-південь чи зелений схід-захід. Нагорода для вікна рішення — негатив загальної довжини черги, накопиченої по всіх підходах.

Як користуватися цією симуляцією?

Оберіть фіксований час чи адаптивне Q-навчання кнопками режиму. Налаштуйте чотири повзунки швидкості прибуття для кожного підходу, або клацніть асиметричну пресет-конфігурацію, щоб надіслати набагато більше трафіку північ-південь, ніж схід-захід. У режимі фіксованого часу налаштуйте пресетну тривалість зеленого. У адаптивному режимі налаштуйте швидкість навчання α та швидкість дослідження ε.

Чому керування з фіксованим часом доведено субоптимальне за асиметричного трафіку?

Контролер із фіксованим часом розподіляє зелений час за наперед встановленим графіком без жодної інформації про те, який підхід має автомобілі в очікуванні. За асиметричного чи мінливого попиту це гарантує, що зелений час іноді надається порожньому підходу, тоді як автомобілі стоять у черзі на завантаженому.

Яке правило оновлення Q-навчання показано в цій симуляції?

Q(s,a) ← Q(s,a) + α[r + γ·max_a′ Q(s′,a′) − Q(s,a)]. Після виконання дії a в стані s та спостереження нагороди r і наступного стану s′, агент рухає свою оцінку значення дії Q(s,a) до спостереженої нагороди плюс дисконтоване значення найкращої доступної дії в наступному стані.

Що означає epsilon-жадібне дослідження тут?

З ймовірністю ε агент обирає рівномірно випадкову фазу (дослідження), а з ймовірністю 1−ε обирає фазу з найвищим поточним Q-значенням для поточного стану (експлуатація). Чисте exploitation з початку могло б застрягти на посередній політиці, знайденій рано.

Чи справді агент Q-навчання сходиться до хорошої політики?

Так, за реальних застережень: Q-навчання доведено сходиться до оптимальної функції цінності дії за умови достатнього дослідження кожної пари стан-дія та відповідно запланованої швидкості навчання. У цій симуляції середній час очікування за епізод тенденційно знижується з видимим шумом.

Що таке SCOOT і SCATS?

SCOOT (розроблено у Великій Британії) та SCATS (розроблено в Австралії) — справжні, широко розгорнуті адаптивні системи світлофорів, використовувані в сотнях міст світу. Обидві використовують вимірювання трафіку в реальному часі для безперервного налаштування розподілів сигналів, довжин циклів та зсувів.

Навіщо використовувати дискретизовані кошики довжини черги замість точних підрахунків?

Табличне Q-навчання потребує скінченного простору станів. Групування довжини черги кожного підходу в кілька рівнів утримує таблицю достатньо малою, щоб швидко навчатися, водночас захоплюючи важливу для рішення про вибір фази інформацію.

Як нагорода пов'язана зі справжнім середнім часом очікування?

Нагорода — це негатив загальних секунд черги, накопичених протягом вікна рішення, — прямий проксі затримки. Максимізація кумулятивної нагороди математично еквівалентна мінімізації загальних секунд затримки транспортного засобу.