Головна Соціум та Економіка Дилема в'язня — кооперація та еволюція довіри

🤝 Дилема в'язня — кооперація та еволюція довіри

Кожен гравець виграє від зради, але обидва програють, якщо зраджують обидва. Ітеруйте гру на популяції — і стратегії на кшталт «око за око» дають кооперації еволюціонувати.

Соціум та Економіка2DЛегкий60 FPS
prisoners-dilemma ↗ Відкрити окремо
DRAG · SCROLL · CLICK — керуйте прямо у вікні симуляції.

Про цю симуляцію

Кожен гравець виграє від зради, але обидва програють, якщо зраджують обидва. Ітеруйте гру на популяції — і стратегії на кшталт «око за око» дають кооперації еволюціонувати.

🔬 Що це показує

Просторову ітеровану дилему в'язня на сітці, де кожна клітинка грає повторювану гру зі своїми вісьмома сусідами і накопичує рахунок; потім кожна клітинка копіює стратегію найуспішнішого сусіда (включно з собою), а кластери кооператорів ростуть або зникають із покоління в покоління.

🎮 Як користуватися

Оберіть суміш стратегій (завжди співпрацювати, завжди зраджувати, «око за око», «злопам'ятний», випадкова) для популяції, налаштуйте повзунок мутації, який щопокоління випадково призначає невеликій частці клітинок нову стратегію, і спостерігайте, як кооперація або поширюється кластерами, або витісняється зрадниками.

💡 Чи знали ви?

Дилему сформулювали Мерілл Флад і Мелвін Дрешер у RAND в 1950 році, а пам'ятну історію про в'язнів додав Альберт Такер; комп'ютерні турніри Роберта Аксельрода у 1980-х показали, що проста стратегія «око за око» — яка починає зі співпраці, а потім копіює останній хід супротивника — перемагає значно складніші стратегії.

Часті запитання

Що таке дилема в'язня?

Це гра, в якій двоє гравців обирають співпрацювати або зрадити. Кожен окремо виграє від зради, але якщо зраджують обидва, вони програють більше, ніж якби обидва співпрацювали. Саме це напруження між особистим і спільним інтересом і становить дилему.

Чому взаємна зрада трапляється, якщо співпраця вигідніша?

У грі з одним ходом зрада є домінантною стратегією: що б не робив інший гравець, зрада дає вищий рахунок. Раціональний власний інтерес штовхає обох гравців до зради, що дає гірший результат для обох — рівновагу Неша, яка не є оптимальною за Парето.

Що означають виплати T, R, P і S?

T — спокуса зрадити кооператора, R — винагорода за взаємну співпрацю, P — покарання за взаємну зраду, а S — виплата «простака» за співпрацю проти зрадника. Дилема вимагає T > R > P > S, а для ітерованої гри — 2R > T + S.

Що таке стратегія «око за око»?

«Око за око» починає зі співпраці, а потім повторює те, що зробив супротивник на попередньому ході. Вона доброзичлива, здатна відповідати на зраду, здатна прощати і зрозуміла — саме ці якості принесли їй перемогу в турнірах Роберта Аксельрода з ітерованої дилеми в'язня у 1980 році.

Як працює просторова версія?

Кожна клітинка сітки грає повторювану гру зі своїми вісьмома сусідами і накопичує рахунок. Потім кожна клітинка копіює стратегію того сусіда (включно із собою), який набрав найбільше очок. Це правило наслідування дозволяє кластерам кооператорів рости або зменшуватися з покоління в покоління.

Що таке стратегія «злопам'ятного» (grudger)?

«Злопам'ятний» (також відомий як «grim trigger») співпрацює, доки супротивник хоча б раз не зрадить, а потім зраджує назавжди. Вона непрощаюча, але дуже стійка до експлуатації.

Чому кооператори виживають у просторовій грі, але не у «перемішаній» популяції?

У добре перемішаній популяції зрадники завжди перемагають, але на сітці кооператори утворюють кластери, де вони здебільшого зустрічаються з іншими кооператорами і отримують високу виплату за взаємну співпрацю. Край кластера може протистояти вторгненню, тож кооперація зберігається, попри те що глобально вона програє.

Що робить повзунок мутації?

Мутація випадково переприсвоює невеликій частці клітинок випадкову стратегію щопокоління. Невелика мутація підтримує різноманітність і може засіяти нові кластери кооператорів; надмірна мутація пригнічує відбір і перетворює популяцію на шум.

Хто винайшов дилему в'язня?

Гру сформулювали Мерілл Флад і Мелвін Дрешер у RAND в 1950 році, а пам'ятну історію про в'язнів їй дав Альберт Такер. Комп'ютерні турніри Роберта Аксельрода у 1980-х популяризували ітеровану версію та успіх стратегії «око за око».

Які реальні ситуації вона моделює?

Гонки озброєнь, цінові війни, ухилення від кліматичних угод, допінг у спорті, перелов риби та еволюція біологічної кооперації — усі вони мають структуру цієї дилеми: короткостроковий власний інтерес підриває взаємовигідніший результат, якщо тільки повторення, репутація чи спорідненість не винагороджують співпрацю.

Схожі симуляції