InicioSociedad y EconomíaTeoría de Juegos

🎮 Teoría de Juegos

Simulación interactiva de teoría de juegos evolutiva: los agentes juegan el Dilema del Prisionero en una cuadrícula. Observa cómo emerge la cooperación, cómo Tit-for-Tat invade a los que traicionan y qué estrategias sobreviven. Ajusta las recompensas, el ruido y la mezcla de estrategias.

Sociedad y Economía3DModerado60 FPS
game-theory ↗ Abrir independiente

Acerca de la Teoría de Juegos Evolutiva

Esta simulación ejecuta el Dilema del Prisionero espacial en una cuadrícula toroidal de agentes (40×40 por defecto). En cada ronda, cada celda juega el dilema contra los ocho vecinos de su vecindad de Moore y acumula una recompensa según la matriz T > R > P > S. Los agentes luego evolucionan por imitación: cada uno copia la estrategia del vecino (incluido él mismo) que haya obtenido la mayor puntuación en esa ronda, con una pequeña probabilidad de mutación aleatoria.

Los deslizadores fijan las cuatro recompensas — Tentación, Recompensa, Castigo y Bobo — mientras que otros ajustan el tamaño de la cuadrícula, la velocidad de la simulación y el ruido (tasa de mutación). Cinco estrategias compiten: Cooperar Siempre, Traicionar Siempre, Tit-for-Tat, Pavlov (Gana-Mantente Pierde-Cambia) y Random. La misma lógica explica la cooperación en tratados climáticos, carreras armamentistas, ecología de resistencia a antibióticos y guerras de precios corporativas, donde los incentivos individuales chocan con el beneficio colectivo.

Preguntas frecuentes

¿Qué muestra realmente esta simulación?

Muestra cómo la cooperación puede emerger, colapsar o ciclarse cuando muchos agentes juegan repetidamente el Dilema del Prisionero en una cuadrícula. Cada celda coloreada es un agente que ejecuta una de cinco estrategias, y a lo largo de rondas sucesivas las estrategias más exitosas se propagan por la población mediante imitación.

¿Cómo funciona la regla de evolución?

Después de cada ronda, cada agente observa su propia puntuación y las de sus ocho vecinos, y adopta la estrategia de quien haya obtenido más puntos en esa ronda. Esta regla de "imitar al mejor vecino" es una forma estándar de dinámica evolutiva espacial — sin genética ni reproducción, solo copia del comportamiento exitoso.

¿Qué controlan los deslizadores T, R, P y S?

Fijan las cuatro recompensas del dilema: Tentación (traicionar a un cooperador), Recompensa (cooperación mutua), Castigo (traición mutua) y Bobo (cooperar con un traidor). Un dilema genuino necesita T > R > P > S, e idealmente 2R > T + S, de modo que la cooperación mutua supere a la explotación alterna.

¿Cuáles son las cinco estrategias?

Cooperar Siempre (verde) y Traicionar Siempre (rojo) ignoran al oponente. Tit-for-Tat (azul) repite el último movimiento del vecino hacia él. Pavlov, o Gana-Mantente Pierde-Cambia (morado), mantiene su movimiento si la última recompensa fue buena y cambia si fue mala. Random (ámbar) coopera o traiciona con una moneda al 50/50 en cada interacción.

¿Por qué a Tit-for-Tat le suele ir tan bien?

En los torneos de 1980 de Robert Axelrod, Tit-for-Tat venció a 62 estrategias rivales porque es amable (nunca traiciona primero), vengativa (castiga la traición de inmediato), indulgente (vuelve a cooperar de inmediato) y clara. En una cuadrícula, los grupos de agentes TFT se protegen mutuamente de la explotación, permitiendo que la cooperación mantenga un punto de apoyo incluso entre traidores.

¿Cuál es la diferencia entre un equilibrio de Nash y un óptimo de Pareto aquí?

En un juego de una sola ronda, la traición mutua es el equilibrio de Nash: ningún jugador puede ganar cambiando solo. La cooperación mutua es el óptimo de Pareto: no se puede mejorar a un agente sin perjudicar al otro. La tragedia del dilema es que el interés propio racional lleva a los jugadores al peor resultado, el de Nash.

¿Qué hace el deslizador de ruido?

El ruido fija una tasa de mutación, de 0 a 20 por ciento. Después del paso de imitación, cada agente tiene esa probabilidad de adoptar en su lugar una estrategia elegida al azar. Un poco de ruido evita que el sistema se congele en un único estado absorbente y permite que se resiembren nuevas estrategias para que la dinámica siga siendo dinámica.

¿Es importante la estructura espacial?

Sí. Como los agentes solo interactúan con ocho vecinos inmediatos en lugar de con toda la población, los cooperadores pueden formar grupos protectores cuyos miembros interiores cooperan todos y puntúan bien. Esta estructura local es precisamente la razón por la que la cooperación sobrevive espacialmente cuando sería eliminada en una población bien mezclada.

¿Qué hacen los ajustes preestablecidos?

Todos Traidores siembra un mar de traidores con un pequeño núcleo TFT para probar la invasión; Invasión TFT usa un grupo cooperativo más grande; Mundo Pavlov llena la cuadrícula mayormente con agentes Pavlov; y Mixto parte de una mezcla ponderada de las cinco estrategias. Son formas rápidas de explorar qué configuraciones permiten que la cooperación se afiance.

¿Qué tan precisa es esto comparada con la teoría de juegos real?

La matriz de recompensas, las definiciones de estrategias y el análisis de Nash y Pareto son fieles a la teoría estándar, y la dinámica de imitar al mejor es un modelo reconocido usado por Nowak y May. Sin embargo, es una herramienta didáctica simplificada: las ecologías reales implican estrategias continuas, memoria de muchas rondas pasadas y reproducción en lugar de copia pura.

¿Dónde aparece el Dilema del Prisionero en el mundo real?

Modela cualquier situación en la que los incentivos privados socavan las ganancias compartidas: naciones que emiten carbono a pesar de un interés colectivo en la moderación, rivales atrapados en carreras armamentistas, bacterias que producen bienes públicos que los tramposos explotan, y empresas tentadas a bajar un precio mutuamente rentable. La simulación sugiere cómo la repetición y la estructura pueden rescatar la cooperación.

⚙ Detrás de escena

Dilema del Prisionero evolutivo en una cuadrícula espacial. Las estrategias ALL-D, ALL-C, TFT, Grim Trigger y Random compiten; la matriz de recompensas impulsa la selección en cada ronda.

Canvas 2DTeoría de JuegosEvoluciónDilema del Prisionero

3D · Three.js / WebGL renderer · 60 FPS target · runs fully client-side, no install

¿Qué encontraste?

Agregar pasos de reproducción (opcional)