InicioSociedad y EconomíaEl Torneo de Axelrod

🤝 El Torneo de Axelrod

Ejecuta el clásico torneo de todos contra todos de Robert Axelrod para el dilema del prisionero iterado. Observa competir a Toma y Daca, Pavlov, Grim Trigger y más.

Sociedad y Economía3DModerado60 FPS
axelrod-tournament ↗ Abrir independiente

Acerca del Torneo IPD de Axelrod

En 1980, el politólogo Robert Axelrod invitó a teóricos de juegos de todo el mundo a enviar programas informáticos para jugar el Dilema del Prisionero Iterado (IPD), un juego repetido en el que dos jugadores eligen simultáneamente cooperar (C) o delatar (D) en cada ronda, con pagos T > R > P > S (tentación, recompensa, castigo, incauto). El sorprendente ganador de ambos torneos fue la propuesta más sencilla: Toma y Daca, que coopera en el primer movimiento y luego copia la acción anterior del oponente. El análisis de Axelrod, publicado en "La evolución de la cooperación" (1984), se convirtió en un hito de la biología evolutiva, la economía y la ciencia política, explicando por qué la cooperación puede surgir entre agentes egoístas sin autoridad central.

Esta simulación ejecuta un torneo completo de todos contra todos con 10 estrategias, incluyendo Toma y Daca, TFT Generoso, Pavlov (Gana-Persiste, Pierde-Cambia), Grudger, Aleatorio y Siempre Delatar. Puedes ajustar el número de rondas por partida, personalizar la matriz de pagos TRPS, añadir ruido (ε % de probabilidad de delación accidental) y observar en vivo cómo evolucionan la matriz de puntuaciones y las tasas de cooperación. El ruido revela qué estrategias son robustas ante los errores: el TFT puro cae en una espiral de castigo mutuo, mientras que el TFT Generoso y Pavlov pueden escapar.

Preguntas frecuentes

¿Qué es el Dilema del Prisionero?

Dos sospechosos son interrogados por separado. Cada uno puede traicionar al otro (Delatar) o permanecer callado (Cooperar). Si ambos callan, ambos reciben una condena leve (recompensa R). Si uno delata y el otro calla, el delator queda libre (tentación T) mientras el otro recibe la condena máxima (pago de incauto S). Si ambos delatan, ambos reciben una condena moderada (castigo P). El orden de pagos T > R > P > S hace que delatar sea la estrategia dominante en un solo juego — aunque la cooperación mutua da un mejor resultado para ambos que la delación mutua.

¿Por qué ganó Toma y Daca los torneos de Axelrod?

Axelrod identificó cuatro propiedades que hicieron exitosa a TFT: es "amable" (nunca delata primero), "vengativa" (castiga de inmediato la delación), "perdonadora" (vuelve a cooperar tras una ronda de represalia) y "clara" (su estrategia es obvia para el oponente, permitiendo la coordinación). Estas propiedades permiten a TFT rendir muy bien contra socios cooperativos (ganando R por ronda) mientras limita el daño frente a delatores (perdiendo S solo una vez por encuentro). Ninguna estrategia individual vence a TFT en todos los entornos, pero TFT acumula la mayor puntuación total frente a oponentes diversos.

¿Qué le hace el ruido (ε) al torneo?

El ruido modela la delación accidental: con probabilidad ε, cada cooperación pretendida se convierte en una delación. Para el Toma y Daca puro, un solo evento de ruido desencadena una delación vengativa, que a su vez desencadena otra, encerrando a ambos jugadores en un castigo mutuo hasta el final de la partida — un fenómeno llamado "delación en eco". El TFT Generoso (que coopera con probabilidad 1 – ε al vengarse) y Pavlov (Gana-Persiste, Pierde-Cambia) pueden escapar de esta trampa perdonando ocasionalmente, haciéndolos mucho más robustos en entornos ruidosos.

¿Qué es la estrategia Pavlov (Gana-Persiste, Pierde-Cambia)?

Pavlov coopera si ambos jugadores hicieron el mismo movimiento en la ronda anterior (ambos C o ambos D — una "victoria") y delata si hicieron movimientos diferentes (uno C uno D — una "derrota"). Esta simple regla de refuerzo se autocorrige: tras una doble delación inducida por ruido (castigo P), Pavlov delata mientras TFT coopera — volviendo a la cooperación mutua tras una ronda. Pavlov también puede explotar a Siempre-Coopera cambiando a delación permanente, dándole una ventaja que TFT no tiene. En torneos IPD ruidosos, Pavlov a menudo supera a TFT.

¿Qué es el TFT Generoso?

El TFT Generoso (GTFT) es como Toma y Daca, pero en lugar de vengarse siempre tras la delación del oponente, coopera con una pequeña probabilidad p (típicamente p = 1/3 o ajustada a la tasa de ruido). Este perdón rompe los ciclos de delación en eco: tras una cadena de castigo mutuo, GTFT coopera ocasionalmente, dando al oponente la oportunidad de volver a la cooperación mutua. Nowak y May (1992) demostraron que GTFT es una estrategia evolutivamente estable en poblaciones estructuradas espacialmente, desplazando tanto a TFT como a Siempre-Delatar.

¿Qué es la estrategia Grudger (Grim Trigger)?

Grudger coopera en cada movimiento hasta que el oponente delata aunque sea una vez, y después delata para siempre — guardando un rencor permanente. Contra oponentes cooperativos, Grudger acumula la recompensa máxima. Contra cualquier delator, tras la pérdida inicial de incauto cambia al castigo mutuo, evitando más explotación. Aunque Grudger no es "perdonadora" y rinde mal contra oponentes ruidosos o que la ponen a prueba, es un concepto de equilibrio: una vez que ambos jugadores activan el rencor, ninguno se beneficia volviendo unilateralmente a la cooperación.

¿Qué es Siempre Delatar y por qué pierde en general?

Siempre Delatar (AllD) gana la tentación T frente a cooperadores, lo que parece rentable. Pero en un torneo de todos contra todos solo gana el castigo P (el peor resultado mutuo) contra cualquier otra estrategia delatora — y contra cualquier versión de TFT o Grudger solo gana T en el primer movimiento, y luego cobra P durante las N – 1 rondas restantes. Contra muchos oponentes cooperativos, la puntuación agregada de AllD se hunde porque R >> (T + (N-1)P)/N para N grande. AllD solo "gana" en entornos compuestos principalmente por cooperadores ingenuos.

¿Cómo afecta a los resultados cambiar la matriz de pagos?

La matriz de pagos debe cumplir T > R > P > S y 2R > T + S para que el dilema iterado tenga sentido. Aumentar T (tentación) eleva la recompensa por delatar frente a cooperadores, haciendo el entorno más duro para las estrategias amables. Reducir la diferencia entre R y P disminuye el incentivo para cooperar. Cuando T – R se vuelve muy grande, incluso TFT empieza a delatar oportunistamente en algunas variantes. Ajustar los controles deslizantes permite explorar cómo la intensidad del dilema afecta qué estrategias dominan.

¿Puede la cooperación evolucionar sin interacción repetida?

El artículo de Robert Axelrod y William Hamilton de 1981 mostró que la cooperación puede invadir una población de delatores si el factor de descuento w (probabilidad de otra ronda) satisface w ≥ (T – R)/(T – P). Por encima de este umbral, la sombra futura de la interacción repetida hace que delatar deje de ser rentable. La selección de parentesco (regla de Hamilton: rb > c) y la selección de grupo ofrecen vías evolutivas adicionales. En la práctica, la estructura espacial — donde los cooperadores pueden formar grupos y evitar explotadores — suele ser el mecanismo clave, como muestran los modelos de red espacial IPD de Nowak y May.

¿Qué es un torneo de todos contra todos y cómo se calculan las puntuaciones?

En un torneo de todos contra todos, cada participante juega contra todos los demás participantes (y, en el diseño de Axelrod, también contra sí mismo) durante N rondas. La puntuación total es la suma de los pagos acumulados en todas las partidas. Por eso las puntuaciones están influenciadas no solo por cómo le va a una estrategia contra los delatores, sino también por cómo le va contra la mayoría de las estrategias cooperativas del grupo. Por esto la composición del campo importa: AllD rinde mejor en un campo con mucha delación, mientras que TFT prospera en uno con mucha cooperación.

¿Qué situaciones del mundo real siguen la estructura del Dilema del Prisionero?

El IPD modela muchos fenómenos sociales y biológicos: carreras armamentistas entre naciones (cooperar = limitar armamento, delatar = escalar); competencia de precios corporativa (cooperar = mantener el precio, delatar = rebajarlo); evasión inmunitaria de patógenos (cooperar = suprimir la toxina, delatar = estallar); peces limpiadores y sus huéspedes; incluso reglas de plasticidad sináptica en redes neuronales. Las ideas de Axelrod se han usado para diseñar acuerdos comerciales internacionales, sugerir mecanismos de cooperación climática y explicar la evolución del altruismo en los insectos sociales.

⚙ Bajo el capó

El torneo de todos contra todos de Robert Axelrod de 1980: 10 estrategias IPD — All-D, All-C, TFT, TF2T, TFT Generoso, Grim, Pavlov, Aleatorio, Joss, Friedman — juegan entre sí durante cientos de rondas. Toma y Daca gana famosamente.

Canvas 2DTeoría de JuegosDP IteradoToma y DacaTorneo

3D · Renderizador Three.js / WebGL · Objetivo de 60 FPS · funciona totalmente en el navegador, sin instalación

¿Qué encontraste?

Añadir pasos para reproducirlo (opcional)