🤝 Tournoi d'Axelrod
Lancez le célèbre tournoi round-robin de Robert Axelrod pour le dilemme du prisonnier itéré. Regardez Donnant-Donnant, Pavlov, Rancunier et bien d'autres s'affronter.
À propos du Tournoi IPD d'Axelrod
En 1980, le politologue Robert Axelrod a invité des théoriciens des jeux du monde entier à soumettre des programmes informatiques pour jouer au Dilemme du prisonnier itéré (IPD) — un jeu répété dans lequel deux joueurs choisissent simultanément de coopérer (C) ou de trahir (D) à chaque tour, avec des gains T > R > P > S (tentation, récompense, punition, dupe). Le gagnant surprenant des deux tournois fut l'entrée la plus simple : Donnant-Donnant (Tit-for-Tat), qui coopère au premier coup puis copie l'action précédente de l'adversaire. L'analyse d'Axelrod, publiée dans « The Evolution of Cooperation » (1984), est devenue une référence en biologie évolutive, en économie et en science politique, expliquant pourquoi la coopération peut émerger entre agents égoïstes sans autorité centrale.
Cette simulation exécute un tournoi round-robin complet avec 10 stratégies, dont Donnant-Donnant, Donnant-Donnant Généreux, Pavlov (Gagne-Reste Perd-Change), Rancunier, Aléatoire et Toujours Trahir. Vous pouvez définir le nombre de tours par match, personnaliser la matrice de gains TRPS, ajouter du bruit (ε % de chance de trahison accidentelle), et observer la matrice des scores et les taux de coopération évoluer en direct. Le bruit révèle quelles stratégies résistent aux erreurs — Donnant-Donnant classique s'enfonce dans la punition mutuelle, tandis que Donnant-Donnant Généreux et Pavlov peuvent s'en échapper.
Questions fréquentes
Qu'est-ce que le dilemme du prisonnier ?
Deux suspects sont interrogés séparément. Chacun peut trahir l'autre (Trahir) ou garder le silence (Coopérer). Si les deux gardent le silence, ils reçoivent tous deux une peine légère (récompense R). Si l'un trahit et l'autre garde le silence, le traître va libre (tentation T) tandis que l'autre reçoit la peine maximale (gain du dupé S). Si les deux trahissent, ils reçoivent tous deux une peine modérée (punition P). L'ordre des gains T > R > P > S fait de la trahison la stratégie dominante dans une partie unique — pourtant la coopération mutuelle donne un meilleur résultat pour les deux que la trahison mutuelle.
Pourquoi Donnant-Donnant a-t-il gagné les tournois d'Axelrod ?
Axelrod a identifié quatre propriétés qui ont fait le succès de TFT : il est « gentil » (ne trahit jamais en premier), « représailles » (punit immédiatement la trahison), « indulgent » (revient à la coopération après un tour de représailles), et « clair » (sa stratégie est évidente pour l'adversaire, permettant la coordination). Ces propriétés permettent à TFT de très bien réussir contre des partenaires coopératifs (gagnant R par tour) tout en limitant les dégâts contre les traîtres (perdant S une seule fois par rencontre). Aucune stratégie unique ne bat TFT dans tous les environnements, mais TFT accumule le plus de points au total face à des adversaires variés.
Que fait le bruit (ε) au tournoi ?
Le bruit modélise la trahison accidentelle : avec une probabilité ε, chaque coopération voulue est transformée en trahison. Pour Donnant-Donnant classique, un seul événement de bruit déclenche une trahison de représailles, qui en déclenche une autre, enfermant les deux joueurs dans une punition mutuelle jusqu'à la fin du match — un phénomène appelé « trahison en écho ». Donnant-Donnant Généreux (qui coopère avec une probabilité de 1 – ε lors des représailles) et Pavlov (Gagne-Reste Perd-Change) peuvent échapper à ce piège en pardonnant occasionnellement, ce qui les rend bien plus robustes dans les environnements bruités.
Qu'est-ce que la stratégie Pavlov (Gagne-Reste Perd-Change) ?
Pavlov coopère si les deux joueurs ont fait le même geste au tour précédent (les deux C ou les deux D — une « victoire ») et trahit s'ils ont fait des gestes différents (un C un D — une « perte »). Cette règle de renforcement simple s'autocorrige : après une double trahison induite par le bruit (punition P), Pavlov trahit tandis que TFT coopère — revenant à la coopération mutuelle après un tour. Pavlov peut aussi exploiter Toujours-Coopérer en passant à une trahison permanente, lui donnant un avantage que TFT n'a pas. Dans les tournois IPD bruités, Pavlov surpasse souvent TFT.
Qu'est-ce que Donnant-Donnant Généreux ?
Donnant-Donnant Généreux (GTFT) ressemble à Donnant-Donnant mais au lieu de toujours riposter après une trahison de l'adversaire, il coopère avec une petite probabilité p (typiquement p = 1/3 ou ajustée au taux de bruit). Ce pardon rompt les cycles de trahison en écho : après une chaîne de punition mutuelle, GTFT coopère occasionnellement, donnant à l'adversaire une chance de revenir à la coopération mutuelle. Nowak et May (1992) ont montré que GTFT est une stratégie évolutivement stable dans les populations structurées spatialement, supplantant à la fois TFT et Toujours-Trahir.
Qu'est-ce que la stratégie Rancunier (Grim Trigger) ?
Rancunier coopère à chaque tour jusqu'à ce que l'adversaire trahisse ne serait-ce qu'une fois, puis trahit pour toujours ensuite — gardant une rancune permanente. Contre des adversaires coopératifs, Rancunier accumule la récompense maximale. Contre tout traître, après la perte initiale de dupe, il passe à la punition mutuelle, évitant toute exploitation supplémentaire. Bien que Rancunier ne soit pas « indulgent » et performe mal contre des adversaires bruités ou testeurs, c'est un concept d'équilibre : une fois que les deux joueurs déclenchent la rancune, aucun ne peut bénéficier de revenir unilatéralement à la coopération.
Qu'est-ce que Toujours Trahir et pourquoi perd-il globalement ?
Toujours Trahir (AllD) gagne la tentation T face aux coopérateurs, ce qui semble rentable. Mais dans un tournoi round-robin, il ne gagne que la punition P (le pire résultat mutuel) contre toute autre stratégie de trahison — et contre toute version de TFT ou Rancunier, il ne gagne T qu'au premier coup, puis récolte P pour les N – 1 tours restants. Face à de nombreux adversaires coopératifs, le score global d'AllD est écrasé car R >> (T + (N-1)P)/N pour un grand N. AllD ne « gagne » que dans des environnements composés principalement de coopérateurs naïfs.
Comment la modification de la matrice de gains affecte-t-elle les résultats ?
La matrice de gains doit satisfaire T > R > P > S et 2R > T + S pour que le dilemme itéré ait un sens. Augmenter T (tentation) accroît la récompense pour trahir les coopérateurs, rendant l'environnement plus dur pour les stratégies gentilles. Réduire l'écart entre R et P diminue l'incitation à coopérer. Quand T – R devient très grand, même TFT commence à trahir de manière opportuniste dans certaines variantes. Ajuster les curseurs permet d'explorer comment l'intensité du dilemme affecte quelles stratégies dominent.
La coopération peut-elle évoluer sans interaction répétée ?
L'article de 1981 de Robert Axelrod et William Hamilton a montré que la coopération peut envahir une population de traîtres si le facteur d'actualisation w (probabilité d'un autre tour) satisfait w ≥ (T – R)/(T – P). Au-dessus de ce seuil, l'ombre future de l'interaction répétée rend la trahison non rentable. La sélection de parentèle (règle de Hamilton : rb > c) et la sélection de groupe fournissent des voies évolutives supplémentaires. En pratique, la structure spatiale — où les coopérateurs peuvent former des grappes et éviter les exploiteurs — est souvent le mécanisme clé, comme le montrent les modèles de treillis IPD spatiaux de Nowak et May.
Qu'est-ce qu'un tournoi round-robin et comment les scores sont-ils calculés ?
Dans un tournoi round-robin, chaque participant affronte tous les autres participants (et, dans le dispositif d'Axelrod, également lui-même) pendant N tours. Le score total est la somme des gains accumulés sur tous les matchs. Les scores sont donc influencés non seulement par la performance d'une stratégie contre les traîtres mais aussi par sa performance contre la majorité des stratégies coopératives du groupe. C'est pourquoi la composition du champ compte : AllD performe mieux dans un champ à dominante de trahison, tandis que TFT prospère dans un champ à dominante de coopération.
Quelles situations réelles suivent la structure du dilemme du prisonnier ?
L'IPD modélise de nombreux phénomènes sociaux et biologiques : courses aux armements entre nations (coopérer = limiter les armes, trahir = escalader) ; concurrence des prix des entreprises (coopérer = maintenir le prix, trahir = casser le prix) ; évasion immunitaire des agents pathogènes (coopérer = supprimer la toxine, trahir = exploser) ; poissons nettoyeurs et leurs hôtes ; même les règles de plasticité synaptique dans les réseaux neuronaux. Les idées d'Axelrod ont été utilisées pour concevoir des accords commerciaux internationaux, suggérer des mécanismes pour la coopération climatique, et expliquer l'évolution de l'altruisme chez les insectes sociaux.
Le tournoi round-robin de Robert Axelrod de 1980 : 10 stratégies IPD — All-D, All-C, TFT, TF2T, Donnant-Donnant Généreux, Rancunier, Pavlov, Aléatoire, Joss, Friedman — s'affrontent pendant des centaines de tours. Donnant-Donnant gagne, comme le veut la légende.
3D · Moteur de rendu Three.js / WebGL · 60 FPS cible · fonctionne entièrement côté client, sans installation