AccueilIA et apprentissage automatiqueExplorateur de courbe ROC de prédiction de résiliation

🎯 Explorateur de courbe ROC de prédiction de résiliation

Simulateur interactif de prédiction de résiliation client : faites glisser un seuil de décision et observez la courbe ROC, le compromis précision-rappel et le coût métier évoluer ensemble en temps réel.

IA et apprentissage automatique3DModéré60 IPS
predictive-analytics-growth ↗ Ouvrir en autonome

À propos de l'explorateur de courbe ROC de prédiction de résiliation

La plupart des modèles d'apprentissage automatique d'entreprise ne produisent pas une décision — ils produisent une probabilité. Un modèle de résiliation ne dit pas « ce client va partir », il dit « ce client a 73 % de chances de partir ». Transformer cette probabilité en action (envoyer une offre de fidélisation ou non) nécessite de choisir un seuil de décision, et ce seul choix détermine combien de véritables résiliants vous capturez, combien de fausses alertes vous générez, et finalement combien le modèle vaut en livres et en pence. Cette simulation génère une population synthétique de clients avec des résultats et des scores de modèle connus, puis vous permet d'explorer directement cette décision de seuil.

Faites glisser le curseur de qualité du modèle et observez deux distributions de scores qui se chevauchent — clients conservés regroupés près de zéro, clients résiliés regroupés plus haut — se séparer ou s'effondrer l'une dans l'autre. Lorsque vous déplacez le curseur de seuil, un marqueur se déplace simultanément sur l'histogramme des scores, la courbe ROC et la courbe précision-rappel, de sorte que le lien entre « où je coupe les scores » et « où j'atterris sur la courbe » est immédiat et visuel. Un calculateur de coût en direct vous permet de peser une offre de fidélisation gaspillée contre un client perdu et de voir exactement quel seuil minimise le coût total attendu — ce qui est rarement le même seuil qui semble « le meilleur » sur la seule courbe ROC.

Questions fréquentes

Que mesure réellement l'AUC ?

L'AUC (aire sous la courbe ROC) est la probabilité que le modèle classe un client résilié choisi au hasard plus haut qu'un client conservé choisi au hasard. AUC = 1,0 signifie un classement parfait — chaque client résilié obtient un score supérieur à chaque client non résilié. AUC = 0,5 signifie que le modèle ne fait pas mieux qu'un tirage à pile ou face. Fait essentiel, l'AUC est indépendante du seuil : elle résume la capacité de classement du modèle sur tous les seuils possibles à la fois, ce qui explique pourquoi elle ne vous indique pas quel seuil utiliser réellement en production.

Pourquoi la précision (accuracy) est-elle trompeuse quand seulement 20 % des clients résilient ?

Avec un taux de résiliation de base de 20 %, un modèle paresseux qui prédit « ne résilie jamais » pour chaque client est déjà précis à 80 % tout en ne capturant aucun véritable résiliant. L'accuracy pondère les deux classes de manière égale, mais dans une population déséquilibrée, la classe majoritaire domine le score. C'est pourquoi cette simulation rapporte le TPR (rappel), la précision et le coût plutôt que l'accuracy — ils révèlent la capacité du modèle à trouver la rare classe positive plutôt que de le récompenser pour répéter la majorité.

Quel est le compromis entre précision et rappel quand je déplace le seuil ?

Augmenter le seuil signifie que seuls les scores très élevés sont signalés comme résiliation, donc la précision (la proportion de clients signalés qui résilient réellement) a tendance à augmenter tandis que le rappel (la proportion de véritables résiliants réellement capturés) diminue. Baisser le seuil fait l'inverse — vous capturez plus de résiliants mais signalez plus de fausses alertes. La courbe précision-rappel trace tout ce compromis ; il n'existe aucun seuil qui maximise les deux simultanément à moins que les classes ne soient parfaitement séparables.

En quoi le seuil optimal en coût diffère-t-il du point le plus proche du coin supérieur gauche de la courbe ROC ?

Le coin supérieur gauche de la courbe ROC (TPR = 1, FPR = 0) est un idéal purement statistique qui traite un faux positif et un faux négatif comme également mauvais. Le seuil optimal en coût minimise plutôt le coût métier total attendu = FP × coût-par-faux-positif + FN × coût-par-faux-négatif. Si un résiliant manqué coûte bien plus cher qu'une offre de fidélisation gaspillée, le seuil optimal en coût se situe plus bas (capturer plus de résiliants) que le point statistiquement « équilibré », et inversement.

Pourquoi les seuils de résiliation réels sont-ils choisis selon le coût métier plutôt que la pure statistique ?

La probabilité produite par un modèle n'est qu'un produit intermédiaire — la décision métier est binaire : envoyer l'offre de fidélisation ou non. Deux entreprises avec un modèle identique et un AUC identique peuvent rationnellement choisir des seuils complètement différents si leurs structures de coûts diffèrent, par exemple une entreprise d'abonnement à faible marge par rapport à un contrat d'entreprise à haute valeur. C'est pourquoi le déploiement d'un modèle implique toujours une discussion avec le métier sur le coût relatif des faux positifs et des faux négatifs, pas seulement une métrique de data science.

Que change réellement le curseur « qualité du modèle » ?

Il contrôle à quel point les distributions de scores des clients conservés et résiliés sont éloignées. À faible qualité, les deux distributions de scores en forme de cloche se chevauchent fortement, donc aucun seuil ne les sépare bien et la courbe ROC reste proche de la diagonale (AUC proche de 0,5). À haute qualité, les distributions se chevauchent à peine, la courbe ROC s'incurve fortement vers le coin supérieur gauche, et l'AUC approche 1,0 — c'est exactement ce que fait l'amélioration des caractéristiques ou de l'algorithme d'un modèle réel sur sa distribution de scores.

Pourquoi la courbe ROC ressemble-t-elle à un escalier, et qu'est-ce que la ligne diagonale ?

La courbe ROC est construite en balayant le seuil sur chaque score distinct présent dans l'échantillon fini de clients ; chaque fois que le seuil franchit le score d'un client, la courbe monte (un vrai positif a été capturé) ou se déplace vers la droite (un faux positif a été capturé), produisant un escalier plutôt qu'une ligne lisse. Avec plus de clients, les marches deviennent plus fines et la courbe paraît plus lisse. La diagonale en pointillés de (0,0) à (1,1) représente un modèle sans aucune capacité prédictive — un classificateur qui devine au hasard a une courbe ROC attendue qui se situe exactement sur cette ligne.

⚙ Sous le capot

Un classificateur entraîné note les clients selon leur probabilité de résiliation — faites glisser le seuil et observez la courbe ROC et le coût métier évoluer ensemble.

Three.jsWebGLIAApprentissage automatique

3D · Rendu Three.js / WebGL · Cible 60 IPS · fonctionne entièrement côté client, sans installation

Qu'avez-vous trouvé ?

Ajouter des étapes de reproduction (facultatif)