InicioIA y Aprendizaje AutomáticoExplorador ROC de Predicción de Abandono

🎯 Explorador ROC de Predicción de Abandono

Simulador interactivo de predicción de abandono de clientes: arrastra un umbral de decisión y observa cómo la curva ROC, el compromiso precisión-exhaustividad y el coste empresarial se mueven juntos en tiempo real.

IA y Aprendizaje Automático3DModerado60 FPS
predictive-analytics-growth ↗ Abrir independiente

Acerca del Explorador ROC de Predicción de Abandono

La mayoría de los modelos de aprendizaje automático empresariales no producen una decisión — producen una probabilidad. Un modelo de abandono no dice "este cliente se irá", dice "este cliente tiene un 73% de probabilidad de irse". Convertir esa probabilidad en una acción (enviar una oferta de retención o no) requiere elegir un umbral de decisión, y esa única elección determina cuántos abandonos reales capturas, cuántas falsas alarmas generas y, en última instancia, cuánto vale el modelo en libras y peniques. Esta simulación genera una población sintética de clientes con resultados y puntuaciones de modelo conocidos, y luego te permite explorar esa decisión de umbral directamente.

Arrastra el deslizador de calidad del modelo y observa cómo dos distribuciones de puntuación superpuestas — clientes retenidos agrupados cerca de cero, clientes que abandonan agrupados más alto — se separan o colapsan entre sí. Al mover el deslizador de umbral, un marcador se desliza simultáneamente por el histograma de puntuaciones, la curva ROC y la curva de precisión-exhaustividad, de modo que la conexión entre "dónde corto las puntuaciones" y "dónde caigo en la curva" es inmediata y visual. Una calculadora de coste en vivo te permite sopesar una oferta de retención desperdiciada frente a un cliente perdido y ver exactamente qué umbral minimiza el coste total esperado — que rara vez es el mismo umbral que parece "mejor" solo en la curva ROC.

Preguntas frecuentes

¿Qué mide realmente el AUC?

El AUC (área bajo la curva ROC) es la probabilidad de que el modelo clasifique a un cliente que abandona elegido al azar por encima de un cliente retenido elegido al azar. AUC = 1,0 significa clasificación perfecta — todo cliente que abandona puntúa por encima de todo cliente que no lo hace. AUC = 0,5 significa que el modelo no es mejor que lanzar una moneda. Crucialmente, el AUC es independiente del umbral: resume la capacidad de clasificación del modelo a través de cada posible punto de corte a la vez, por lo que no te dice qué umbral usar realmente en producción.

¿Por qué la precisión (accuracy) es engañosa cuando solo el 20% de los clientes abandona?

Con una tasa base de abandono del 20%, un modelo perezoso que predice "nunca abandona" para cada cliente ya tiene un 80% de precisión (accuracy) mientras no captura ni un solo abandono real. La precisión (accuracy) pondera ambas clases por igual, pero en una población desequilibrada la clase mayoritaria domina la puntuación. Por eso esta simulación reporta TPR (exhaustividad), precisión y coste en lugar de accuracy — exponen lo bien que el modelo encuentra la clase positiva rara en lugar de premiarlo por repetir la clase mayoritaria.

¿Cuál es el compromiso entre precisión y exhaustividad al mover el umbral?

Subir el umbral significa que solo las puntuaciones muy altas se marcan como abandono, por lo que la precisión (la fracción de clientes marcados que realmente abandonan) tiende a subir mientras que la exhaustividad (la fracción de abandonos reales que realmente capturas) baja. Bajar el umbral hace lo contrario — capturas más abandonos pero marcas más falsas alarmas. La curva de precisión-exhaustividad traza todo este compromiso; no hay un umbral que maximice ambas simultáneamente a menos que las clases sean perfectamente separables.

¿En qué se diferencia el umbral óptimo en coste del punto más cercano a la esquina superior izquierda de la curva ROC?

La esquina superior izquierda de la curva ROC (TPR = 1, FPR = 0) es un ideal puramente estadístico que trata un falso positivo y un falso negativo como igualmente malos. El umbral óptimo en coste, en cambio, minimiza el coste empresarial total esperado = FP × coste-por-falso-positivo + FN × coste-por-falso-negativo. Si un abandono no detectado es mucho más costoso que una oferta de retención desperdiciada, el umbral óptimo en coste se sitúa más bajo (captura más abandonos) que el punto estadísticamente "equilibrado", y viceversa.

¿Por qué los umbrales de abandono del mundo real se eligen por coste empresarial en lugar de por pura estadística?

La salida de probabilidad de un modelo es solo un producto intermedio — la decisión empresarial es binaria: enviar la oferta de retención o no. Dos empresas con el modelo idéntico y el mismo AUC pueden elegir racionalmente umbrales completamente distintos si sus estructuras de costes difieren, por ejemplo un negocio de suscripción de bajo margen frente a un contrato empresarial de alto valor. Por eso desplegar un modelo siempre implica una conversación con el negocio sobre el coste relativo de los falsos positivos y los falsos negativos, no solo una métrica de ciencia de datos.

¿Qué cambia realmente el deslizador de "calidad del modelo"?

Controla cuánto se separan las distribuciones de puntuación de los clientes retenidos y los que abandonan. Con calidad baja, las dos distribuciones de puntuación en forma de campana se solapan mucho, por lo que ningún umbral las separa bien y la curva ROC se sitúa cerca de la diagonal (AUC cercano a 0,5). Con calidad alta, las distribuciones apenas se solapan, la curva ROC se curva bruscamente hacia la esquina superior izquierda, y el AUC se acerca a 1,0 — esto es exactamente lo que hace mejorar las características o el algoritmo de un modelo real a su distribución de puntuación.

¿Por qué la curva ROC parece una escalera, y qué es la línea diagonal?

La curva ROC se construye barriendo el umbral a través de cada puntuación distinta presente en la muestra finita de clientes; cada vez que el umbral cruza la puntuación de un cliente, la curva sube un escalón (se capturó un verdadero positivo) o se desplaza a la derecha (se capturó un falso positivo), produciendo una escalera en lugar de una línea suave. Con más clientes los escalones se vuelven más finos y la curva parece más suave. La diagonal discontinua de (0,0) a (1,1) representa un modelo sin ninguna capacidad predictiva — un clasificador que adivina al azar tiene una curva ROC esperada que se sitúa exactamente sobre esta línea.

⚙ Bajo el capó

Un clasificador entrenado puntúa a los clientes según su probabilidad de abandono — arrastra el umbral y observa cómo la curva ROC y el coste empresarial se mueven juntos.

Three.jsWebGLAIMachine Learning

3D · Renderizador Three.js / WebGL · Objetivo 60 FPS · funciona completamente en el navegador, sin instalación

¿Qué encontraste?

Añadir pasos de reproducción (opcional)