🏛️ Clasificador de Fraude del Sector Público — Precisión, Exhaustividad y la Matriz de Confusión
Un clasificador puntúa las solicitudes de prestaciones según su riesgo de fraude: observa cómo cambian en vivo la matriz de confusión, la precisión y la exhaustividad mientras arrastras el umbral de decisión sobre una población real puntuada.
Acerca del Clasificador de Fraude del Sector Público
Los organismos gubernamentales que pagan prestaciones, subvenciones o reembolsos recurren cada vez más a la puntuación estadística de riesgo para decidir qué solicitudes merecen una revisión más detallada. Esta simulación genera una población sintética de varios cientos de solicitudes con una tasa de fraude subyacente del 8%, deliberadamente baja, porque el fraude real en prestaciones es un suceso genuinamente poco frecuente en relación con el volumen de solicitudes legítimas, y entrena un clasificador real de regresión logística sobre dos características visibles (la puntuación z del importe de la solicitud y la puntuación de anomalía del patrón de presentación) mediante descenso de gradiente por lotes sobre la pérdida de entropía cruzada, exactamente como se entrenaría un modelo en producción, solo que a una escala que puedes observar converger época a época.
Una vez entrenado, cada solicitud lleva una probabilidad de fraude en vivo, representada como un mapa de calor de probabilidad detrás del diagrama de dispersión. Arrastrar el control deslizante del umbral cambia qué solicitudes cuentan como «señaladas», y la matriz de confusión, la precisión, la exhaustividad, la puntuación F1 y la tasa de falsos positivos se actualizan de inmediato frente a las etiquetas verdaderas (normalmente ocultas) de la población. Un control de capacidad de revisión añade la restricción bajo la que opera todo equipo real contra el fraude: los investigadores solo pueden revisar cierta cantidad de solicitudes por período, por lo que el umbral «estadísticamente correcto» y el umbral «operativamente viable» suelen ser dos cifras distintas.
Preguntas Frecuentes
¿Por qué es tan difícil lograr una alta precisión aquí, incluso con un modelo bien separado, cuando solo el 8% de las solicitudes son fraudulentas?
Este es el efecto de la tasa base (o probabilidad previa). Supongamos que 500 solicitudes incluyen 40 fraudulentas (una tasa del 8%) y el modelo logra una sólida exhaustividad del 85% con una modesta tasa de falsos positivos del 6% en el grupo legítimo, mucho más numeroso. El modelo señala correctamente 34 de los 40 casos de fraude (verdaderos positivos), pero la tasa de falsos positivos se aplica a las 460 solicitudes legítimas, generando alrededor de 28 falsos positivos. La precisión = 34/(34+28) ≈ 55%, aunque el modelo subyacente sea realmente bueno. Cuando la condición que se busca es poco frecuente, el mero tamaño de la clase negativa hace que incluso una tasa baja de falsos positivos produzca un número absoluto de falsas alarmas comparable al de los verdaderos positivos. Esta es la misma aritmética que hay detrás de la clásica paradoja de la «prueba de enfermedad rara» en medicina.
¿Qué significa cada celda de la matriz de confusión en la práctica para un equipo gubernamental de revisión de fraude?
Verdadero positivo: una solicitud genuinamente fraudulenta es señalada, se investiga y el hallazgo se confirma; el sistema funcionó. Falso positivo: un solicitante legítimo es señalado, lo que consume el tiempo de un investigador en un caso que resulta estar limpio, y puede suponer para el solicitante una revisión estresante, un retraso en el pago o un proceso de apelación; esto representa la carga de investigación y, a gran escala, un coste de equidad y confianza. Falso negativo: una solicitud fraudulenta obtiene una puntuación por debajo del umbral y no recibe ningún escrutinio; se paga un dinero que no debería haberse pagado, y nadie vuelve a examinar el caso a menos que resurja de otra manera. Verdadero negativo: una solicitud legítima se deja correctamente en paz; el resultado invisible, sin incidentes y más frecuente, ya que la mayoría de las solicitudes son legítimas.
¿Por qué la capacidad de revisión importa como una restricción real, además de la elección estadística del umbral?
Un umbral elegido únicamente para equilibrar estadísticamente la precisión y la exhaustividad puede seguir señalando muchas más solicitudes de las que los investigadores pueden revisar realmente en un período, convirtiendo un problema de puntuación en un problema de triaje. Si la capacidad es de 50 revisiones por período pero el umbral señala 140 solicitudes, la cola se acumula indefinidamente, los casos quedan sin revisar más allá de los plazos útiles, o el personal toma decisiones apresuradas y de menor calidad. En la práctica, los organismos suelen invertir la lógica: en lugar de elegir primero un punto de corte de probabilidad, clasifican todas las solicitudes según su puntuación de fraude y toman las N principales hasta el límite de su capacidad, lo cual equivale matemáticamente a elegir el umbral que produzca exactamente N señalizaciones en ese período. La capacidad, y no solo la estadística, suele acabar fijando el umbral operativo real.
¿En qué se diferencia esto de la detección de fraude con tarjetas de crédito de consumo en tiempo real?
La detección de fraude con tarjetas puntúa una transacción en milisegundos y puede bloquearla o aprobarla automáticamente de forma instantánea, con un remedio rápido y de bajo riesgo si se equivoca (un rechazo de la tarjeta, un mensaje de seguimiento). La detección de fraude en prestaciones gubernamentales, en cambio, alimenta un proceso de revisión humana más lento, está sujeta al debido proceso y a derechos de apelación, y un falso positivo puede significar que los ingresos de un solicitante vulnerable queden suspendidos o retrasados durante semanas mientras se investiga el caso, un coste de error mucho mayor para las personas afectadas. El fraude en prestaciones también suele ser más raro como proporción de las solicitudes, las características disponibles suelen ser administrativas en lugar de biométrico-conductuales, y las consecuencias legales y reputacionales de una señalización errónea son mucho más graves para el sector público que para un banco.
¿Por qué el sesgo y la equidad importan especialmente en este tipo de aplicación?
Características como el importe de la solicitud y las anomalías en el patrón de presentación pueden correlacionarse indirectamente con características protegidas, como la composición del hogar, la discapacidad, el origen étnico o la privación vinculada al código postal, incluso cuando esas características nunca se usan directamente. Si los falsos positivos recaen de forma desproporcionada sobre grupos ya desfavorecidos, una herramienta de cribado automatizada puede agravar sistemáticamente el daño a personas menos capaces de soportar una investigación errónea o un pago suspendido. Casos reales como el escándalo de las prestaciones por cuidado infantil en los Países Bajos y el sistema Robodebt de Australia mostraron cómo los sistemas automatizados de detección de fraude y deudas, implementados sin una auditoría adecuada por subgrupos, sin explicabilidad ni un verdadero derecho de apelación, causaron daños injustos a gran escala. Por eso las auditorías de precisión/exhaustividad por subgrupo, la revisión humana de los casos señalados y unos derechos de apelación claros se consideran requisitos de primer orden en este ámbito, no extras opcionales.
¿Qué hace en realidad la regresión logística aquí, y por qué entrenarla con descenso de gradiente?
La regresión logística combina las dos características de entrada con pesos aprendidos w₁, w₂ y un sesgo b en una única puntuación z = w₁x₁ + w₂x₂ + b, y luego comprime esa puntuación en una probabilidad mediante la función sigmoide p = 1/(1+e⁻ᶻ). Entrenar significa elegir w₁, w₂, b para minimizar la pérdida de entropía cruzada: el promedio de −[y·log(p) + (1−y)·log(1−p)] sobre todas las solicitudes, donde y es la etiqueta real de fraude. Como esta pérdida es convexa respecto a los pesos en la regresión logística, el descenso de gradiente —calcular repetidamente el gradiente de la pérdida respecto a cada peso y dar un pequeño paso en su contra— converge de forma fiable al mismo óptimo global cada vez que se reentrena, algo que esta simulación ejecuta de verdad, época a época, mostrando cómo disminuye la pérdida.
¿Por qué existe un compromiso entre precisión y exhaustividad, y cómo lo controla el control deslizante del umbral?
El modelo genera una probabilidad de fraude continua para cada solicitud; el control deslizante del umbral decide el punto de corte por encima del cual una solicitud cuenta como «señalada». Bajar el umbral señala más solicitudes en general, lo que necesariamente detecta más casos reales de fraude (mayor exhaustividad), pero también arrastra más solicitudes legítimas que simplemente obtuvieron una puntuación moderadamente alta (menor precisión). Subir el umbral hace lo contrario: menos señalizaciones, pero más seguras, por lo que la precisión aumenta y la exhaustividad disminuye a medida que los casos de fraude marginales se cuelan por debajo del límite. Como la distribución de puntuaciones subyacente se solapa entre clases, ningún umbral único maximiza ambos a la vez: el control deslizante permite trazar en vivo toda esa curva de compromiso, celda a celda, en la matriz de confusión.
Un clasificador puntúa las solicitudes de prestaciones según su riesgo de fraude: observa cómo cambian en vivo la precisión y la exhaustividad al arrastrar el umbral de decisión.
3D · Motor Three.js / WebGL · Objetivo de 60 FPS · Funciona totalmente en el cliente, sin instalación