InicioIA y aprendizaje automáticoDetector de Fraude de Clics Publicitarios — Ley de Benford en Vivo

🖱️ Detector de Fraude de Clics Publicitarios — Ley de Benford en Vivo

Observa una prueba estadística real de la Ley de Benford comparar en vivo las frecuencias del primer dígito del recuento de clics publicitarios simulados frente a la distribución logarítmica genuina esperada para señalar fuentes de tráfico fraudulentas.

IA y aprendizaje automático3DModerado60 FPS
ai-ad-click-fraud-detection ↗ Abrir independiente

Acerca del Detector de Fraude de Clics Publicitarios con la Ley de Benford

Esta simulación ejecuta un flujo genuino de análisis de dígitos según la Ley de Benford sobre varias fuentes de tráfico publicitario simuladas. Cada fuente genera un flujo de valores de recuento de clics a lo largo de muchas campañas o periodos de reporte; se extrae el primer dígito de cada valor y se tabula en un histograma de frecuencia observada, que luego se compara con la distribución esperada real de Benford P(d) = log₁₀(1 + 1/d) usando un estadístico de bondad de ajuste chi-cuadrado en vivo. Nada en el estadístico de ajuste está codificado de forma fija —se recalcula a partir del conjunto de datos generado real cada vez que vuelves a muestrear o alternas una fuente.

🔬 Qué muestra

Nueve barras 3D por fuente de tráfico, una por cada posible primer dígito del 1 al 9: una barra sólida muestra la frecuencia observada de la fuente, una barra de alambre translúcida detrás de ella muestra la frecuencia esperada de Benford. Las fuentes "genuinas" se generan mediante un proceso multiplicativo log-uniforme que abarca varios órdenes de magnitud —la condición clásica bajo la cual los recuentos de clics reales obedecen la Ley de Benford. Las fuentes de "fraude", en cambio, extraen recuentos de manera uniforme de una banda numérica estrecha, lo que demostrablemente no logra reproducir una distribución logarítmica del primer dígito.

🎮 Cómo usarlo

Alterna cualquier fuente entre Genuina y Fraude con los botones del panel izquierdo, ajusta el tamaño de muestra (periodos por fuente) con el deslizador, y pulsa Volver a muestrear para extraer un nuevo lote de datos de clics. Arrastra para orbitar la escena 3D, desplázate para hacer zoom, y haz clic en cualquier barra o tarjeta de fuente para inspeccionar su estadístico χ² exacto, valor p aproximado y desviación media absoluta (MAD) en el panel de detalle. La lista de clasificación se reordena en vivo según la puntuación de probabilidad de fraude (χ²) a medida que cambian los datos.

💡 ¿Sabías que...?

La Ley de Benford fue observada por primera vez por el astrónomo Simon Newcomb en 1881, quien notó que las primeras páginas de las tablas de logaritmos estaban mucho más desgastadas que las últimas —lo que significa que la gente buscaba números que comenzaban con 1 mucho más a menudo que números que comenzaban con 9. Hoy es una herramienta estándar de contabilidad forense y detección de fraude, usada para examinar declaraciones de impuestos, recuentos de votos electorales, datos científicos y —como se demuestra aquí— informes de tráfico publicitario digital en busca de señales de fabricación.

Preguntas frecuentes

¿Qué es la Ley de Benford y por qué se aplica a los datos de clics publicitarios?

La Ley de Benford establece que, para muchos conjuntos de datos numéricos multiescala que ocurren de forma natural, el primer dígito d no se distribuye de manera uniforme entre 1 y 9, sino que sigue P(d) = log₁₀(1 + 1/d) — de modo que alrededor del 30,1% de los valores comienzan con 1, el 17,6% con 2, hasta solo el 4,6% que comienza con 9. Esto surge siempre que la cantidad subyacente abarca varios órdenes de magnitud y su logaritmo se distribuye aproximadamente de manera uniforme, que es exactamente lo que ocurre con los recuentos orgánicos de clics publicitarios agregados en campañas de tamaños, presupuestos y alcances muy diferentes. Los datos fabricados — generados eligiendo números en un rango estrecho para parecer plausibles — no tienen esta estructura multiescala, por lo que no logran reproducir la propiedad log-uniforme y sus primeros dígitos se desvían de la curva esperada de Benford.

¿Cómo funciona aquí la prueba de bondad de ajuste chi-cuadrado?

Para cada fuente de tráfico tabulamos cuántos de sus N valores de recuento de clics tienen cada primer dígito del 1 al 9, obteniendo los recuentos observados O(d). Calculamos el recuento esperado según la Ley de Benford como E(d) = N × log₁₀(1 + 1/d). El estadístico chi-cuadrado es χ² = Σ (O(d) − E(d))² / E(d), calculado en vivo a partir de los datos simulados reales en cada regeneración — nada está codificado de forma fija. Con 9 categorías de dígitos hay 8 grados de libertad, y el valor crítico estándar para un nivel de significancia del 5% es 15,507; las fuentes cuyo estadístico chi-cuadrado supera ese umbral se marcan como estadísticamente inconsistentes con tráfico genuino y de escala natural.

¿Qué genera el tráfico "genuino" frente al "fraudulento" en la simulación?

Las fuentes genuinas extraen recuentos de clics de un proceso multiplicativo log-uniforme: la escala base es 10 elevado a un exponente uniformemente aleatorio entre 1 y aproximadamente 5,2 (de modo que las magnitudes van de decenas a cientos de miles), multiplicado por ruido lognormal que representa la variación diaria de la campaña. Como el exponente es uniforme, los primeros dígitos resultantes siguen de cerca la Ley de Benford, reflejando cómo se comporta el tráfico web real agregado. Las fuentes fraudulentas, en cambio, extraen recuentos de manera uniforme de una banda numérica estrecha, como de 500 a 900 clics — un patrón típico de granjas de clics o bots que intentan parecer un volumen estable y plausible, lo cual matemáticamente no puede reproducir una distribución logarítmica del primer dígito.

¿Qué aporta la desviación media absoluta (MAD) más allá del chi-cuadrado?

El chi-cuadrado es sensible al tamaño de la muestra N — con suficientes datos, incluso desviaciones diminutas y prácticamente sin importancia se vuelven estadísticamente significativas. La desviación media absoluta, MAD = (1/9) × Σ |fracción observada(d) − P(d)|, mide el tamaño promedio de la propia desviación, independientemente de N. Los profesionales del análisis de dígitos (siguiendo las convenciones de contabilidad forense de Nigrini) consideran un MAD por debajo de aproximadamente 0,006 como conformidad cercana, 0,006–0,012 como aceptable, 0,012–0,015 como marginal, y por encima de 0,015 como no conforme. Reportar ambos estadísticos juntos — chi-cuadrado para la significancia estadística y MAD para el tamaño del efecto — ofrece una imagen más completa que cualquiera de los dos por separado.

¿Puede el análisis de la Ley de Benford por sí solo probar que una fuente de tráfico es fraudulenta?

No — la Ley de Benford es una heurística de cribado, no una prueba. Algunos conjuntos de datos genuinos no logran conformarse porque están restringidos a un rango estrecho por razones legítimas (por ejemplo, una pequeña campaña de presupuesto fijo que siempre compra un número similar de clics), y algunos datos fabricados pueden construirse deliberadamente para imitar una distribución logarítmica. En la detección real de fraude publicitario, un resultado chi-cuadrado significativo en los recuentos de clics es una señal más entre muchas — junto con los patrones de tiempo de clic, las huellas digitales de dispositivos, la reputación de IP y las anomalías en la tasa de conversión — que los analistas usan para priorizar qué fuentes de tráfico merecen una investigación más profunda.

¿Por qué las barras de frecuencia de dígitos observadas siguen moviéndose incluso sin cambiar la configuración?

Las barras observadas se animan suavemente hacia su nueva altura objetivo cada vez que cambian los datos subyacentes — por ejemplo, cuando alternas una fuente entre genuina y fraudulenta, cambias el tamaño de la muestra, o haces clic en Volver a muestrear. Esto es puramente un efecto visual de suavizado para facilitar la lectura; el estadístico chi-cuadrado y el valor p mostrados en el panel lateral siempre se calculan directamente a partir de los datos finales y estabilizados, no del fotograma animado intermedio.

⚙ Bajo el capó

Los histogramas del primer dígito (nueve dígitos) se tabulan en vivo por fuente y se comparan con P(d) = log₁₀(1 + 1/d) usando un estadístico real de bondad de ajuste χ² y la desviación media absoluta, recalculados en cada muestreo.

Ley de BenfordPrueba chi-cuadradoDetección de fraudeEstadísticaAnálisis de dígitos

3D · Renderizador Three.js / WebGL · objetivo de 60 FPS · se ejecuta completamente en el cliente, sin instalación

¿Qué encontraste?

Añadir pasos de reproducción (opcional)