InicioIA y Aprendizaje AutomáticoDetector de Intrusiones en Red — Puntuación de Anomalías en Vivo

🚨 Detector de Intrusiones en Red — Puntuación de Anomalías en Vivo

Un flujo de tráfico de red simulado pasa por un modelo de detección de anomalías que puntúa cada conexión según su riesgo de intrusión, señalando escaneos de puertos y patrones de exfiltración de datos a medida que aparecen.

IA y Aprendizaje Automático3DAvanzado60 FPS
ai-cybersecurity-intrusion-detection ↗ Abrir independiente

Acerca del Detector de Intrusiones en Red

Los sistemas modernos de detección de intrusiones en red se dividen en dos grandes familias. Los sistemas basados en firmas (Snort, Suricata, la mayoría de los cortafuegos comerciales) comparan el tráfico con un catálogo de patrones ya conocidos como maliciosos y solo pueden detectar lo que ya se ha visto y escrito en una regla. Los sistemas basados en anomalías, en cambio, construyen un modelo estadístico de cómo es el tráfico «normal» de una red — tasas de paquetes típicas, duraciones de conexión, puertos utilizados — y señalan cualquier cosa que se desvíe fuertemente de él, lo que les permite detectar patrones de ataque genuinamente nuevos a costa de una mayor tasa de falsos positivos. Esta simulación implementa directamente el enfoque basado en anomalías: un flujo en vivo de conexiones sintéticas, cada una descrita por cuatro características a nivel de flujo (paquetes/seg, bytes/paquete, duración de la conexión y puertos de destino distintos utilizados), se puntúa frente a una distribución de referencia que a su vez se reestima sobre la marcha a partir del tráfico reciente aún no marcado.

La puntuación de anomalía de cada conexión es la norma euclídea de sus cuatro puntuaciones z frente a esa referencia en vivo — una forma simplificada, de covarianza diagonal, de la distancia de Mahalanobis. Un control deslizante de sensibilidad fija el umbral de puntuación por encima del cual se marca una conexión; una vez marcada, la simulación examina qué características están impulsando la anomalía para distinguir un escaneo de puertos (muchos puertos distintos, duración muy corta) de una exfiltración de datos (bytes por paquete grandes que se mueven de forma constante a través de muy pocos puertos durante una sesión larga). Como cada conexión sintética lleva en secreto una etiqueta de verdad fundamental, la simulación puede calcular en vivo la precisión, la exhaustividad y la matriz de confusión completa a medida que mueves el umbral — haciendo directamente visible y ajustable el equilibrio entre alertas y fatiga que está en el centro de cualquier centro de operaciones de seguridad real.

Preguntas Frecuentes

¿Qué es la detección de intrusiones basada en anomalías y en qué se diferencia de un IDS basado en firmas?

Los sistemas basados en firmas, como Snort o Suricata, comparan el tráfico con una base de datos de patrones de ataque conocidos — una secuencia de bytes concreta, una IP conocida como maliciosa, una forma de paquete particular — y solo pueden detectar ataques que ya se han visto y catalogado antes. La detección basada en anomalías, en cambio, construye un perfil estadístico de cómo es el tráfico «normal» para una red dada — tasas de paquetes típicas, duraciones de conexión, puertos utilizados — y señala cualquier cosa que se desvíe fuertemente de ese perfil, sin importar si el ataque exacto se ha visto alguna vez. Esto permite a los detectores de anomalías detectar patrones de ataque nuevos o de día cero, a costa de una mayor tasa de falsos positivos, ya que un comportamiento inusual pero legítimo (una tarea de copia de seguridad, un servicio nuevo) también puede activar una alerta. Los despliegues reales suelen combinar ambos enfoques en capas.

¿Qué características utiliza esta simulación para describir una conexión, y por qué estas cuatro?

Cada conexión simulada se describe mediante cuatro características: paquetes por segundo (pps), bytes por paquete (bpp), duración de la conexión en segundos, y el número de puertos de destino distintos utilizados durante la sesión. Se eligieron estas cuatro porque separan con claridad las dos familias de ataque modeladas aquí sin necesidad de una inspección profunda de paquetes: un escaneo de puertos se manifiesta como muchos puertos distintos tocados en una duración muy corta con paquetes pequeños (bpp bajo, pps alto), mientras que la exfiltración de datos se manifiesta como una sesión de larga duración que mueve un número de bytes por paquete inusualmente alto a través de muy pocos puertos. Los sistemas reales de detección de intrusiones usan de docenas a cientos de estas características a nivel de flujo (varianza del tiempo entre llegadas, proporciones de indicadores TCP, entropía de bytes), pero cuatro son suficientes para que la estadística subyacente — y el equilibrio resultante entre falsos positivos y falsos negativos — sea totalmente visible.

¿Cómo se calcula realmente la puntuación de anomalía?

Cada una de las cuatro características se convierte en una puntuación z: zᵢ = (xᵢ − mediaᵢ) / desviaciónᵢ, usando una media y una desviación estándar estimadas en vivo a partir de una ventana móvil de las conexiones más recientes que no están marcadas actualmente como anómalas. La puntuación de anomalía es entonces la norma euclídea del vector de puntuaciones z, puntuación = √(z₁² + z₂² + z₃² + z₄²) — equivalente a una distancia de Mahalanobis bajo el supuesto simplificador de que las cuatro características no están correlacionadas (una matriz de covarianza diagonal), en lugar de la matriz de covarianza completa que estimaría un sistema de producción. Una conexión se marca en cuanto su puntuación supera el umbral de sensibilidad fijado por el control deslizante.

¿Cómo distingue la simulación un escaneo de puertos de una exfiltración de datos una vez marcada una conexión?

Cuando la puntuación supera el umbral, la simulación observa qué puntuaciones z individuales están impulsando la anomalía. Si la puntuación z de puertos distintos es fuertemente positiva mientras que la de duración es fuertemente negativa, la firma coincide con muchos puertos tocados en muy poco tiempo — se clasifica como escaneo de puertos. Si las puntuaciones z de bytes por paquete y de duración son ambas fuertemente positivas mientras que los puertos distintos se mantienen bajos, la firma coincide con una transferencia de datos grande, sostenida y estrecha — se clasifica como exfiltración. Cualquier marca que no coincida claramente con ninguna de las dos firmas se etiqueta como anomalía genérica. Esto refleja cómo los analistas de un SOC real clasifican una alerta: la puntuación de anomalía en bruto dice que algo es inusual, pero el desglose por características dice qué tipo de inusual es.

¿Cómo afecta el control deslizante del umbral de sensibilidad a los falsos positivos y falsos negativos?

Bajar el umbral marca más conexiones: la exhaustividad sube (menos intrusiones reales pasan como falsos negativos) pero la precisión baja (más tráfico ordinario se marca erróneamente como falso positivo, un efecto que los analistas llaman fatiga de alertas). Subir el umbral hace lo contrario — menos alertas, mayor precisión, pero una probabilidad creciente de que escaneos o sesiones de exfiltración reales pasen desapercibidos. No existe un ajuste universalmente correcto: el SOC de un banco podría tolerar una tasa de falsos positivos más alta para detectar más amenazas reales, mientras que un servicio con un equipo de seguridad pequeño podría subir el umbral simplemente porque no puede clasificar una avalancha de alertas.

¿Por qué el modelo recalcula sus estadísticas de referencia a partir de una ventana móvil en vivo en lugar de un conjunto de entrenamiento fijo?

El tráfico de red real cambia constantemente — se lanza una nueva aplicación, cambia un horario de copias de seguridad, el trabajo remoto desplaza el perfil de tráfico por hora del día — un fenómeno llamado deriva de concepto. Un detector entrenado una sola vez con el tráfico del mes pasado y nunca actualizado se irá descalibrando poco a poco: o bien marcará cada vez más comportamiento normal-pero-nuevo como falso positivo, o (peor aún) tratará un ataque lento y deliberado como el nuevo estado normal porque se coló gradualmente. Recalcular la media y la desviación estándar a partir de una ventana móvil de conexiones recientemente no marcadas permite que la línea base siga la deriva legítima mientras sigue resistiendo ataques que llegan como un estallido repentino, a costa de ser vulnerable a atacantes que aumentan deliberadamente su actividad con la suficiente lentitud como para ser absorbidos en la línea base — una limitación bien conocida a veces llamada envenenamiento de la rana hervida.

¿Cuáles son las limitaciones de este enfoque de covarianza diagonal en comparación con un sistema de detección de intrusiones de producción?

Tratar las cuatro características como no correlacionadas (sumando puntuaciones z independientes) ignora correlaciones reales — por ejemplo, una tasa de paquetes alta y unos bytes por paquete bajos tienden a coexistir de forma natural en peticiones cortas normales, así que una matriz de covarianza completa dibujaría una región normal elíptica e inclinada en lugar de la alineada con los ejes de esta simulación, y marcaría menos de esos puntos naturalmente correlacionados como anómalos. Los sistemas de producción van todavía más lejos: los bosques de aislamiento, los autoencoders y otros modelos de aprendizaje automático capturan estructura no lineal y de orden superior a través de docenas de características, y normalmente se combinan con reglas de firmas, fuentes de inteligencia de amenazas y revisión de analistas humanos en lugar de depender de una única puntuación estadística aislada.

¿Por qué cuestan tan diferente los falsos negativos y los falsos positivos en un SOC real?

Un falso negativo — una intrusión no detectada — puede significar que los datos realmente salen de la red o que un punto de apoyo del atacante pasa desapercibido, con costes medidos en remediación de brechas, exposición regulatoria y daño reputacional. Un falso positivo cuesta tiempo de analista: alguien tiene que abrir la alerta, extraer los registros y concluir que era benigna. Como el tiempo de los analistas es finito y todo SOC real recibe muchas más alertas de las que puede investigar por completo, un detector ajustado solo para maximizar la exhaustividad (detectarlo todo) puede resultar contraproducente si entierra las alertas genuinas bajo una avalancha de falsas — precisamente por eso el equilibrio entre precisión y exhaustividad que expone el control deslizante del umbral de esta simulación es la decisión operativa central en la detección de intrusiones real, no una simple curiosidad estadística.

⚙ Bajo el capó

Las conexiones simuladas fluyen ante un detector de anomalías en vivo: la media y la desviación estándar de cuatro características de flujo se reestiman a partir de una ventana móvil de tráfico reciente no marcado, cada nueva conexión se puntúa mediante la norma euclídea de sus puntuaciones z, y las conexiones marcadas se clasifican como escaneo de puertos, exfiltración o anomalía genérica según qué características impulsan la puntuación.

Canvas 2DDetección de AnomalíasDetección de Escaneo de PuertosExfiltración de DatosPrecisión/Exhaustividad

3D · Renderizador Three.js / WebGL · objetivo 60 FPS · funciona totalmente en el cliente, sin instalación

¿Qué encontraste?

Añadir pasos de reproducción (opcional)