Actualización Bayesiana

Prior → Verosimilitud → Posterior — modelo conjugado Beta-Binomial

Lanzamientos n =0
Caras k =0
Moda post. =-
Media post. =-
IC del 95% =-
1
1
0.60
med.

Qué demuestra

El teorema de Bayes explica cómo actualizar creencias cuando llegan nuevos datos. Para una moneda con sesgo desconocido p, la distribución Beta Beta(α, β) es un prior natural — vive en [0, 1] y codifica pseudoconteos de resultados (C, X). Tras observar k caras en n lanzamientos, la actualización conjugada es exacta:

Prior Beta(α, β) + k caras, n−k cruces → Posterior Beta(α+k, β+n−k)

Cómo usarlo

¿Sabías que...?

La actualización bayesiana está en el corazón de los filtros antispam, el diagnóstico médico (VPP frente a VPN), los receptores GPS y el aprendizaje automático moderno. El intervalo de credibilidad del 95% mostrado aquí tiene una interpretación clara: «Hay un 95% de probabilidad (dados los datos y el prior) de que p esté en este rango» — a diferencia de un intervalo de confianza frecuentista, que mantiene el parámetro fijo y varía las muestras hipotéticas.

Sobre la Actualización Bayesiana

Esta simulación modela la actualización conjugada Beta-Binomial — el motor matemático detrás de la inferencia bayesiana para la estimación de proporciones. Empiezas con una creencia previa sobre el sesgo de una moneda, codificada como una distribución Beta(α, β), y luego lanzas la moneda repetidamente; cada observación transforma el prior en un posterior más estrecho mediante la regla exacta Beta(α + k, β + n − k), donde k es el número de caras y n el total de lanzamientos. A medida que se acumula evidencia, el posterior se estrecha y converge hacia el sesgo oculto verdadero p que fijaste con el deslizador.

La actualización bayesiana impulsa sistemas reales, desde los filtros antispam del correo y el diagnóstico médico hasta la fusión de señales GPS y los sistemas de recomendación adaptativos. Esta metodología se remonta al artículo póstumo de Thomas Bayes de 1763 y fue desarrollada de forma independiente por Pierre-Simon Laplace.

Preguntas frecuentes

¿Qué es la actualización bayesiana?

La actualización bayesiana es el proceso de revisar una estimación de probabilidad (el prior) a la luz de nueva evidencia para producir una estimación actualizada (el posterior), usando el teorema de Bayes: P(H|E) = P(E|H) · P(H) / P(E). El prior codifica todo lo que creías antes de observar los datos, la verosimilitud mide cuán probables son los datos observados bajo cada hipótesis, y el posterior combina ambos. Lo esencial: el posterior de hoy se convierte en el prior de mañana a medida que llegan más datos.

¿Cómo se usan los controles de la simulación?

Ajusta los deslizadores de α y β previos para definir tu creencia inicial: α = β = 1 da un prior Uniforme plano que considera todos los sesgos igual de probables, mientras que un α mayor respecto a β codifica la creencia de que la moneda favorece cara. Fija la p verdadera como el sesgo real oculto de la moneda, y luego pulsa Lanzar 1, Lanzar 5, Lanzar 20 o Lanzar 100 para acumular observaciones. Activa el lanzamiento automático para ver el posterior evolucionar en tiempo real, y pulsa Reiniciar para borrar los lanzamientos conservando los ajustes del prior.

¿Qué significa el intervalo de credibilidad del 95%?

El intervalo de credibilidad del 95% que se muestra al pie del gráfico significa que existe un 95% de probabilidad — dados los datos observados y el prior — de que el sesgo verdadero p de la moneda se encuentre en ese rango. Se trata de una afirmación directa de probabilidad sobre el parámetro, que es la interpretación bayesiana. Es distinto de un intervalo de confianza frecuentista del 95%, que significa que si repitieras el experimento muchas veces, el 95% de los intervalos construidos contendrían el valor verdadero — una afirmación sobre el procedimiento, no sobre un intervalo concreto.

¿Por qué la distribución Beta es un prior natural para el sesgo de una moneda?

La distribución Beta está definida en el intervalo [0, 1], exactamente el rango de una probabilidad, y sus dos parámetros de forma α y β pueden interpretarse como pseudoconteos de caras y cruces previas. Lo más importante: es el prior conjugado de la verosimilitud Binomial: multiplicar un prior Beta por una verosimilitud Binomial da de nuevo una distribución Beta. Esta conjugación significa que la actualización del posterior requiere solo dos sumas (α += k, β += n − k) en lugar de una integral numérica, haciendo que el cálculo sea exacto e instantáneo sin importar cuántos lanzamientos se hayan observado.

¿Dónde se utiliza la actualización bayesiana en el mundo real?

Los filtros antispam la usan para estimar la probabilidad de que una palabra (como «gratis» o «ganador») indique spam, refinando las estimaciones a medida que el usuario marca correos. Las pruebas médicas la usan para calcular el valor predictivo positivo — la probabilidad de que un resultado positivo signifique enfermedad — combinando la sensibilidad de la prueba con la prevalencia previa de la enfermedad. En los receptores GPS, un filtro de Kalman aplica actualizaciones bayesianas secuenciales para fusionar señales satelitales ruidosas con predicciones del modelo de movimiento. Las plataformas de pruebas A/B usan métodos bayesianos para estimar posteriores de tasas de conversión e informar intervalos de credibilidad en lugar de valores p.

¿Cuál es un error común sobre la estadística bayesiana frente a la frecuentista?

Un error común es pensar que los métodos bayesianos son «subjetivos» y por tanto menos rigurosos que los frecuentistas. En la práctica, ambos enfoques requieren decisiones de modelado — los frecuentistas eligen un estadístico de prueba y un nivel de significancia, los bayesianos eligen un prior. Cuando el prior es débilmente informativo o hay abundancia de datos, el posterior queda dominado por la verosimilitud y converge a la misma respuesta que obtendría un frecuentista. La diferencia real es interpretativa: los bayesianos asignan probabilidades a las hipótesis, lo que encaja naturalmente con la toma de decisiones; los frecuentistas definen la probabilidad como frecuencia a largo plazo, lo que evita especificar un prior pero impide hacer afirmaciones directas de probabilidad sobre los parámetros.

¿Quién descubrió la inferencia bayesiana y cuándo?

El reverendo Thomas Bayes (c. 1701-1761) dedujo el teorema central pero nunca lo publicó; su amigo Richard Price encontró el manuscrito y lo presentó a la Royal Society, donde apareció en Philosophical Transactions en 1763, dos años después de la muerte de Bayes. Pierre-Simon Laplace redescubrió y amplió notablemente el enfoque de forma independiente hacia 1774, dándole la forma matemática que usamos hoy y aplicándolo a problemas que van desde las tasas de natalidad hasta la mecánica celeste. El término moderno «estadística bayesiana» solo se popularizó en las décadas de 1950 y 1960, defendido por estadísticos como Harold Jeffreys, Leonard Savage y Dennis Lindley.

¿Qué otras simulaciones están relacionadas con la actualización bayesiana?

La Inferencia Bayesiana (Prior, Likelihood y Posterior) de este sitio extiende el mismo marco a modelos no conjugados. El simulador de Distribución Normal demuestra el teorema central del límite, que explica por qué los posteriores de muestras grandes se vuelven aproximadamente gaussianos independientemente del prior. El simulador de Monte Carlo π ilustra otro método de razonamiento probabilístico: usar el muestreo aleatorio para estimar cantidades en lugar de posteriores de forma cerrada. El Explorador de Distribuciones de Probabilidad permite examinar la Beta, la Binomial y otras familias que sustentan los modelos conjugados.

¿Cómo se utiliza la actualización bayesiana en el aprendizaje automático y la IA?

Los clasificadores Naive Bayes aplican el teorema de Bayes a la clasificación de texto y documentos, tratando cada palabra como evidencia independiente. Las redes neuronales bayesianas colocan distribuciones sobre los pesos de la red en lugar de estimaciones puntuales, permitiendo cuantificar la incertidumbre en las predicciones. Los procesos gaussianos —usados en la optimización bayesiana para el ajuste de hiperparámetros— mantienen una distribución posterior sobre funciones enteras y la actualizan con cada nuevo experimento. Algoritmos de aprendizaje por refuerzo como el muestreo de Thompson usan muestras del posterior para equilibrar exploración y explotación en problemas de bandidos multibrazo, superando a las estrategias deterministas epsilon-greedy cuando los datos son limitados.