Teorema de Bayes: P(θ|datos) ∝ P(datos|θ) × P(θ)
Conjugación Beta-Binomial: Prior Beta(α,β) + k éxitos de n observaciones → Posterior Beta(α+k, β+n−k).
La curva de color azul es el prior, la morada es el posterior. Las líneas discontinuas verdes representan la verosimilitud.

Acerca de la inferencia bayesiana

Autor: Equipo de MySimulator · Revisión editorial: Redacción de MySimulator

Actualizado: 9 de julio de 2026

La inferencia bayesiana es un método para actualizar creencias a la luz de nueva evidencia, basado en el teorema de Bayes: P(θ|datos) ∝ P(datos|θ) × P(θ). Aquí P(θ) es la distribución previa (prior, nuestra creencia antes de observar los datos), P(datos|θ) es la función de verosimilitud (likelihood, qué tan probables son los datos observados dado θ), y P(θ|datos) es la distribución posterior (nuestra creencia actualizada). El simulador usa la distribución beta Beta(α, β) como prior conjugado para resultados binarios: tras k éxitos y m fracasos, el posterior es Beta(α+k, β+m) — una fórmula analítica elegante que no requiere integración numérica.

Elige un escenario (moneda / prueba médica / tasa de eventos / personalizado), ajusta los valores previos α y β con los deslizadores, y pulsa «Éxito» o «Fracaso» para añadir observaciones. La curva de la distribución posterior se actualiza en tiempo real: observa cómo se estrecha alrededor del parámetro verdadero a medida que crece el número de datos. La estimación MAP (máximo del posterior) y el intervalo de credibilidad del 95% se muestran en el panel de estadísticas.

Preguntas frecuentes

¿Qué son el prior, la verosimilitud y el posterior?

La distribución previa P(θ) codifica nuestra creencia sobre el parámetro θ antes de observar datos — por ejemplo, «la moneda probablemente es justa» se representa con Beta(2,2), con un pico cerca de 0,5. La verosimilitud P(datos|θ) es la probabilidad del resultado observado dado un θ fijo. El posterior P(θ|datos) es la síntesis de ambos: cuanto más datos, menor es la influencia del prior y mayor la de las propias observaciones.

¿Por qué la distribución beta es «conjugada» con la binomial?

Se dice que una familia de priors F es conjugada de una verosimilitud L si el posterior también pertenece a F. Para datos binomiales (éxito/fracaso) con un prior beta, el posterior siempre es una distribución beta: Beta(α,β) + (k éxitos, m fracasos) → Beta(α+k, β+m). Esto significa que α y β pueden interpretarse como «pseudoobservaciones»: Beta(1,1) es un prior uniforme, mientras que Beta(10,10) equivale a «ya he visto 10 éxitos y 10 fracasos».

¿En qué se diferencia la estimación MAP de la media posterior?

El MAP (Maximum A Posteriori) es el valor de θ que maximiza la distribución posterior: para Beta(α,β) es (α−1)/(α+β−2). La media posterior es α/(α+β). En una distribución simétrica ambos coinciden, pero en una distribución sesgada difieren. La media minimiza el error cuadrático medio; el MAP corresponde a la estimación puntual bajo una pérdida 0-1. En muestras pequeñas, la diferencia puede ser considerable.

¿Qué es el «intervalo de credibilidad bayesiano del 95%» y en qué se diferencia del frecuentista?

El intervalo de credibilidad bayesiano (HDI, la región de mayor densidad) es el rango que contiene el 95% de la probabilidad posterior. Esto significa: «dados los datos, existe un 95% de probabilidad de que θ esté en este intervalo». El intervalo de confianza frecuentista del 95% solo significa: «si se repitiera el procedimiento infinitas veces, el 95% de los intervalos calculados contendrían el verdadero θ» — el parámetro se considera fijo, no aleatorio. La interpretación bayesiana resulta más natural en la práctica.

¿Cómo influye el prior en el resultado cuando hay pocos datos?

Con muestras pequeñas, el prior tiene un gran peso: un prior informativo fuerte como Beta(10,10) «tira» del posterior hacia 0,5, aunque los primeros 5 lanzamientos salgan cruz. A medida que crecen los datos (n → ∞), la verosimilitud «gana»: el posterior converge al verdadero θ independientemente del prior, siempre que este no sea nulo en θ. Esta es la «robustez bayesiana»: con suficientes datos, cualquier creencia inicial razonable acaba dando el mismo resultado.

¿Cómo se aplica el enfoque bayesiano al diagnóstico médico?

Una prueba con un 99% de sensibilidad y un 99% de especificidad parece casi perfecta. Pero si la enfermedad afecta a 1 de cada 10 000 personas (una probabilidad previa del 0,01%), un resultado positivo implica solo un ~1% de probabilidad de tener la enfermedad realmente — el otro 99% de positivos son falsos positivos. Esta es una consecuencia directa del teorema de Bayes y explica por qué el cribado masivo de enfermedades raras es técnicamente complicado.

¿Qué es un prior uniforme y cuándo se utiliza?

El prior uniforme Beta(1,1) no favorece ningún valor de θ ∈ [0,1] — expresa «no sé nada de antemano». Es el «principio de indiferencia» de Laplace. En la práctica, el prior uniforme es un compromiso razonable cuando no hay información previa. Pero incluso un prior uniforme no es «objetivo»: cambiar la parametrización (por ejemplo, a escala logit en vez de lineal) produce un prior no uniforme para θ. Un prior verdaderamente «no informativo» es el prior de Jeffreys, Beta(0.5,0.5).

¿En qué se diferencia el escenario de «prueba médica» del de «moneda» en el simulador?

El escenario de «moneda» usa un prior uniforme Beta(1,1): ambos resultados son igual de probables. El de «prueba médica» usa un prior sesgado (por ejemplo, Beta(1,19)) que refleja la baja prevalencia de la enfermedad. Al pulsar «Éxito» (resultado positivo), observa lo lentamente que cambia el posterior debido al fuerte prior sesgado — precisamente lo que ilustra el problema de las enfermedades raras.

¿Qué significa la actualización bayesiana «secuencial»?

Una propiedad clave de la inferencia bayesiana es la consistencia secuencial: el posterior tras la primera observación se convierte en el prior de la segunda; el orden de los datos no importa para el resultado final. Beta(1,1) + (3 éxitos, 2 fracasos) = Beta(4,3), sin importar el orden. Esto permite actualizar el modelo en tiempo real con cada nueva observación sin recalcular desde cero, algo esencial en sistemas de análisis en tiempo real y en el aprendizaje en línea.