🔁 Remuestreo Bootstrap — Intervalos de Confianza
Simulador interactivo de remuestreo bootstrap: extraiga muestras, remuestree con reemplazo y construya intervalos de confianza sin supuestos paramétricos. Observe cómo converge la distribución bootstrap.
Acerca del Remuestreo Bootstrap
El remuestreo bootstrap es una técnica no paramétrica poderosa para estimar la incertidumbre de cualquier estadístico (media, mediana, correlación, coeficiente de regresión) sin hacer supuestos sobre la distribución de probabilidad subyacente. La idea, introducida por Bradley Efron en 1979, es elegantemente simple: tratar la muestra observada como un sustituto de la población, y luego extraer repetidamente nuevas muestras del mismo tamaño con reemplazo (de modo que la misma observación pueda aparecer varias veces). Calcular el estadístico en cada uno de estos "remuestreos bootstrap" construye una distribución muestral empírica, de la cual se derivan directamente los intervalos de confianza.
En este simulador se elige una distribución poblacional (normal, sesgada, bimodal, uniforme o de cola pesada), un tamaño de muestra n, el número de remuestreos bootstrap B, un nivel de confianza y el estadístico de interés (media, mediana, desviación estándar, cuartiles o RIC). Tras pulsar Ejecutar, el lienzo muestra la muestra original, la distribución bootstrap del estadístico y el intervalo de confianza percentil resultante, permitiendo explorar cómo el tamaño de muestra, B y la forma de la distribución afectan el ancho y la cobertura del intervalo.
Preguntas frecuentes
¿Qué significa "remuestrear con reemplazo"?
Al extraer un remuestreo bootstrap de tamaño n a partir de las n observaciones originales, cada extracción es independiente: se elige una observación al azar, se registra y se devuelve al conjunto antes de la siguiente extracción. Esto significa que cualquier observación puede aparecer 0, 1, 2 o más veces en un solo remuestreo. En promedio, cada remuestreo contiene alrededor del 63,2% de observaciones únicas (1 − 1/e), siendo el resto duplicados. Esta repetición imita la variabilidad que se vería si se recogiera una muestra nueva de la misma población.
¿Cuántos remuestreos bootstrap B se necesitan para intervalos de confianza precisos?
Para el bootstrap percentil, B = 1000 es suficiente para intervalos de confianza del 95% en la mayoría de los casos; se recomienda B = 10 000 para intervalos del 99% o al estudiar cuantiles de cola. El error estándar del extremo del IC bootstrap escala como 1/√B, así que pasar de 1000 a 10 000 remuestreos reduce el ruido del extremo en √10 ≈ 3,2 veces. Para resultados de calidad de publicación con percentiles extremos, se recomienda B = 100 000.
¿Qué es el método del intervalo de confianza bootstrap percentil?
Tras calcular el estadístico θ̂* en cada uno de los B remuestreos, se ordenan los B valores. El IC percentil al nivel de confianza 1 − α toma el cuantil α/2 como límite inferior y el cuantil 1 − α/2 como límite superior. Para un IC del 95% con B = 1000 remuestreos, los límites son los valores ordenados 25 y 975. El método se justifica porque la distribución bootstrap de (θ̂* − θ̂) aproxima la verdadera distribución muestral de (θ̂ − θ).
¿Cuándo debería usar bootstrap en lugar de los intervalos de confianza paramétricos estándar?
El IC bootstrap es preferible cuando: (1) el estadístico no tiene un error estándar simple de forma cerrada (por ejemplo, la mediana, el RIC o una R² de regresión); (2) la distribución poblacional es claramente no normal o de cola pesada; (3) el tamaño de muestra es pequeño, haciendo sospechosa la normalidad asintótica; o (4) se quiere una "comprobación de cordura" de los resultados paramétricos. El intervalo t estándar para la media es fiable para n ≥ 30 bajo desviaciones moderadas de la normalidad, pero el bootstrap siempre es válido bajo supuestos más débiles.
¿Cuál es la diferencia entre el bootstrap percentil y el bootstrap BCa?
El bootstrap percentil puede estar sesgado o tener una cobertura incorrecta si la distribución muestral de θ̂ está sesgada o si θ̂ es un estimador sesgado de θ. El método corregido por sesgo y acelerado (BCa), también de Efron, ajusta los niveles de cuantil usados para extraer los extremos del IC mediante una corrección de sesgo z₀ (basada en la frecuencia con la que θ̂* < θ̂) y una constante de aceleración a (basada en los valores de influencia jackknife). Los IC BCa tienen mejor cobertura teórica y se recomiendan para estadísticos sesgados.
¿Funciona el bootstrap para series temporales o datos correlacionados?
El bootstrap i.i.d. estándar falla para series temporales porque destruye la correlación temporal. En su lugar, los métodos de bootstrap por bloques remuestrean bloques consecutivos de observaciones (por ejemplo, bloques de 20 puntos de datos) para preservar la estructura de autocorrelación. Las variantes comunes incluyen el bootstrap de bloque móvil, el bootstrap de bloque circular y el bootstrap estacionario (longitudes de bloque aleatorias de una distribución geométrica). Para datos espaciales, se necesitan procedimientos de bootstrap espacial o submuestreo.
¿Qué es el jackknife y cómo se relaciona con el bootstrap?
El jackknife (Quenouille, 1949; Tukey, 1958) estima el sesgo y la varianza dejando fuera secuencialmente una observación a la vez, calculando el estadístico con los n−1 valores restantes, y promediando o diferenciando los resultados. Es computacionalmente más barato que el bootstrap (solo n remuestreos frente a B), pero está limitado a estadísticos suaves: falla para la mediana y los cuantiles porque pequeñas perturbaciones no cambian el estadístico de orden. El bootstrap engloba al jackknife como caso especial.
¿Cómo afecta el tamaño de muestra n al ancho del IC bootstrap?
El ancho del IC bootstrap escala aproximadamente como 1/√n para estadísticos con varianza finita (como la media). Duplicar el tamaño de muestra de 30 a 120 reduce el ancho del IC a la mitad. Para distribuciones de cola pesada (Cauchy no tiene varianza finita), este escalado 1/√n se rompe y los IC bootstrap pueden ser inconsistentes. El simulador permite observar esto directamente: pruebe n = 10 frente a n = 100 con la distribución tipo Cauchy ("pesada") y compare cómo cambia el ancho del IC.
¿Puede el bootstrap estimar la incertidumbre de la precisión de un modelo de aprendizaje automático?
Sí: esta es una de las aplicaciones modernas más populares del bootstrap. Para estimar la varianza de la precisión de validación cruzada, el bootstrap .632 evalúa cada modelo bootstrap en las observaciones fuera de bolsa (el ~37% no extraído), combinándolo con la precisión de entrenamiento: error = 0,368 × error_entrenamiento + 0,632 × error_fuera_de_bolsa. El método .632+ ajusta además el sobreajuste. Scikit-learn y el paquete caret de R ofrecen evaluación de modelos basada en bootstrap.
¿Cuáles son las limitaciones del bootstrap?
El bootstrap es inconsistente para estadísticos que dependen de estadísticos de orden extremos (por ejemplo, el máximo o el mínimo de la muestra), porque el máximo de un remuestreo nunca puede superar el máximo de la muestra original. También requiere que la muestra original sea representativa de la población: si la muestra tiene sesgo de selección, el IC bootstrap hereda ese sesgo. Finalmente, el costo computacional escala con B y n, lo que puede ser prohibitivo para ajustes de modelo lentos o conjuntos de datos muy grandes sin submuestreo.
¿Qué es el "principio de sustitución" que justifica el bootstrap?
El principio de sustitución dice: estimar cualquier cantidad poblacional sustituyendo la función de distribución empírica F̂(x) (la función escalonada que coloca masa 1/n en cada valor observado) por la distribución verdadera F(x). El muestreo bootstrap a partir de los datos originales es equivalente a muestrear de F̂. Cualquier cantidad poblacional, ya sea una media, un cuantil o un funcional complejo, puede entonces estimarse calculando la misma cantidad bajo F̂, con incertidumbre caracterizada por la variabilidad entre los remuestreos bootstrap.
Acerca de esta simulación
El remuestreo bootstrap estima cuánto variaría un estadístico (una media, mediana o RIC) a través de repetidas recolecciones de datos, usando solo la muestra que ya se tiene. En lugar de asumir una población con forma de campana, extrae muchas muestras nuevas con reemplazo de sus datos y recalcula el estadístico cada vez, construyendo una distribución empírica de la cual se lee directamente un intervalo de confianza. Bradley Efron ideó el método en 1979.
🔬 Qué muestra
Cada ejecución extrae n puntos de una forma poblacional elegida (Normal, Sesgada, Bimodal, Uniforme o de Cola Pesada), y luego la remuestrea B veces para construir un histograma del estadístico. El intervalo percentil sombreado se compara con el valor verdadero de la población para mostrar si lo cubre.
🎮 Cómo usarlo
Elija una distribución Poblacional y un Estadístico (Media, Mediana, Desviación estándar, cuartiles o RIC), y luego fije el tamaño de muestra n, los remuestreos bootstrap B y el nivel de confianza. Pulse ▶ Ejecutar Bootstrap para reconstruir la distribución, o 🔀 Nueva Muestra para una muestra original nueva.
💡 ¿Sabía que…?
Efron nombró el método por la expresión "levantarse tirando de las propias correas de las botas" (pulling yourself up by your bootstraps): usar únicamente los datos disponibles para aprender sobre la incertidumbre de la propia estimación, sin suposiciones sobre la forma subyacente de la población.
Preguntas frecuentes
¿Qué significa realmente remuestrear "con reemplazo"?
Cada remuestreo bootstrap extrae n valores de la muestra original de uno en uno, devolviendo cada valor antes de la siguiente extracción, de modo que una observación puede aparecer una vez, muchas veces o ninguna, imitando la variabilidad de una muestra nueva.
¿Por qué a veces el intervalo de confianza no incluye el valor verdadero?
Se espera que un intervalo del 95% no incluya el valor verdadero en aproximadamente una ejecución de cada veinte; pulse Nueva Muestra repetidamente para observarlo: los fallos ocasionales son esperados, no un defecto del método.
¿Cuántos remuestreos bootstrap B necesito?
Unos pocos miles de remuestreos suelen dar un intervalo percentil estable. Muy pocos hacen que los extremos sean ruidosos; los niveles de confianza más altos o estadísticos como el RIC se benefician de un B mayor para un histograma más suave.
¿La elección del estadístico cambia cómo se comporta el bootstrap?
Los estadísticos suaves como la media convergen rápido. La mediana, los cuartiles y el RIC dependen de valores ordenados y suelen mostrar histogramas más escalonados e intervalos más amplios, especialmente con tamaños de muestra pequeños.
¿Por qué importa tanto el tamaño de muestra n?
Las muestras más grandes representan la población con más fidelidad, por lo que la distribución bootstrap se estrecha y el intervalo se reduce a medida que n crece. Con la opción de cola pesada este estrechamiento es mucho más débil, ya que los valores extremos dominan el estadístico.
Remuestree un conjunto de datos miles de veces con reemplazo para construir una distribución muestral y leer intervalos de confianza percentiles a partir de ella.
3D · Renderizador Three.js / WebGL · Objetivo de 60 FPS · funciona totalmente en el cliente, sin instalación