Strona głównaArtykułyStatystyka

Bootstrap Resampling: Statystyczne Wywnioskowanie Bez Założeń

Wprowadzone przez Bradley'a Efrona w 1979 roku: zakładaj, że Twoje zaobserwowane dane stanowią populację, losowo próbuj je z powrotem z ponownym wstawianiem i odczytuj przedziały ufności bezpośrednio z wynikającej rozrzutowości.

mysimulator teamZaktualizowano — czerwiec 2026≈ 8 min czytania▶ Otwórz symulację

Próbkowanie z powtórzeniami

Klasyczna statystyka opiera się na założeniach: rozkład normalny, wystarczająco duży rozmiar próby dla twierdzenia granicznego Marshalla-Cumminga, formuła na standardowy błąd dla konkretnej statystyki. Próbkowanie bootstrapowe omija wszystkie te założenia. Biorąc pod uwagę n obserwacji, wyciągnij próbkę bootstrapową wielkości n wartości losowo z powtórzeniami z oryginalnych danych — każda obserwacja może pojawić się zero, raz lub wiele razy. Oblicz statystykę T* na tej próbie bootstrapowej, powtarzaj to B razy (zwykle 1000-10000) i rozrzut wartości T* bezpośrednio przybliża zmienność próbną statystyki T.

1. Oblicz T_obserwowane z oryginalnej próby n obserwacji 2. Wyciągnij x*1 .. x*n próbując n wartości losowo z powtórzeniami z oryginalnych danych 3. Oblicz T* z próby bootstrapowej 4. Powtarzaj kroki 2-3 B razy → T*1 .. T*B 5. Podsumuj rozkład T* → przedział ufności, standardowy błąd Empiryczny rozkład — prawdopodobieństwo 1/n na każdą obserwację — jest najlepszym nieparametrycznym oszacowaniem prawdziwego rozkładu populacji, więc próbkowanie z niego naśladuje próbkowanie z prawdy. W średnim przypadku każda próba zawiera około 1 − e⁻¹ ≈ 63,2% unikalnych oryginalnych obserwacji; pozostałe ~36,8% stanowią podstawę oszacowania błędu poza bagiem w lasach losowych.

1. Compute T_obs from the original n observations
2. Draw x*1 .. x*n by sampling n values with replacement
3. Compute T* from the resample
4. Repeat steps 2-3 B times → T*1 .. T*B
5. Summarise the T* distribution → CI, standard error
demo na żywo · powiązana symulacja● LIVE

Przykładowe zastosowanie resamplingu

Najprostszym podejściem jest metoda percentyli: sortujemy statystyki B z resamplingów i przyjmujemy 2.5-ty i 97.5-ty centyl jako przedział ufności 95%. Metoda bias-corrected and accelerated (BCa) wprowadza dwie korekty – współczynnik korygujący błąd dla skośności i współczynnik przyspieszający, oszacowany metodą jackknife, co daje lepsze pokrycie dla skośnych statystyk. Metoda bootstrap-t (studentyzowana) standardyzuje każdy resampling przez jego własny bootstrapowy odchylenie standardowe i jest najbardziej dokładna, ale też najbardziej wymagająca obliczeniowo, wymagając zagnieżdżonego resamplingu.

Kiedy go używać, i jakie są jego ograniczenia

Bootstrap błyszczy tam, gdzie teoria klasyczna jest nieobecna lub niewiarygodna — przedział ufności współczynnika korelacji, średnia wycieniowana, korelacja rangowa Spearmana, obszar krzywej ROC. Metody klasyczne nadal wygrywają, gdy ich założenia rzeczywiście się spełniają, dając dokładne przedziały z mniejszymi obliczeniami. Bootstrap nie może naprawić oszacowania obciążonego lub nieprzedstawiającego próby — szacuje zmienność próbną, nic więcej. Standardowy bootstrap zakłada niezależne i identycznie rozłożone dane; dla szeregów czasowych lub danych z grupami (uczniowie w szkołach, pacjenci w szpitalach), używa się bootstrapa blokowego lub bootstrapa grupowego, aby zachować strukturę korelacji.

Zastosowania w świecie rzeczywistym

Random Foresty wykorzystują oszacowanie out-of-bag bootstrap do oceny błędu generalizacji bez oddzielnego zbioru testowego. Badania kliniczne używają przedziałów ufnych bootstrapowych dla skośnych porównań czasów przeżycia. Wartość ryzyka i oczekiwany krótki termin w finansach są obliczane za pomocą symulacji historycznych, które z kolei stanowią formę bootstrapowania. Niezawodność drzew filogenetycznych jest raportowana jako wartości wsparcia bootstrapa, a krajowe agencje statystyczne wykorzystują metody oparte na powiązanych wagach do obsługi złożonych projektów badań stratyfikowanych.

Frequently asked questions

Co to jest bootstrap resampling?

Bootstrap resampling to metoda obliczeniowa polegająca na wielokrotnym losowaniu próbek z powtórzeniami z danych obserwowanych, w celu przybliżenia rozkładu próbnego dowolnej statystyki, umożliwiając konstrukcję przedziałów ufności bez założeń dotyczących rozkładu.

Ile próbek bootstrapowych potrzebujesz?

Dla przybliżonych oszacowań, 200-500 prób jest często wystarczające. Aby uzyskać wiarygodne przedziały ufności na poziomie 95%, standardem jest 1000-2000. W celu uzyskania bardzo dokładnych percentyli ogonowych, takich jak przedział ufności 99%, zaleca się użycie 10 000 lub więcej próbek.

Jakie jest różnice między bootstrapem a testami permutacji?

Bootstrap resampling szacuje niepewność wokół estymaty poprzez losowanie z powtórzeniami. Testy permutacji oceniają istotność statystyczną poprzez przetasowywanie etykiet grup bez ponownego użycia, generując rozkład zerowy do obliczenia wartości p. Oba są metodami resamplingowymi, ale odpowiadają na różne pytania.

Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz the simulation i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację the simulation

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)