Вибірка з заміною
Класична статистика ґрунтується на припущеннях: нормальному розподілі, достатньо великому розмірі вибірки для теореми про центральну межу та формулі для стандартної похибки вашого конкретного статистичного показника. Bootstrap-вибірка обходить усі ці обмеження. Враховуючи n спостережень, згенеруйте bootstrap-вибірку з n значень випадково, із заміною, з оригінальних даних – будь-яке спостереження може зустрічатися нуль, один або декілька разів. Обчисліть статистику T* на цій вибірці, повторіть B разів (зазвичай 1000–10000), і розповсюдження отриманих значень T* безпосередньо приблизно відповідає змінності вибірки T.
1. Обчисліть T_obs з початкової n спостережень 2. Згенеруйте x*1 .. x*n, взявши випадково n значень із заміною 3. Обчисліть T* з вибірки 4. Повторіть кроки 2-3 B разів → T*1 .. T*B 5. Узагальніть розподіл T* → довірчий інтервал, стандартна похибка Емпіричний розподіл – ймовірність 1/n для кожного спостережуваного значення – є найкращим непараметричним оцінком справжнього популяційного розподілу, тому ресемплювання з нього імітує ресемплювання з правди. В середньому, кожна вибірка містить приблизно 63,2% унікальних оригінальних спостережень (1 − e⁻¹); незабраковані 36,8% формують основу оцінки помилки поза вибіркою в випадкових лісіях.
1. Compute T_obs from the original n observations 2. Draw x*1 .. x*n by sampling n values with replacement 3. Compute T* from the resample 4. Repeat steps 2-3 B times → T*1 .. T*B 5. Summarise the T* distribution → CI, standard error
Побудова інтервалу довіри
Найпростіший підхід – метод на основі квантилів: сортуються статистичні дані B з використанням bootstrap, а потім визначаються 2,5-й та 97,5-й квантилі як інтервал у межах 95% довірчого інтервалу. Інтервал bias-corrected and accelerated (BCa) застосовує два коригування – коефіцієнт корекції спотворення та коефіцієнт прискорення, оцінений за допомогою jackknife, що забезпечує краще покриття для спотворених статистичних даних. Метод bootstrap-t (стандартизований) стандартизує кожен зразки bootstrap на основі його власного bootstrap стандартного відхилення і є найбільш точним, але найбільш обчислювально затратним, вимагаючи вкладеного bootstrap.
Коли використовувати та його обмеження
Bootstrap особливо ефективний там, де класична теорія відсутня або ненадійна – наприклад, при розрахунку довірчого інтервалу для коефіцієнта кореляції, обчисленні зрізаного середнього значення (trimmed mean), використанні кореляції Спірмена (Spearman’s rank correlation) або визначенні площі під ROC-кривою. Класичні методи все ще переважають, коли їхні припущення справді виконуються, надаючи точні інтервали з меншими обчислювальними затратами. Bootstrap не може виправити упереджений оцінювач або не репрезентативний зразок – він оцінює мінливість вибірки, нічого більше. Стандартний Bootstrap також передбачає незалежність та однаковість розподілу даних; для часових рядів або кластерних даних (учні в школах, пацієнти в лікарнях), блок-Bootstrap або кластерний Bootstrap передивляються цілі блоки або кластери, щоб зберегти структуру кореляції.
Практичне застосування
Випадкові ліси використовують оцінку out-of-bag bootstrap для оцінки похибки узагальнення без окремого тестового набору. Клінічні дослідження використовують інтервали bootstrap для порівняння спотворених часових рядів виживання. Value-at-Risk та Expected Shortfall у фінансах обчислюються за допомогою історичного моделювання, яке є формою bootstrap. Надійність філогенетичних дерев повідомляється як значення підтримки bootstrap, а національні статистичні агентства використовують подібні методи повторних ваг для обробки складних стратифікованих дизайнів опитувань.
Frequently asked questions
Що таке ресемплінг бутстрапу?
Ресемплінг бутстрапу – це обчислювальна техніка, яка повторно витягує зрази зі заміною з спостережуваних даних для наближення розподілу вибірки будь-якої статистики, що дозволяє будувати інтервали довіри без припущень щодо розподілу.
Скільки зразків бутстрапу вам потрібно?
Для грубих оцінок, 200-500 повторних семплів часто достатньо. Для надійних інтервалів довіри у 95% стандартно 1000-2000. Для дуже точних відсотків хвоста, таких як 99% CI, рекомендується 10000 або більше повторних семплів.
Яка різниця між бутстрапом і тестами перестановки?
Ресемплінг бутстрапу оцінює невизначеність навколо оцінки шляхом ресемплінгу зі заміною. Тести перестановки оцінюють статистичну значущість шляхом перемішування міток груп без заміни, створюючи нульовий розподіл для обчислення p-значень. Обидва є методами ресемплінгу, але відповідають на різні питання.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте the simulation і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію the simulation