Центральна гранична теорема: доведення та наслідки
Киньте кубик тисячу разів і підсумуйте результати — сума виглядає нормально розподіленою, незалежно від того, наскільки «нерівний» розподіл однієї кидки. Ми доведемо чому, використовуючи характеристичні функції, кількісно оцінимо швидкість збіжності за допомогою нерівності Беррі-Ессеена (формули, яка дає найгіршу можливу різницю між реальним розподілом суми та нормальною кривою при скінченному n) та симулюємо процес на JavaScript.
1. Формулювання теореми
Нехай X₁, X₂, …, Xₙ — незалежні однаково розподілені (н.о.р.) випадкові величини зі скінченним математичним сподіванням μ та скінченною дисперсією σ² > 0. Визначимо стандартизовану суму:
Центральна гранична теорема Ліндеберга-Леві стверджує, що при n → ∞, Zₙ збігається за розподілом до стандартного нормального розподілу:
Разюче: це справджується незалежно від форми вихідного розподілу Xᵢ — він може бути рівномірним, експоненційним, розподілом однієї грані кубика чи сильно скошеним — доки дисперсія скінченна.
2. Характеристичні функції
Доведення спирається на характеристичну функцію випадкової величини X, що визначається як φX(t) = E[eitX]. Два факти роблять її правильним інструментом:
- Характеристична функція суми незалежних випадкових величин дорівнює добутку їхніх характеристичних функцій: φX+Y(t) = φX(t)·φY(t).
- (Теорема неперервності Леві) Поточкова збіжність характеристичних функцій до функції, неперервної в нулі, означає збіжність за розподілом відповідних випадкових величин.
Це перетворює складну задачу про розподіли на просту задачу про звичайні границі комплекснозначних функцій.
3. Схема доведення (ЦГТ Ліндеберга-Леві)
Без обмеження загальності припустимо μ = 0 (віднімемо середнє) і σ² = 1 (масштабуємо). Нехай Y = X/σ, тоді E[Y]=0, E[Y²]=1. Характеристична функція Y допускає розклад Тейлора біля t = 0:
= 1 − t²/2 + o(t²) // оскільки E[Y]=0, E[Y²]=1
Характеристична функція стандартизованої суми Zₙ = (1/√n) Σ Yᵢ, використовуючи правило добутку для незалежних величин і властивість масштабування φaX(t) = φX(at):
= [ 1 − t²/(2n) + o(1/n) ]ⁿ
Тепер візьмемо границю при n → ∞. Це точно класична форма границі (1 + x/n)ⁿ → eˣ з x = −t²/2:
Але e−t²/2 — це точно характеристична функція стандартного нормального розподілу N(0,1). За теоремою неперервності Леві, оскільки ця гранична функція неперервна в t = 0, Zₙ збігається за розподілом до N(0,1). ∎
4. Швидкість збіжності: Беррі-Ессеен
ЦГТ каже, що збіжність настане врешті-решт — теорема Беррі-Ессеена кількісно оцінює, наскільки швидко, використовуючи третій абсолютний момент ρ = E[|Y|³]:
де Φ — стандартна нормальна функція розподілу, а C — абсолютна константа (відомо, що C ≤ 0.4748). Оцінка зменшується як 1/√n — збіжність гарантована, але повільна: щоб зменшити максимальну похибку вдвічі, потрібно у 4 рази більше вибірок.
| Вихідний розподіл | n для «візуально нормальної» гістограми | Чому |
|---|---|---|
| Один чесний кубик | ~10–20 | Симетричний, обмежений, мале ρ |
| Exponential(λ) | ~30–50 | Скошений, помірне ρ |
| Важкохвостий (скінченне, але велике ρ) | сотні–тисячі | Великий третій момент сповільнює збіжність |
5. Наслідки для статистики
- Довірчі інтервали: вибіркове середнє X̄ₙ наближено має розподіл N(μ, σ²/n), що обґрунтовує звичний 95% ДІ X̄ₙ ± 1.96·s/√n навіть коли генеральна сукупність не є нормальною.
- t-тести та z-тести: перевірка гіпотез про середні спирається на ЦГТ для наближення вибіркового розподілу тестової статистики, тому вони залишаються валідними для помірно ненормальних даних при достатньо великому n.
- Похибка вимірювання: якщо спостережувана похибка є сумою багатьох малих незалежних внесків (шум приладу, округлення, зовнішнє тремтіння), ЦГТ пояснює, чому похибки вимірювань так часто на практиці виявляються приблизно нормальними.
- Стандартна похибка Монте-Карло: похибка оцінки Монте-Карло, побудованої з n незалежних вибірок, зменшується як σ/√n — прямий наслідок ЦГТ, застосованої до вибіркового середнього.
6. JavaScript: симуляція суми кубиків
Сума одного рівномірного кубика (значення 1–6, сам собою далекий від нормального) вже виглядає разюче дзвоноподібно вже після кількох кубиків:
// Сума `k` чесних кубиків, повторена `trials` разів, розбита на гістограму.
function rollDie() { return 1 + Math.floor(Math.random() * 6); }
function diceSumHistogram(k, trials) {
const hist = {};
for (let t = 0; t < trials; t++) {
let sum = 0;
for (let d = 0; d < k; d++) sum += rollDie();
hist[sum] = (hist[sum] || 0) + 1;
}
return hist;
}
// Порівнюємо емпіричне середнє/дисперсію з передбаченням ЦГТ: mean = k*3.5, var = k*35/12
function cltCheck(k, trials) {
const hist = diceSumHistogram(k, trials);
let mean = 0;
for (const sum in hist) mean += Number(sum) * hist[sum];
mean /= trials;
let variance = 0;
for (const sum in hist) variance += hist[sum] * (Number(sum) - mean) ** 2;
variance /= trials;
return { mean, variance, predictedMean: k * 3.5, predictedVariance: k * 35/12 };
}
console.log(cltCheck(10, 100000));
// { mean: ~35.0, variance: ~29.17, predictedMean: 35, predictedVariance: 29.166... }
📈 Спостерігайте ЦГТ у дії
Сумуйте кидки кубиків наживо та дивіться, як гістограма збігається до нормального розподілу.