Теорія ймовірностей почалася як числення результатів азартних ігор (Паскаль, Ферма, Гюйгенс, 1654–1657) і отримала строге аксіоматичне обґрунтування завдяки Колмогорову в 1933 році. Сьогодні це мова, спільна для фізики (квантове вимірювання, статистична механіка), інженерії (виявлення сигналів, надійність), біології (популяційна генетика, секвенування), економіки (ціноутворення опціонів, теорія аукціонів) та комп'ютерних наук (алгоритми, машинне навчання). Цей спотлайт узагальнює шість основних тем, кожну з яких ілюструє інтерактивна симуляція.
1. Розподіли ймовірностей
Розподіл ймовірностей — це функція, яка присвоює ймовірність (або густину ймовірності) кожному можливому результату. Дві основні родини — дискретні (зліченні результати) та неперервні (результати на інтервалі).
Дискретні розподіли
- Біноміальний B(n, p): кількість успіхів у n незалежних випробуваннях Бернуллі, кожне з ймовірністю успіху p. Функція ймовірності: P(X=k) = C(n,k) pk(1−p)n−k. Середнє np, дисперсія np(1−p).
- Пуассона Po(λ): границя біноміального при n→∞, p→0 з фіксованим λ=np. Моделює рідкісні події: радіоактивні розпади на секунду, фотони на піксель, мутації на геном. Функція ймовірності: P(X=k) = e−λλk/k!. Середнє = дисперсія = λ.
- Геометричний Geo(p): кількість випробувань до першого успіху. Без пам'яті: P(X>m+n | X>m) = P(X>n). Середнє = 1/p.
Неперервні розподіли
- Нормальний N(μ, σ²): найважливіший розподіл у статистиці (ЦГТ; див. Розділ 2). Функція густини: f(x) = (1/σ√(2π)) exp(−(x−μ)² / 2σ²). Правило 68–95–99,7: інтервали 1σ/2σ/3σ містять 68 %, 95 %, 99,7 % ймовірнісної маси.
- Експоненційний Exp(λ): час очікування між подіями Пуассона. Без пам'яті, як і геометричний. Функція густини: λe−λx для x≥0. Середнє = 1/λ, дисперсія = 1/λ².
- Бета Beta(α,β): розподіл на [0,1]; використовується як спряжений пріор для пропорцій та ймовірностей. Гнучка форма: рівномірний (α=β=1), U-подібний (α,β<1), дзвоноподібний (α,β>1).
- Гамма Γ(k,θ): узагальнює експоненційний (k=1) та хі-квадрат (χ²=Γ(n/2, 2)) розподіли. З'являється в баєсівській спряженості для швидкостей Пуассона.
Моменти та твірна функція моментів
E[X] = ∫ x f(x) dx (середнє / перший початковий момент)
Var[X] = E[X²] − (E[X])² (дисперсія)
Skew[X] = E[(X−µ)³] / σ³ (асиметрія)
Kurt[X] = E[(X−µ)⁴] / σ⁴ − 3 (надлишковий ексцес)
MGF: M_X(t) = E[e^{tX}]
→ k-й момент = d𝓀M_X/dt𝓀 |_{t=0}
→ Для нормального: M(t) = exp(µt + ½σ²t²)
→ Якщо X,Y незалежні: M_{X+Y}(t) = M_X(t) · M_Y(t)
Центральна гранична теорема
Інтерактивне вибіркове семплування з шести материнських розподілів; гістограма вибіркових середніх збігається до нормального при зростанні n; спостерігайте, як σ/√n зменшується в реальному часі.
Парадокс днів народження
Точна ймовірність p(n) = 1 − 365!/(365−n)!/365^n, підтвердження методом Монте-Карло, інтерактивний повзунок розміру групи, анімація збігу.
2. Закон великих чисел і центральна гранична теорема
Дві фундаментальні теореми про збіжність керують поведінкою вибіркових середніх зі зростанням обсягу вибірки n:
- Слабкий ЗВЧ (Чебишов, 1867): для будь-якого ε>0, P(|X̅−μ|>ε) ≤ σ²/(nε²) → 0 при n→∞. Вибіркове середнє збігається за ймовірністю до генерального середнього.
- Сильний ЗВЧ (Борель, 1909, Колмогоров, 1930): X̅n → μ майже напевно (з ймовірністю 1). Це формальне обґрунтування частотної ймовірності як граничної відносної частоти.
Центральна гранична теорема (ЦГТ) стверджує більше: за умови Ліндеберга (жоден окремий доданок не домінує над дисперсією) нормалізована сума √n(X̅−μ)/σ збігається за розподілом до N(0,1). Примітно, що материнський розподіл може бути дискретним, обмеженим або сильно асиметричним — сума завжди наближається до гаусового.
Центральна гранична теорема
Нехай X₁, X₂, …, X_n н.о.р. з середнім µ, дисперсією σ² < ∞. S_n = X₁ + … + X_n Тоді (S_n − nµ) / (σ√n) → N(0,1) за розподілом Еквівалентно: X̅_n = S_n/n → N(µ, σ²/n) Стандартна похибка середнього: SE = σ / √n → Подвоєння точності вимагає у 4× більше даних
ЦГТ пояснює, чому нормальний розподіл домінує в статистиці: будь-яка величина, що є сумою багатьох малих незалежних внесків, буде приблизно нормальною, незалежно від базового розподілу цих внесків. Це пояснює дзвоноподібну форму помилок вимірювання (Гаусс, 1809), розподіл зросту та показників IQ, а також теплові флуктуації макроскопічних систем.
Обмеження ЦГТ: збіжність може бути повільною для розподілів з важкими хвостами (наприклад, Коші, у якого немає середнього). Теорема Беррі-Ессеена обмежує максимальну похибку в нормальному наближенні як O(n−1/2) з константою, пропорційною асиметрії материнського розподілу.
3. Перевірка гіпотез і p-значення
Частотна перевірка гіпотез запитує: «Якби нульова гіпотеза H0 була істинною, наскільки дивними були б спостережувані дані?» Здивування кількісно виражається p-значенням — ймовірністю спостерігати тестову статистику принаймні настільки ж екстремальну, як спостережена, за умови H0.
Фреймворк Неймана-Пірсона
- H0 (нульова гіпотеза): базове твердження (наприклад, ліки не мають ефекту, два середні рівні).
- Ha (альтернативна): те, що ми сподіваємось встановити (наприклад, ліки знижують кров'яний тиск).
- Тестова статистика: функція даних, що розрізняє H0 від Ha (наприклад, z-оцінка, t-статистика, F-відношення).
- p-значення: P(T ≥ tobs | H0). Мале p-значення означає, що дані малоймовірні за H0. Це не ймовірність того, що H0 істинна.
- α (рівень значущості): поріг, за якого ми відхиляємо H0, зазвичай 0,05 або 0,01 (обирається до перегляду даних).
Типи помилок і статистична потужність
H₀ ІСТИННА H₀ ХИБНА
Відхилити H₀ Помилка I роду α Правильно (потужність = 1−β)
Не відхилити Правильно Помилка II роду β
Потужність = P(відхилити H₀ | H хибна) = 1 − β
Одновибірковий z-тест: z = (X̅ − µ₀) / (σ / √n)
Одновибірковий t-тест: t = (X̅ − µ₀) / (s / √n), df = n − 1
Потужність зростає з: більшим n, більшим розміром ефекту, більшим α, меншим σ
Множинні порівняння
При перевірці m незалежних гіпотез на рівні α, ймовірність принаймні одного хибнопозитивного результату становить 1−(1−α)m, що наближається до 1 зі зростанням m — проблема сімейної частоти помилок (FWER). Рішення включають:
- Поправка Бонферроні: перевіряти кожну гіпотезу на рівні α/m. Консервативна, але точно контролює FWER.
- Процедура Бенджаміні-Хохберга: контролює частку хибних відкриттів (FDR = очікувана частка хибнопозитивних результатів серед відхилень. Менш консервативна; переважна для багатовимірних геномних та зображувальних даних.
Бутстреп-ресемплінг
Непараметричні довірчі інтервали через 1000 бутстреп-вибірок; порівняння з нормальним наближенням; візуалізація вибіркового розподілу медіани, середнього, стандартного відхилення, асиметрії.
Баєсівський висновок
Оновлення пріор → апостеріор зі спряженою моделлю Бета-Біноміальний; візуалізація того, як докази зміщують переконання; порівняння правдоподібного інтервалу з довірчим.
4. Баєсівський висновок
Баєсівський висновок трактує ймовірність як міру ступеня переконання, а не довгострокової частоти. Він забезпечує принциповий механізм оновлення переконань у світлі нових доказів через теорему Байєса:
Теорема Байєса
P(θ | дані) = P(дані | θ) × P(θ) / P(дані) P(θ | дані) = апостеріорний розподіл параметра θ P(дані | θ) = правдоподібність даних за умови θ P(θ) = апріорний розподіл (кодує наявні знання) P(дані) = маргінальна правдоподібність (нормувальна константа) Спряжені пріори — коли пріор і апостеріор належать одній родині: Beta(α, β) + Binomial(n, θ) → Beta(α+k, β+n−k) N(µ₀, σ₀²) + N(θ, σ²) → N(µ_n, σ_n²) (апостеріорний нормальний) Gamma(α, β) + Poisson(θ) → Gamma(α+nλ, β+n)
Правдоподібні інтервали проти довірчих інтервалів
Частотний 95 % довірчий інтервал (ДІ) не означає, що існує 95 % ймовірність того, що θ лежить в інтервалі для поточної вибірки — θ фіксоване (не випадкове у частотному фреймворку). Правильна інтерпретація: якщо ми повторимо експеримент нескінченно багато разів і обчислимо інтервал кожного разу, 95 % таких інтервалів міститимуть істинне θ.
Баєсівський 95 % правдоподібний інтервал означає саме те, що каже: P(θ ∈ ПІ | дані) = 0,95. Це, як правило, більш природна інтерпретація для практиків.
Ланцюги Маркова Монте-Карло (MCMC)
Для складних моделей, де апостеріорний розподіл не можна обчислити аналітично, алгоритми MCMC генерують вибірки з апостеріорного розподілу. Алгоритм Метрополіса-Гастінгса пропонує кандидата θ′ з пропозиційного розподілу q(θ′|θ), потім приймає з ймовірністю min(1, [p(θ′|дані) q(θ|θ′)] / [p(θ|дані) q(θ′|θ)]). За багато ітерацій ланцюг збігається до цільового апостеріорного розподілу. Сучасні варіанти (HMC, NUTS) використовують інформацію про градієнт для пропозиції більш ефективних кроків у високовимірних просторах параметрів.
5. Ланцюги Маркова та стаціонарні розподіли
Дискретний ланцюг Маркова — це послідовність випадкових величин X0, X1, … з марковською властивістю: P(Xn+1=j | Xn=i, Xn−1, …, X0) = Pij — наступний стан залежить лише від поточного стану.
Матриця переходу та стаціонарний розподіл
Матриця переходу P: P_ij = P(X_{n+1}=j | X_n=i), ∑_j P_ij = 1
n-кроковий перехід: P^n_ij = P(X_n=j | X_0=i) (степінь матриці)
Рівняння Чепмена-Колмогорова: P^{m+n} = P^m · P^n
Стаціонарний розподіл π: π P = π, ∑_i π_i = 1
→ розв'язати (P^T − I) π^T = 0 за умови ∑π_i = 1
Детальний баланс (для оборотних ланцюгів): π_i P_ij = π_j P_ji
→ достатньо, але не необхідно, щоб π було стаціонарним
PageRank
Оригінальний алгоритм PageRank від Google (Брін і Пейдж, 1998) моделює випадкового відвідувача веб-графа. На кожній сторінці відвідувач переходить за випадковим посиланням з ймовірністю d (≈ 0,85) або телепортується на випадкову сторінку з ймовірністю 1−d. Стаціонарний розподіл цього ланцюга Маркова присвоює вищу ймовірність сторінкам, на які посилаються інші сторінки з високою ймовірністю. Ранжувальний вектор — це провідний власний вектор модифікованої матриці суміжності.
Степенева ітерація PageRank
PR_i = (1 − d)/N + d · ∑_{j→i} PR_j / L_j
d = коефіцієнт затухання (≈ 0,85)
N = загальна кількість сторінок
L_j = кількість вихідних посилань зі сторінки j
Ітерується до збіжності: почати з рівномірного PR_i = 1/N
Степенева ітерація оновлює всі PR одночасно на кожному кроці
Критерій збіжності: ||PR_{new} − PR_{old}||₁ < 10⁻⁶
6. Оцінка максимальної правдоподібності та поширення похибок
Оцінка максимальної правдоподібності (MLE) знаходить значення параметра θ̂, яке робить спостережувані дані найбільш ймовірними за припущеної моделі: θ̂ = arg max θ L(θ; x) де L(θ; x) = P(X=x; θ) — функція правдоподібності. На практиці ми максимізуємо log L (логарифм правдоподібності) для чисельної стійкості.
MLE, інформація Фішера та межа Крамера-Рао
Функція оцінки: s(θ) = d/dθ log L(θ; x)
Умова MLE: s(θ̂) = 0
Інформація Фішера: I(θ) = −E[d²/dθ² log L(θ)]
= E[s(θ)²]
Межа Крамера-Рао: Var(θ̂) ≥ 1/I(θ) / n
→ MLE асимптотично ефективна: Var(θ̂_MLE) → 1/I(θ)/n
Поширення похибок (дельта-метод):
Якщо g(θ) — гладка функція θ:
Var(g(θ̂)) ≈ [g'(θ)]² · Var(θ̂)
Критерій узгодженості хі-квадрат:
χ² = ∑_i (O_i − E_i)² / E_i, df = кількість інтервалів − 1 − оцінені параметри
MLE — метод вибору, коли правдоподібність піддається аналізу; вона узгоджена (збігається до істинного значення при n→∞), асимптотично нормальна та досягає межі Крамера-Рао за умов регулярності. Коли правдоподібність не піддається аналізу, баєсівські методи зі спряженими пріорами або варіаційний висновок надають обчислювально доступні альтернативи.
Центральна гранична теорема
Шість материнських розподілів (рівномірний, експоненційний, бімодальний, Бернуллі, Пуассона, Парето). Гістограма X̅ оновлюється в реальному часі при надходженні вибірок; показано огинаючу σ/√n.
Баєсівський висновок
Бета-пріор на чесність монети; панелі густини пріора, правдоподібності, апостеріорної густини; порівняння правдоподібного інтервалу з частотним ДІ, режим послідовного оновлення.
Статистика як епістемічна інфраструктура
Від парадоксу днів народження (який дивує більшість людей, оскільки людська інтуїція значно недооцінює ймовірності збігу) до p-хакінгу та кризи відтворюваності (що виникають через нерозуміння того, що означають p-значення), статистика має репутацію того, що легко застосувати неправильно. Інструменти цього спотлайту — строга теорія розподілів, ЦГТ, ретельна перевірка гіпотез, баєсівське оновлення та належне поширення похибок — є протиотрутою.
Інтерактивні симуляції дозволяють спостерігати збіжність ЦГТ у реальному часі з материнськими розподілами з важкими хвостами, досліджувати, як баєсівський пріор вимивається достатньою кількістю даних, та розвивати інтуїцію щодо того, чому більше даних завжди покращує оцінки зі швидкістю √n. Статистична грамотність є фундаментальною для кожної кількісної дисципліни; ці концепції з'являються як у невизначеності квантових вимірювань, генетичних асоціативних дослідженнях, значущості виявлення гравітаційних хвиль, так і в межах узагальнення глибокого навчання.