Strona główna Statystyka Regresja do średniej

📉 Regresja do średniej

Wybierz skrajne wyniki ze skorelowanej pary pomiarów i obserwuj, jak kolejne dryfują ku średniej: pułapka stojąca za wieloma sportowymi klątwami.

Statystyka2DŁatwy60 FPS
regression-to-mean ↗ Otwórz osobno
Interfejs samej symulacji jest w języku angielskim.

O tej symulacji

Ta symulacja generuje N par skorelowanych wyników (x, y) z dwuwymiarowego rozkładu normalnego o korelacji ρ, wykorzystując transformację Boxa-Mullera do wygenerowania standardowych losowań normalnych oraz y = ρ·x + √(1−ρ²)·z. Następnie wybiera najlepiej wypadający wycinek pod względem X (według progu %) i pokazuje, jak ich średni wynik Y cofa się w stronę średniej populacji — prawdziwe zjawisko statystyczne stojące za sportowymi zapaściami, efektami placebo w medycynie i błędnymi ocenami programów.

🔬 Co pokazuje

Wykres punktowy (lub histogram) wyników okresu 1 względem okresu 2 dla maksymalnie 600 symulowanych osób, z najlepszymi X% wynikami na X podświetlonymi na żółto. Fioletowa linia przedstawia prawdziwą warunkową wartość oczekiwaną E[Y|X] = ρ·X, szara przerywana linia oznacza Y=X dla porównania, a czerwona strzałka pokazuje lukę między średnim X wybranej grupy a jej rzeczywistym średnim Y — sam efekt regresji.

🎮 Jak korzystać

Przeciągnij Korelację ρ (od −1 do 1), aby zmienić siłę zależności między wynikami okresu 1 i okresu 2, Rozmiar próby N (30–600), aby zmienić liczbę losowanych punktów, oraz Próg selekcji (5–50%), aby zmienić, jak ekstremalna jest podświetlona grupa. Przełączaj między widokami Wykres punktowy, Histogram i Wszystko, naciśnij Resampluj, aby uzyskać nowe losowe losowanie, lub wczytaj gotowe presety Klątwa sportowa, Medycyna i Brak korelacji, aby zobaczyć wstępnie skonfigurowane przykłady tego efektu.

💡 Czy wiesz, że?

Francis Galton po raz pierwszy udokumentował ten efekt w 1886 roku, badając wzrost rodziców i dzieci, nazywając go „regresją ku przeciętności” — stąd pochodzi słowo „regresja” w statystyce. Gdy ρ = 0 (preset Brak korelacji), dowolna grupa wybrana ze względu na ekstremalne wyniki X regresuje całkowicie z powrotem do średniej populacji na Y, ponieważ oba pomiary nie mają ze sobą żadnego rzeczywistego związku.

Najczęściej zadawane pytania

Jak symulacja właściwie generuje skorelowane dane?

Losuje dwie niezależne standardowe wartości normalne z1 i z2 za pomocą transformacji Boxa-Mullera, ustawia x = z1, a y = ρ·z1 + √(1−ρ²)·z2. Jest to standardowa konstrukcja pary dwuwymiarowej normalnej o korelacji ρ: gdy ρ jest bliskie 1, y niemal dokładnie podąża za x, a gdy ρ jest bliskie 0, y jest zasadniczo niezależnym szumem.

Jak obliczana jest „wybrana” grupa i strzałka regresji?

Symulacja sortuje wszystkie N punktów według malejącej wartości X i pobiera górny wycinek zdefiniowany suwakiem Progu selekcji (5–50%). Następnie oblicza średnie X i średnie Y tej grupy oraz rysuje czerwoną strzałkę od punktu (avgX, avgX) na linii tożsamości Y=X w dół do rzeczywistego punktu (avgX, avgY) — wizualnie pokazując, jak bardzo rzeczywista średnia Y grupy nie dorównuje jej zawyżonej średniej X.

Dlaczego niższa korelacja ρ powoduje silniejszą regresję do średniej?

Fioletowa linia regresji narysowana na wykresie punktowym to E[Y|X] = ρ·X, więc jej nachylenie wynosi dokładnie ρ. Przy ρ = 1 ta linia pokrywa się z Y=X i nie ma żadnej regresji; w miarę zmniejszania się ρ w stronę 0, linia spłaszcza się w stronę poziomej, co oznacza, że dowolna ekstremalna wartość X przewiduje wartość Y ściągniętą niemal całkowicie z powrotem do ogólnej średniej równej zero.

Co modelują presety Klątwa sportowa, Medycyna i Brak korelacji?

Klątwa sportowa ustawia ρ = 0,5, N = 300 i wąski 10% próg selekcji, naśladując sytuację, w której medialną uwagę zdobywają tylko naprawdę wybitne jednosezonowe występy, które w kolejnym sezonie mocno regresują. Medycyna wykorzystuje ρ = 0,7, N = 150 i próg 30%, bliżej sytuacji, w której pacjenci decydujący się na leczenie w szczycie objawów naturalnie poprawiają się później. Brak korelacji ustawia ρ = 0, pokazując skrajny przypadek, w którym wybrani wykonawcy regresują całkowicie do średniej populacji.

Czy pokazany tu efekt regresji jest prawdziwym efektem przyczynowym, czy artefaktem?

Jest to statystyczny artefakt selekcji na podstawie jednego zaszumionego pomiaru, a nie rzeczywista siła ściągająca wyniki w dół. Sam panel informacyjny symulacji stwierdza to wprost: dowolny ekstremalny wynik częściowo odzwierciedla prawdziwe umiejętności, a częściowo szczęście, a ponieważ szczęście z definicji się nie powtarza, kolejny pomiar naturalnie wygląda bardziej przeciętnie, mimo że nic w rzeczywistych umiejętnościach się nie zmieniło. Właśnie dlatego model oblicza statystykę „Regresja %” zamiast przypisywać zmianę jakiejkolwiek rzeczywistej interwencji.

Najczęściej zadawane pytania

Czym jest regresja do średniej?

Regresja do średniej to zjawisko statystyczne, w którym ekstremalne pomiary jednej zmiennej mają tendencję do bycia następowanymi przez mniej ekstremalne pomiary drugiej, skorelowanej zmiennej. Zostało po raz pierwszy opisane przez Francisa Galtona w 1886 roku podczas badania wzrostu rodziców i dzieci.

Dlaczego zachodzi regresja do średniej?

Dzieje się tak, ponieważ ekstremalne wyniki są częściowo wynikiem przypadku (szumu). Wybierając ekstremalne wartości w jednym pomiarze, wybieramy też ponadprzeciętne szczęście. W kolejnym pomiarze szczęście będzie prawdopodobnie bliższe przeciętnemu, ciągnąc wynik z powrotem w stronę średniej. Wzór matematyczny to E[Y|X=x] = μ_Y + ρ·(σ_Y/σ_X)·(x − μ_X).

Czym jest „klątwa sportowa” i jak wyjaśnia ją regresja?

„Klątwa Sports Illustrated” (lub „zapaść drugiego sezonu”) opisuje sportowców, którzy osiągają wyjątkowe wyniki, zdobywają sławę, a następnie wydają się podupadać. W rzeczywistości ich pierwszy występ był częściowo szczęściem, a drugi jest bliższy ich prawdziwym umiejętnościom. To regresja do średniej, a nie prawdziwa klątwa, w pełni wyjaśnia ten wzorzec.

Jak korelacja ρ wpływa na regresję do średniej?

Siła regresji do średniej zależy bezpośrednio od korelacji ρ. Gdy ρ = 1 (idealna korelacja), nie ma żadnej regresji — drugi pomiar jest dokładnie równy pierwszemu. Gdy ρ = 0 (brak korelacji), drugi pomiar jest całkowicie niezależny, a ekstremalne pierwsze wyniki zawsze regresują całkowicie z powrotem do średniej populacji.

Gdzie regresja do średniej występuje w medycynie?

Pacjenci często szukają leczenia, gdy objawy są najsilniejsze. Nawet bez leczenia objawy miałyby tendencję do poprawy z powodu regresji do średniej. Dlatego badania kliniczne potrzebują grup kontrolnych — pozorna poprawa po leczeniu może być po prostu regresją, a nie prawdziwym efektem leku.

Czym jest dwuwymiarowy rozkład normalny?

Dwuwymiarowy rozkład normalny opisuje dwie łącznie normalnie rozłożone zmienne losowe X i Y ze średnimi μ_X, μ_Y, odchyleniami standardowymi σ_X, σ_Y i współczynnikiem korelacji ρ. Warunkowa wartość oczekiwana E[Y|X=x] tworzy linię prostą, a nachylenie ρ·(σ_Y/σ_X) określa stopień regresji.

Czy regresja do średniej może prowadzić do błędnych wniosków w badaniach?

Tak. Jeśli badacze wybiorą najsłabszych uczniów do interwencji, a następnie zaobserwują poprawę, ta poprawa może wynikać wyłącznie z regresji do średniej, a nie z samego programu. Projekty typu przed-po bez grup kontrolnych są szczególnie podatne na ten czynnik zakłócający.

Jak regresja do średniej wiąże się z regresją liniową?

Termin „regresja” w regresji liniowej pochodzi bezpośrednio z pierwotnej pracy Galtona nad regresją do średniej. Zauważył on, że linia najlepszego dopasowania łącząca wzrost rodziców ze wzrostem dzieci miała nachylenie mniejsze niż 1, co pokazywało, że wysocy rodzice mieli dzieci bliższe przeciętnemu wzrostowi niż oni sami.

Czy regresja do średniej działa tylko w dół?

Nie. Regresja do średniej działa symetrycznie: bardzo niskie wyniki zmiennej X mają tendencję do bycia następowanymi przez mniej ekstremalne (wyższe) wyniki Y. Jeśli wybierzesz najsłabszych uczniów, będą mieli tendencję do poprawy — nie z powodu swojego wysiłku, ale dlatego, że ich słaby początkowy wynik zawierał pecha.

Jak uniknąć wprowadzenia w błąd przez regresję do średniej?

Stosuj randomizowane badania kontrolowane z odpowiednimi grupami kontrolnymi. Unikaj wybierania uczestników na podstawie ekstremalnych wyników wstępnych bez uwzględnienia efektów regresji. Stosuj metody statystyczne, które jawnie modelują błąd pomiaru, takie jak korekta rozcieńczenia regresji lub modele równań strukturalnych.

⚙ Pod maską

Wybierz skrajne wyniki ze skorelowanej pary pomiarów i obserwuj, jak kolejny pomiar dryfuje z powrotem ku średniej — pułapka stojąca za wieloma sportowymi klątwami.

regression to the meanGaltoncorrelationsports cursestatisticsbivariate normal

3D · Three.js / WebGL renderer · 60 FPS target · runs fully client-side, no install

Podobne symulacje