Co rzeczywiście twierdzi przedział ufności
Przedział ufności to zakres prawdopodobnych wartości dla niewiadomego parametru populacji, stworzony na podstawie danych próbowych, dołączony do poziomu ufności takiego jak 95%. Najczęstsza błąd interpretacji polega na traktowaniu przedziału ufności o poziomie 95% jako „istnieje 95% szans, że prawdziwy parametr znajduje się w tym konkretnym zakresie”. Ta interpretacja jest niepoprawna już po tym, jak przedział został obliczony na podstawie konkretnej próby — prawdziwy parametr populacji jest ustaloną (ale niewiadomą) liczbą, a dowolny wyliczony przedział albo go zawiera, albo nie.
Poprawna interpretacja dotyczy procedury, a nie konkretnego przedziału: jeśli powtórzylibyśmy proces próbkowania wielokrotnie i budowalibyśmy przedziały ufności w ten sam sposób w każdym razie, około 95% tych przedziałów zawierałoby prawdziwy parametr populacji. Ta właściwość częstotliwości długoterminowej nazywana jest pokryciem i najlepiej jest ona zrozumiana wizualnie, a nie słownie.
Tworzenie przedziału ufności z-i dla średniej
Gdy odchylenie standardowe populacji σ jest znane (lub, co bardziej powszechnie w praktyce, duża próba pozwala podstawić wariancję próbową s bez znacznego utraty dokładności), przedział ufności dla średniej populacji μ tworzy się jako
x̄ ± z* · (σ / √n)
gdzie x̄ to średnia próbowa, n to wielkość próby, a z* to krytyczna wartość rozkładu normalnego standardowego odpowiadająca wybranemu poziomowi ufności: 1.645 dla 90% ufności, 1.96 dla 95% ufności i 2.576 dla 99% ufności. Liczba σ/√n to błąd standardowy średniej, a powinna być znana — jest dokładnie odchyleniem standardowym rozkładu próbowego x̄ zapewnionym przez Twierdzenie o granicy centralnej. To jest podstawowa przyczyna, dla której przedziały ufności opierają się na CLT: cała konstrukcja zakłada, że x̄ jest blisko normalnie rozłożone wokół μ, co CLT uzasadnia nawet gdy populacja podstawowa sama nie jest normalna, przy warunku, że próba jest odpowiednio duża.
Wizualizacja okrywania poprzez powtarzane losowanie
Najjednoznaczniejszy sposób na zrozumienie, co obiecuje przedział ufności, polega na jego bezpośrednim symulowaniu. Ustal znany średnią populacji μ (co nigdy nie wiesz w rzeczywistym badaniu, ale możesz ustawić dowolnie podczas symulacji), a następnie powtarzająco losuj próbki o rozmiarze n, oblicz 95% przedział ufności dla każdej próbki i rysuj każdą z tych interwałów jako pionową linię odcinka, stosując ją jeden nad drugim, z pionową referencyjną linią oznaczającą prawdziwy μ. W takiej wizualizacji niektóre przedziały całkowicie nie okrywają prawdziwej średniej — a najważniejsze, po wielokrotnym powtarzaniu symulowanego losowania, około 95% z rysowanych przedziałów przecina referencyjną linię, podczas gdy około 5% nie robi tego. Ta proporcja, a nie szerokość ani pozycja żadnego jednego przedziału, jest tym, co „95% pewność” rzeczywiście opisuje, i tylko zbiega do dokładnej 95% wraz ze wzrostem liczby powtarzanych próbek, co jest jeszcze jednym wyrażeniem zasady liczb dużych.
Test z-i: użycie tej samej metodyki do sprawdzenia hipotezy
Test z-i pyta o pokrewny, ale inny problem: czy średnia próbki obserwowana jest zgodna z pewną konkretne hipotezowana średnią populacji μ0, czy jest ona wystarczająco oddalona, aby podważyć tę hipotezę? Statystyk testowy ma postać
z = (x̄ − μ0) / (σ / √n)
która pomiaruje, ile standardowych odchyleń standardowych odległa jest średnia próbki obserwowana od wartości hipotezy. Pod warunkiem nulowej hipotezy, że μ rzeczywiście równe jest μ0, ten statystyk z ma rozkład normalny standardowy, ponownie na podstawie Twierdzenia o Granicznym Przylęce. Wynikowany wartość p to prawdopodobieństwo obserwacji statystyki z co najmniej tak ekstremalnej jak ta obliczona, jedynie przypadkowo, gdyby nulowa hipoteza była rzeczywiście prawdziwa. Jeśli ta wartość p spadnie poniżej poziomu istotności wybranego na początku (często 0,05), wynik nazywa się statystycznie istotny i nulowa hipoteza jest odrzucona w przesłuchaniu alternatywy.
Zasady do uniknięcia zazwyczaj błędnego rozumienia
Warto unikać myślenia, że wartość p równa 0,03 oznacza, że istnieje 3% szans, iż hipoteza zerowa jest prawdziwa, ani 97% szans, iż alternatywna hipoteza jest prawdziwa; jest to zasada dotycząca tego, jak niezwykłe byłyby dane obserwacyjne, gdyby założono hipotezę zerową jako prawdą od początku — a ta niewielka, ale ważna różnica, ponieważ mówi ona absolutnie nic bezpośrednio o samym prawdopodobieństwie żadnej z tych hipotez. Podobnie, „statystycznie istotne” nie jest takie samo jak „praktycznie ważne”: przy wystarczająco dużej próbie, nawet najmniejsza i praktycznie bez znaczenia różnica od μ0 może wygenerować bardzo małą wartość p, ponieważ błękitny błąd zmniejsza się wraz z rosnącą n, czyniąc test coraz bardziej czuły na drobne odchylenia. Przedstawienie zarówno przedziału ufności, jak i wartości p obok siebie jest ogólnie lepszą praktyką niż jedno z nich samodzielnie, ponieważ przedział bezpośrednio przekazuje miarę i dokładność efektu, podczas gdy wartość p przekazuje tylko, czy ten efekt przekroczył pewien ustalony próg istotności.
Gdzie te narzędzia pojawiają się w finansach i medycynie
W badaniach klinicznych, przedziały ufności dla różnicy wyników między grupami leczniczymi a kontrolnymi są standardowym sposobem oceny regulatorów i lekarzy zarówno wielkości, jak i wiarygodności efektu leczenia, a test z-i (lub jego wariant maślanego próby, t-test) jest typowo formalną statystyczną metodą za tą wynikową informacją badania. W finansach kwantyfikacyjnych przedziały ufności są używane do ograniczania szacunków takich jak oczekiwane zwroty portfelu lub Value-at-Risk, podczas gdy testy z-i i ich warianty stanowią podstawę ram A/B testinga wykorzystywanych do decyzji, czy zmiana strategii handlowej, modelu cenowego lub projektu strony internetowej przyniosła rzeczywistą poprawę, a nie jedynie efekt szumu losowego próbkowania. W obu dziedzinach podstawowa logika jest identyczna z przykładami monet i kubka z kawą używanymi do nauczania metody: to Twierdzenie graniczne centralne, zastosowane do średniej lub proporcji, sprawia, że cała te technologia jest prawidłowa.
Często zadawane pytania
Jak się różnią test Z i test t?
Test Z zakłada, że odchylenie standardowe populacji σ jest znane i wykorzystuje rozkład normalny dla swoich wartości krytycznych. Test t jest używany, gdy σ jest nieznane i musi być szacowane na podstawie próby, co wprowadza dodatkową niepewność; używa się rozkładu t o nieco szerzej zakończeniach zamiast rozkładu normalnego, a różnica między tymi dwoma rozkładami zmniejsza się wraz z wzrostem wielkości próby.
Czy szerszy przedział ufności oznacza mniej wiarygodny estymator?
Oznacza to mniej precyzji, niekoniecznie mniej wiarygodności. Szerszy przedział na tym samym poziomie ufności (np. 95%) zwykle odbiera mniejszą wielkość próby lub bardziej zmienną podstawową danych, co powoduje wzrost błędu standardowego. Poziom ufności (95% w stosunku do 99%) jest osobnym wyborem: przedział 99% zawsze jest szerzej niż przedział 95% zbudowany na tej samej próbie, ponieważ jest zaprojektowany tak, aby miał wyższy długoterminowy sukces w złapaniu prawdziwej wartości parametru.
Może przedział ufności być użyty do przetestowania hipotezy?
Tak, i te dwie metody są matematycznie połączone. Dwastronowy test hipotez o poziomie istotności α odmawia zerowej hipotezy μ = μ0 dokładnie wtedy, gdy μ0 leży poza odpowiednim (1 − α) przedziałem ufności zbudowanym na tej samej próbie, więc 95% przedział ufności i test Z o poziomie istotności 0,05 zawsze będą zgadzać się w odmawianiu danej hipotezy.
Dlaczego powiększanie wielkości próby uciążliwieje przedział ufności?
Bo błąd standardowy σ/√n pojawia się bezpośrednio w szerokości przedziału, a zanika wraz ze wzrostem n, zgodnie z odwrotnie proporcjonalną zależnością: czterokrotny podwójenie wielkości próby zmniejsza szerokość przedziału o połowe (zachowując poziom ufności), a sto razy większa wielkość próby tylko uciążliwieje ją o czynnik dziesiętny, ilustrując dlaczego zbieranie coraz większych próbek ma dla precyzji ograniczone zwracanie się.
▶ Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Confidence Intervals, the Z-Test, and What "Coverage" Really Means i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.