Planowanie wielkości próby przypada przed zbieraniem danych, nie po nim
Moc statystyczna to prawdopodobieństwo, że badanie zidentyfikuje rzeczywisty efekt danego rozmiaru, jeśli taki efekt istnieje naprawdę, i zależy od wielu czynników, w tym od wielkości próby, oczekiwanej wielkości efektu, naturalnej zmienności wyniku oraz poziomu istotności wybranego. Badanie przeprowadzone z zbyt małą liczbą kolonii ryzykuje niekonsekwentnych wyników nawet wtedy, gdy rzeczywisty efekt traktamentu istnieje, spowodując utratę pracy polowej na badaniu, które nigdy nie było w stanie wykryć tego, czego się podstawiło; badanie przeprowadzone z znacznie większą liczbą kolonii niż potrzebna jest kosztem zasobów, które mogłyby odpowiedzieć na drugie pytanie zamiast tego.
Analiza mocowości wykonywana przed rozpoczęciem zbierania danych konwertuje to zahadane przypuszczenia na jasne i dowodzone decyzje: podaną realistyczną szacunek zmienności (często pochodzi on od studia pilotowego lub poprzednich publikacji) oraz najmniejszą wielkość efektu, która byłaby praktycznie znacząca do wykrycia, analiza mocowości zwraca minimalną wielkość próby potrzebną do uzyskania racjonalnej pewności, zwykle doceniając 80 procent moc na konwencjonalnym poziomie istotności.
Projekt próbkowania dla ankiestr poprawności apiarniczych
Gdzie celem nie jest kontrolowany eksperyment, ale reprezentatywna ankia, na przykład szacowanie średniej straty colonies przez zimną węgielna na danym obszarze, ramka próbkowania (lista lub metoda wykorzystywana do identyfikacji możliwych uczestników) determinuje, czy wnioski mogą być generalizowane. Ankieta ograniczona do apiarniców aktywnych w konkretnym forum internetowym systematycznie nadrepresentuje bardziej zaangażowanych, często bardziej doświadczonych apiarników, a jej wyniki nie można bezpiecznie generalizować na całą populację apiarniczą nawet jeśli wielkość próby jest duża.
Próbkowanie stratyfikowane, które dzieli docelową populację na sensowne grupy (na podstawie regionu, wielkości operacji lub poziomu doświadczenia) i próbuje proporcjonalnie w każdym z nich, produkuje bardziej reprezentatywne i dokładniejsze szacunki niż prosta losowa próba z niekompletnej listy, szczególnie gdy te stratafikacje różnią się znacznie względem wyniku mierzonego. Jasne dokumentowanie ramki próbkowania, stopy odpowiedzi oraz dowolnych znanych białości w końcowym raporcie pozwala czytelnikom ocenić samodzielnie jak daleko wnioski mogą być generalizowane.
Z rawych danych do dowodzenia statystycznego modelu
Przejście przez przejrzysty proces statystyczny zaczyna się od sprawdzeń eksploracyjnych: rysowaniu rawych danych przed jakimkolwiek modelowaniem, sprawdzaniu istnienia wygganów, brakujących wartości i jasnych błędów wprowadzania danych, a także potwierdzaniu kształtu rozkładu zmiennej wynikowej. Wybór statystycznego modelu powinien zależeć od struktury danych, a nie znanie konkretnego testu; dane liczebne, takie jak spadek pszczoły, zwykle wymagają innego rodziny modeli niż ciągłe i prawie normalne dane, takie jak waga kolonii, a powtarzające się pomiary na tej samej koloniach podczas sezonu wymagają modelu, który uwzględnia to niezależność, co zwykle oznacza model mieszanej efektywności z kolonią lub beczką jako czynny losowy efekt.
Wszystkie założenia każdego modelu powinny być sprawdzane po dopasowaniu, a nie przyjmowane za prawdziwe: wykresy residua, sprawdzenie nadwrażliwości w modelach liczebnych i testy jednorodności wariancji zajmują tylko kilka minut, ale zidentyfikowują problemy, które inaczej mogłyby prowadzić do fałszywych wartości p. Gdzie są naruszone założenia, transformacja, różny rodzaj modelu lub alternatywna nieparametryczna metoda powinny być dokonane jako świadomie zrobione wybory, a nie mówiące się do zastosowania.
Zaprezentowanie wyników w sposób wspierający powtórne analizy
Reproducibilny raport statystyczny nie zawiera tylko wartości p końcowej, ale również wielkości efektu z przedziałem ufności, dokładnej specyfikacji modelu użytego oraz wersji oprogramowania i pakietów, ponieważ wartość p sama w sobie mówi prawie nic o praktycznym rozmiarze ani wiarygodności efektu. Publikacja skryptu analizy razem z manuskryptem, idealnie kontrolowanym w wersjach, pozwala innych badaczy zweryfikować dokładne kroki podjęte i dostosować tę samą metodologię do własnych danych.
Wielokrotne porównania wymagają szczególnej opieki w badaniach apiarniczych, gdzie często badane są wiele wyników (liczba pszczoł, waga kolonii, powierzchnia jajowiska, produkcja miodu) jednocześnie; bez korekcji dla wielokrotnej testacji, co najmniej jedno z kilku niezależnych testów będzie statystycznie znaczącego poziomu przypadkowo około raz na dwadzieścia, a to powinno być jasno rozpatrywane, czy poprzez formalną metodę korekcji, czy przez wyraźne oddzielenie podmiotowych wyników główne od eksploracyjnych dodatkowych.
Często zadawane pytania
Jaką wielkość efektu powinienem użyć podczas planowania analizy mocy, jeśli nie mam danych pilotowych?
W braku danych pilotowych, publikowane estymaty z podobnych badań lub konserwatywnych próg znaczących praktycznie (na przykład najmniejsza różnica w wydajności, która rzeczywiście zmienia zalecenia zarządcze) są odpowiednim podstawieniem, a założenie powinno być jasno zaznaczone w sekcji metod.
Dlaczego nie mogę przeprowadzić ankiety tylko wśród owczarek, którzy odwiedzili moje ogłoszenie online?
Przydatne próby wybrane zgodnie z social media lub odpowiedzi na forum systematycznie nadstawiają bardziej zaangażowanych lub połączonego z grupą owczarek, więc wnioski wyciągane z nich nie mogą być bezpiecznie ogólne dla większej populacji owczarzy bez przyznania tej ograniczenia.
Czy potrzebuję modelu mieszankowego, jeśli pomiar dokonano tylko raz dla każdego skonwoju?
Jeśli skonwoje są grupowane w apiarniach i czynniki na poziomie apiarni mogłyby logicznie wpłynąć na wynik, model mieszany z apiarnią jako efektem losowym nadal jest często stosowany nawet przy jednym pomiarze na skonwoju, ponieważ uwzględnia niezależność wewnątrz apiarni, a nie tylko w powtarzanych pomiarach na tym samym skonwoju.
Jak powinienem zarządzać testowaniem wielu wyników w tej samej próbie?
Zanim zaczniesz zbierać dane, przedmiotowe zaznacz ponownie mało wyników główne w planie badania i traktuj wszystkie dodatkowe wyniki jako eksploracyjne, stosując korekcję wielokrotnej porównawczości lub co najmniej jasno informując o tym, które wyniki były potwierdzające, a które eksploracyjne.
Jaka jest różnica między znaczeniem statystycznym a praktycznym znaczeniem w badaniu apiarniczym?
Znaczenie statystyczne oznacza, że efekt nie jest prawdopodobnie spowodowany przypadkowo pod warunkami rozmiaru próby, podczas gdy znaczenie praktyczne pyta, czy efekt jest wystarczająco duży, aby mieć znaczenie dla rzeczywistych decyzji w zarządzaniu owcami; bardzo duże badanie może wykryć statystycznie istotny, ale praktycznie niewyraźny rozbieżność miedzy wagą skonwoju lub wydajnością.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Power Analysis, Sampling, and Statistics for Apiary Studies i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Power Analysis, Sampling, and Statistics for Apiary Studies