Test t sprawdza, czy różnica jest większa niż szum
Każdy test t ma ten sam kształt. Jest różnica, która cię interesuje: średnia z próby wobec deklarowanej wartości, średnie dwóch grup wobec siebie albo przeciętna zmiana w parach. Jest błąd standardowy: o ile ta różnica wahałaby się między kolejnymi próbami, oszacowany z rozrzutu danych. Statystyka t to pierwsze podzielone przez drugie, więc t = 3 oznacza, że różnica ma szerokość trzech błędów standardowych, a krzywa t dla właściwej liczby stopni swobody zamienia to na wartość p.
Trzy testy różnią się tylko tym, czym jest różnica i czym błąd standardowy. Jedna próba: średnia minus wartość z hipotezy, przez s podzielone przez pierwiastek z n. Próby zależne: to samo zastosowane do listy różnic, po jednej na parę, dlatego parowanie jest tak skuteczne, gdy każda para dzieli dużo wspólnego szumu. Dwie próby: odstęp między średnimi przez błąd standardowy zbudowany z obu rozrzutów. Dla dwóch prób strona domyślnie używa wersji Welcha, która nie zakłada równych wariancji w obu grupach i jest domyślna w każdym współczesnym pakiecie statystycznym; wersja Studenta z łączoną wariancją jest o jedno kliknięcie, gdy wymaga jej kurs.
Strona zachowuje dokładnie to, co da się zachować. Średnia 26 jest wypisana jako 26, a wariancja 32/3 jako 32/3, a nie 10.67; błąd standardowy jest pokazany jako pierwiastek, bo nim jest; statystyka t to pierwszy ułamek dziesiętny, bo dzielenie przez pierwiastek nie zostawia nic wymiernego do zachowania. Poniżej wypisany jest każdy krok, więc tabelę podsumowania prób można porównać z własnymi obliczeniami.
Co warto wiedzieć o testach t
Stopnie swobody to n minus 1 dla jednej próby i dla prób zależnych oraz n1 plus n2 minus 2 dla testu dwóch prób z łączoną wariancją. Stopnie swobody Welcha to ułamek wyliczany z obu wariancji i często nie jest liczbą całkowitą.
Parowanie usuwa wspólny szum. Pomiary przed i po na tych samych osobach wymagają testu dla prób zależnych, nigdy testu dla dwóch prób; ten drugi wyrzuca parowanie i zwykle niczego nie znajduje.
Welch to bezpieczny wybór domyślny. Gdy obie wariancje naprawdę są równe, obie wersje się zgadzają; gdy nie są, tylko Welch utrzymuje obiecany poziom błędu.
Przedział ufności mówi to, czego nie powie wartość p: jak duża prawdopodobnie jest różnica. Istotne t z przedziałem od 0.1 do 0.3 to mały efekt; to samo t z przedziałem od 2 do 6 to duży efekt.
d Cohena to różnica wyrażona w odchyleniach standardowych, więc można ją porównywać między badaniami o różnych skalach. Około 0.2 to mały efekt, 0.5 średni, 0.8 duży.
Jak przeprowadzić test t
1
Wybierz rodzaj testu
Jedna próba wobec deklarowanej średniej; dwie niezależne próby wobec siebie; próby zależne, gdy każda wartość z jednej listy ma swoją parę w drugiej.
2
Wklej dane
Działają przecinki, spacje i nowe linie. W teście dla prób zależnych obie listy muszą mieć tę samą długość i tę samą kolejność.
3
Ustaw hipotezę i poziom istotności
Dwustronny dla „różne”, jednostronny dla kierunku ustalonego z góry. Alfa równe 0.05 to konwencja.
4
Najpierw przeczytaj tabelę podsumowania
Sprawdź, czy średnie i wariancje są takie, jakich się spodziewasz. Większość błędnych testów t jest błędna, bo jakaś wartość trafiła do niewłaściwej listy.
5
Potem odczytaj t, p i przedział
Werdykt mówi, czy różnica przekroczyła próg; przedział mówi, jak duża prawdopodobnie jest. Podawaj oba.
Dziesięć wartości ma średnią 26 i wariancję z próby 32/3. Błąd standardowy to pierwiastek z 32/30, około 1.033, więc t wynosi około 1.94 przy 9 stopniach swobody, a dwustronne p około 0.085. Nieistotne na poziomie 5%: średnia 26 mieści się w tym, co dziesięcioelementowa próba z populacji o średniej 24 dałaby mniej więcej raz na dwanaście.
Pierwsza grupa ma średnią około 84.7, druga około 78.9. Test Welcha daje t około 2.46 przy około 9 stopniach swobody i p około 0.036; wersja z łączoną wariancją daje to samo t przy 12 stopniach swobody i p około 0.030. Istotne w obu przypadkach, a przedział dla różnicy biegnie mniej więcej od 0.5 do 11.2.
Każda para wzrosła o 2 do 4 punktów. Średnia różnic to 19/6, około 3.17, przy małym rozrzucie, więc t dla prób zależnych jest duże, około 10.3 przy 5 stopniach swobody, a p wynosi około 0.0001. Test dla dwóch prób na tych samych liczbach znalazłby znacznie mniej, bo rozrzut między osobami zagłusza zmianę u każdej z nich.
Błędy przy teście t
Test dla dwóch prób na danych sparowanych. Parowanie to właśnie informacja; wyrzucenie go sprawia, że prawdziwa zmiana znika w szumie.
Zakładanie równych wariancji bez sprawdzenia. Test z łączoną wariancją jest poprawny tylko wtedy, gdy rozrzuty są równe; Welch prawie nic nie kosztuje, gdy są, i ratuje test, gdy nie są.
Użycie wzoru na wariancję populacji. Test t korzysta z wariancji z próby, dzieląc przez n minus 1, i ta strona tak robi.
Mylenie istotności z wielkością. Przy dostatecznie dużej ilości danych nawet drobna różnica jest istotna; to przedział i d Cohena mówią, czy ma znaczenie.
Wybór ogona po zobaczeniu znaku. Jeśli pytanie brzmiało „czy są różne”, test jest dwustronny, nawet jeśli wynik poszedł po twojej myśli.
Testowanie mocno skośnej miary na kilku wartościach. Przy n poniżej około 15 i długim ogonie krzywa t to tylko zgrubna wskazówka; uczciwą alternatywą jest test rangowy albo bootstrap.
Test t Studenta: FAQ
Kiedy użyć testu t zamiast testu z?
Zawsze wtedy, gdy odchylenie standardowe jest szacowane z tej samej próby, czyli prawie zawsze. Grubsze ogony krzywej t uwzględniają tę dodatkową niepewność. Test z jest dla podręcznikowego przypadku, gdy odchylenie standardowe populacji jest znane z góry, albo dla bardzo dużych prób, przy których obie krzywe się pokrywają.
Czym różni się test t dla prób zależnych od testu dla prób niezależnych?
Test dla prób zależnych korzysta z różnic w dopasowanych parach, na przykład tej samej osoby zmierzonej dwa razy, więc szum wspólny dla każdej pary się znosi. Test dla prób niezależnych (dwóch prób) porównuje dwie oddzielne grupy. Używaj testu dla prób zależnych zawsze, gdy każda wartość z jednej listy ma naturalną parę w drugiej; w przeciwnym razie testu dla dwóch prób.
Test Welcha czy test t Studenta?
Welcha, chyba że kurs lub czasopismo wymaga inaczej. Test Studenta z łączoną wariancją zakłada, że obie grupy mają tę samą wariancję, i daje błędne poziomy błędu, gdy tak nie jest; Welch rezygnuje z tego założenia i zgadza się ze Studentem, gdy ono zachodzi. Ta strona domyślnie używa Welcha, a wersję łączoną oferuje jako przełącznik.
Jak odczytać stopnie swobody w teście Welcha?
Stopnie swobody Welcha wynikają ze wzoru na dwóch wariancjach i liczebnościach prób i zwykle nie są liczbą całkowitą, na przykład 9.87. To normalne; krzywa t jest określona dla dowolnej dodatniej liczby stopni swobody. Gdy obie wariancje i liczebności są równe, wzór sprowadza się do n1 plus n2 minus 2.
Co oznacza przedział ufności dla różnicy?
To zakres wartości prawdziwej różnicy, z którymi dane są zgodne na wybranym poziomie. Jeśli nie obejmuje zera, test jest istotny przy odpowiadającym mu alfa; jego szerokość mówi, jak precyzyjnie wyznaczono różnicę. Podawaj go obok wartości p.
Czym jest d Cohena?
To różnica średnich podzielona przez odchylenie standardowe, czyli wielkość efektu w jednostkach odchylenia standardowego, którą można porównywać między badaniami o różnych skalach. Umownie 0.2 to mały efekt, 0.5 średni, a 0.8 duży, choć to, co jest istotne w praktyce, zależy od dziedziny.
Czy mogę użyć tego do testu A/B?
Dla współczynnika konwersji nie: to porównanie proporcji, a kalkulator testu A/B na stronach narzędzi robi to testem z dla dwóch proporcji. Dla miary ciągłej, takiej jak przychód na użytkownika czy czas na stronie, tak, jeśli masz wartości dla każdego użytkownika do wklejenia; test Welcha dla dwóch prób to właściwy wybór.