Menu

Kalkulator chi kwadrat

Test niezależności na tabeli kontyngencji albo test zgodności, z każdą liczebnością oczekiwaną podaną dokładnie.

Autor: Nethanel Bar, Współzałożyciel i CEO

Ostatnia aktualizacja

Chcesz rozwiązywać takie zadania bez kalkulatora?

Kurs matematyki Coddy uczy samej metody: każdy krok robisz na interaktywnej tablicy i dowiadujesz się dokładnie, gdzie ruch poszedł nie tak.

Test chi kwadrat mierzy, jak daleko liczebności są od oczekiwanych

Każdy test chi kwadrat porównuje tabelę liczebności obserwowanych z liczebnościami, które przewiduje jakaś hipoteza. W teście niezależności hipoteza mówi, że zmienna z wierszy i zmienna z kolumn nie mają ze sobą nic wspólnego, więc każda liczebność oczekiwana to suma wiersza razy suma kolumny podzielone przez sumę całkowitą. W teście zgodności hipoteza to zestaw udziałów, równe udziały dla uczciwej kostki albo 9:3:3:1 dla grochu Mendla, przeskalowany do twojej sumy. W obu przypadkach statystyka to ta sama suma: dla każdej komórki różnica obserwowanej i oczekiwanej, podniesiona do kwadratu i podzielona przez oczekiwaną.

Ta suma jest dokładna. Tabela 2 na 2 z liczebnościami 20, 30, 30, 20 ma wszystkie liczebności oczekiwane równe 25 i chi kwadrat równe dokładnie 4; w bardziej nieporządnej tabeli liczebności oczekiwane wychodzą np. 350/3, a ta strona zostawia je jako 350/3 zamiast 116.67, więc odczytana statystyka jest prawdziwa, a nie jest sumą pięciu zaokrąglonych składników. Dokładna nie może być wartość p, czyli pole pod krzywą chi kwadrat za statystyką; strona rysuje ten ogon i opisuje liczbę jako to, czym jest: pole.

Tabela pod odpowiedzią to ta część, za którą uczeń dostaje punkty, i ta, którą większość kalkulatorów pomija: liczebność obserwowana każdej komórki, jej liczebność oczekiwana i jej wkład w statystykę. Pokazuje też, gdzie siedzi związek. W dużej tabeli jedna lub dwie komórki często odpowiadają za większość chi kwadrat, a kolumna wkładu wskazuje je palcem. V Craméra, podawane dla tabel kontyngencji, zamienia statystykę na miarę siły efektu od 0 do 1, którą można porównywać między tabelami różnej wielkości.

Co warto wiedzieć o teście chi kwadrat

  • Liczba stopni swobody to (wiersze − 1)(kolumny − 1) dla tabeli i kategorie − 1 dla testu zgodności. Tabela 2 na 2 ma jeden stopień swobody niezależnie od liczebności.
  • Liczebności oczekiwane poniżej 5 czynią przybliżenie niedokładnym. Strona ostrzega, gdy taką widzi; przy tabeli 2 na 2 zwykłą alternatywą jest dokładny test Fishera, a w innych przypadkach zwykle łączy się rzadkie kategorie.
  • Test jest zawsze prawostronny. Małe chi kwadrat oznacza, że liczebności pasują do hipotezy; tylko duże jest dowodem przeciwko niej.
  • Istotny to nie to samo co silny. Przy wystarczającej ilości danych nawet drobny związek jest istotny; o jego sile mówi V Craméra, gdzie 0.1 to związek słaby, 0.3 umiarkowany, a 0.5 silny.
  • Liczebności, nie procenty. Statystyka zależy od rzeczywistej liczby obserwacji; tabeli procentów bez sumy nie da się przetestować.

Jak ręcznie przeprowadzić test chi kwadrat

  1. Rozpisz liczebności obserwowane

    Wiersze to kategorie jednej zmiennej, kolumny to kategorie drugiej. Zsumuj każdy wiersz, każdą kolumnę i całą tabelę.

  2. Oblicz każdą liczebność oczekiwaną

    Suma wiersza razy suma kolumny, podzielone przez sumę całkowitą. Zachowaj ułamki; za chwilę będą podnoszone do kwadratu.

  3. Oblicz wkład każdej komórki

    Obserwowana minus oczekiwana, do kwadratu, podzielone przez oczekiwaną. Dodaj wszystkie wkłady; suma to statystyka chi kwadrat.

  4. Znajdź stopnie swobody i wartość p

    (wiersze − 1)(kolumny − 1). Wartość p to pole prawego ogona krzywej chi kwadrat o tej liczbie stopni swobody; porównaj ją z alfa albo porównaj statystykę z wartością krytyczną.

Wartości krytyczne chi kwadrat

Statystyka musi przekroczyć te wartości, żeby wynik był istotny na danym poziomie.

Stopnie swobodyα = 0.10α = 0.05α = 0.01
12.7063.8416.635
24.6055.9919.210
36.2517.81511.345
47.7799.48813.277
59.23611.07015.086
914.68416.91921.666

Przykłady z obliczeniami

Tabela 2 na 2

plain
20, 30 / 30, 20

Sumy wierszy 50 i 50, sumy kolumn 50 i 50, suma całkowita 100, więc każda liczebność oczekiwana to 50 × 50 / 100 = 25. Każda komórka wnosi 25/25 = 1, chi kwadrat wynosi dokładnie 4 przy jednym stopniu swobody, a wartość p to około 0.046. Wynik istotny na poziomie 5%, choć ledwo; V Craméra wynosi 0.2, czyli związek jest słaby.

Czy kostka jest uczciwa?

plain
10, 12, 8, 11, 9, 10 over six faces

Sześćdziesiąt rzutów, więc na każdą ściankę przypada oczekiwanie dziesięciu. Wkłady to 0, 0.4, 0.4, 0.1, 0.1 i 0, co daje chi kwadrat równe dokładnie 1 przy pięciu stopniach swobody i wartość p około 0.96. Nic tu nie wskazuje, że kostka jest obciążona.

Groch Mendla

plain
315, 108, 101, 32 against 9 : 3 : 3 : 1

Suma to 556, więc liczebności oczekiwane to 556 × 9/16 = 312.75, 104.25, 104.25 i 34.75. Chi kwadrat wychodzi około 0.47 przy trzech stopniach swobody, p około 0.93: liczebności pasują do przewidywania 9:3:3:1 wręcz podejrzanie dobrze, co samo w sobie jest słynnym argumentem.

Błędy w teście chi kwadrat

  • Testowanie procentów. Najpierw zamień je z powrotem na liczebności; statystyka rośnie razem z liczbą obserwacji.
  • Zaokrąglanie liczebności oczekiwanych. Liczebność oczekiwana 116.67 podniesiona do kwadratu i podzielona to nie to samo co 350/3 podniesione do kwadratu i podzielone; małe błędy w każdej komórce sumują się w całej tabeli.
  • Ignorowanie liczebności oczekiwanej poniżej 5. Krzywa chi kwadrat to przybliżenie, które psuje się w rzadkich komórkach; połącz kategorie albo użyj testu dokładnego.
  • Odczytywanie dużego chi kwadrat jako silnego związku. Statystyka rośnie z wielkością próby; miarą siły jest V Craméra.
  • Błędna liczba stopni swobody. Tabela 3 na 4 ma ich 6, a nie 11 ani 12.
  • Dwustronny test chi kwadrat. Test jest z definicji jednostronny; bardzo mała statystyka nie jest dowodem na nic poza dobrym dopasowaniem.

Test chi kwadrat: najczęstsze pytania

Jak obliczyć statystykę chi kwadrat?
Dla każdej komórki odejmij liczebność oczekiwaną od obserwowanej, podnieś wynik do kwadratu i podziel przez liczebność oczekiwaną. Dodaj te składniki dla wszystkich komórek. W tabeli kontyngencji liczebność oczekiwana to suma wiersza razy suma kolumny podzielone przez sumę całkowitą; w teście zgodności to suma całkowita razy oczekiwany udział danej kategorii.
Czym różni się test niezależności od testu zgodności?
Test niezależności działa na tabeli dwudzielczej i sprawdza, czy zmienna z wierszy i zmienna z kolumn są ze sobą powiązane; jego liczebności oczekiwane wynikają z sum brzegowych samej tabeli. Test zgodności działa na jednej liście liczebności i sprawdza, czy pasują do udziałów podanych z góry, na przykład równych udziałów albo proporcji genetycznej.
Jak znaleźć wartość p w teście chi kwadrat?
To pole pod krzywą chi kwadrat o liczbie stopni swobody testu, na prawo od statystyki. Chi kwadrat równe 3.841 przy jednym stopniu swobody daje p = 0.05; większe statystyki dają mniejsze wartości p. Strona oblicza to pole bezpośrednio i zaznacza je na krzywej.
Co zrobić, gdy liczebność oczekiwana jest mniejsza niż 5?
Przybliżenie chi kwadrat staje się wtedy niewiarygodne. Zwykła rada jest taka, że każda liczebność oczekiwana powinna wynosić co najmniej 5, a w najgorszym razie nie więcej niż jedna piąta z nich może być poniżej 5 i żadna poniżej 1. Przy tabeli 2 na 2 użyj zamiast tego dokładnego testu Fishera; przy większej tabeli połącz rzadkie kategorie. Strona sygnalizuje ten warunek, gdy go wykryje.
Co to jest V Craméra?
Miara siły efektu dla tabeli kontyngencji: pierwiastek z chi kwadrat podzielonego przez liczebność próby razy mniejszą z wartości (wiersze − 1) i (kolumny − 1). Przyjmuje wartości od 0, czyli brak związku, do 1, czyli związek doskonały, i w przeciwieństwie do samego chi kwadrat nie rośnie tylko dlatego, że urosła próba.
Czy można użyć testu chi kwadrat na tabeli 2 na 2 z małymi liczebnościami?
Tylko ostrożnie. Przy liczebnościach oczekiwanych równych 5 lub więcej nie ma problemu; czasem stosuje się poprawkę Yatesa na ciągłość, choć bywa zbyt zachowawcza. Poniżej tego progu standardowym wyborem jest dokładny test Fishera, który oblicza dokładne prawdopodobieństwo tabeli.
Dlaczego ta strona zostawia liczebności oczekiwane jako ułamki?
Bo statystyka to suma kwadratów różnic podzielonych przez te liczebności, a zaokrąglanie każdej liczebności oczekiwanej przed podniesieniem do kwadratu wprowadza mały błąd do każdego składnika. Liczebność oczekiwana 350/3 jest dokładnie tym; 116.67 nie jest. Zachowanie ułamków sprawia, że odczytane chi kwadrat to prawdziwa wartość dla wpisanej tabeli.

Więcej narzędzi matematycznych

Ilustracja języków programowania w Coddy

Ucz się matematyki z Coddy

ZACZNIJ