Jak sprawdzić, czy test A/B jest istotny statystycznie?
Wpisz odwiedzających i konwersje dla każdego wariantu, wybierz poziom ufności (standardem jest 95%) i przeczytaj werdykt. Test jest istotny, gdy p-value jest mniejsze niż 1 minus poziom ufności, czyli poniżej 0,05 przy 95%. Ta strona pokazuje też przedział dla prawdziwego wzrostu i to, czy test w ogóle mógł wykryć efekt, na który patrzysz, czego samo p-value nie powie.
Co oznacza p-value 0,08 w moim teście?
Że gdyby A i B naprawdę konwertowały w tym samym tempie, różnica co najmniej tak duża pojawiałaby się przypadkiem w około 8% przypadków. To nie prawdopodobieństwo, że wynik jest błędny, i nie "92% pewności, że B jest lepsze". Przy 95% ufności oznacza, że test nie przeskoczył poprzeczki. Spójrz na kafelek najmniejszego wykrywalnego wzrostu, by sprawdzić, czy w ogóle mógł.
Czy 90% ufności wystarczy?
Może wystarczyć, jeśli 90% ustalono przed startem testu i akceptujesz jeden fałszywy alarm na dziesięć. Nigdy nie wystarczy natomiast uruchomienie testu przy 95%, zobaczenie 91% i uznanie, że prawdziwym progiem od początku było 90%. Poziom ufności to obietnica, jak często zgadzasz się dać się oszukać, a zmiana go po obejrzeniu danych łamie tę obietnicę.
Ile konwersji potrzeba na wariant?
Nie ma magicznej liczby, ale poniżej około 25 konwersji na wariant test z to zgrubny szkic, a większość prawdziwych testów potrzebuje setek. Liczy się wzrost, który chcesz wykryć: przy bazowej stopie 5% wykrycie wzrostu względnego o 10% przy 95% ufności i 80% mocy wymaga około 31 000 odwiedzających na wariant, czyli mniej więcej 1550 konwersji w każdym. Zakładka wielkości próby liczy to dla twoich stóp.
Czym różni się częstościowe p-value od bayesowskiej szansy, że B jest lepsze?
P-value pyta "jak zaskakująca jest ta różnica, jeśli nic się nie zmieniło?" i daje odpowiedź tak lub nie przy danym progu. Liczba bayesowska pyta "biorąc pod uwagę to, co widzę, jak prawdopodobne jest, że prawdziwa stopa B jest wyższa niż A?" i daje prawdopodobieństwo. Na tych samych danych zwykle zgadzają się co do kierunku: p równe 0,05 odpowiada mniej więcej 97% szansy, że B jest lepsze, w teście dwustronnym. Strona pokazuje oba, bo zdanie bayesowskie to to, co ludzie mają na myśli, mówiąc "ufność", a p-value to liczba, którą pokazuje ich narzędzie.
Dlaczego kalkulator odmawia werdyktu, gdy podział jest nieprawidłowy?
Bo niezgodność proporcji próby (SRM) oznacza, że grupy nie zostały przydzielone losowo, a losowość to cały powód, dla którego test A/B działa. Jeśli planowano 50/50, a zaobserwowany podział ma szansę poniżej jednej na tysiąc, by powstać przypadkiem, jakiś mechanizm decyduje, kto trafia do którego wariantu, i może być powiązany z konwersją. Wzrost, który widzisz, może być efektem tego mechanizmu, a nie twojej zmiany.
Czy ten kalkulator nadaje się do przychodu na odwiedzającego lub średniej wartości zamówienia?
Nie. Ta strona testuje proporcję: każdy odwiedzający albo dokonał konwersji, albo nie. Przychód na odwiedzającego to ciągła, mocno skośna metryka i wymaga testu t lub bootstrapu na kwotach per użytkownik, a do tego potrzebne są surowe dane, a nie cztery sumy. Kalkulator testu t w matematycznych kalkulatorach Coddy porówna średnie, gdy masz wartości dla każdego użytkownika.
Skąd bierze się najmniejszy wykrywalny wzrost?
Z tego samego wzoru co w kalkulatorze wielkości próby, tylko odwróconego. Na podstawie wielkości grup i stopy A znajduje wzrost względny, który 80% testów tej wielkości wykryłoby przy twoim poziomie ufności. Jeśli zaobserwowany wzrost jest mniejszy, test miał za małą moc dla tego efektu, a "nieistotny" nie mówi prawie nic o tym, czy zmiana zadziałała.