Menu

Kalkulator testów A/B

Wpisz liczbę odwiedzających i konwersji dla każdego wariantu. Dostajesz werdykt w jednym zdaniu, p-value z obliczeniami, przedział, bayesowską szansę, że B jest lepsze, sprawdzenie, czy podział ruchu nie jest zepsuty, oraz najmniejszy wzrost, jaki ten test w ogóle mógł wykryć.

Autor: Nethanel Bar, Co-founder & CEO

Ostatnia aktualizacja

Chcesz naprawdę nauczyć się programować?

Coddy uczy cię przez pisanie prawdziwego kodu w przeglądarce: interaktywne lekcje, natychmiastowa informacja zwrotna i pomoc AI, gdy utkniesz.

Co ten kalkulator mówi, a inne nie

Każdy kalkulator testów A/B pokazuje p-value. Większość na tym kończy i właśnie dlatego założyciele firm wpatrują się w 87% ufności, nie wiedząc, co to znaczy. Ten odpowiada na pytania, które naprawdę decydują o kolejnym kroku. Czy różnica jest większa, niż dałby sam przypadek? Jak duży może być prawdziwy wzrost w najgorszym i najlepszym razie? Jeśli test wyszedł "nieistotny", to czy przy takiej próbie w ogóle mógł coś znaleźć? I czy sam podział ruchu jest zdrowy, czy porównujesz dwie grupy, które nigdy nie były równe?

Kalkulator wykonuje standardowy test z dla dwóch proporcji, ten sam, którego używa klasyczny silnik Optimizely, tryb częstościowy VWO i każdy podręcznik statystyki, i pokazuje każdy wiersz rachunku: wspólną stopę, błąd standardowy, wynik z i pole ogona. Obok znajduje się odpowiedź bayesowska, czyli prawdopodobieństwo, że prawdziwa stopa B jest wyższa niż A, bo zdanie "jest 91% szansy, że B jest lepsze" to właśnie to, czego większość ludzi oczekuje od p-value, a to zupełnie inna liczba.

Zbudowaliśmy go po spojrzeniu na własny panel. Coddy przeprowadziło około dwudziestu nazwanych eksperymentów, z czego dziesięć to testy cen w poszczególnych krajach na małych wycinkach ruchu, a nasze wewnętrzne narzędzie pokazywało pasek ufności z napisem "Kontynuuj" poniżej 95%. To opcjonalne zatrzymywanie z przyjazną twarzą. Trzy zakładki obok tej, wielkość próby, sprawdzenie realiów i symulator podglądania, istnieją, bo kalkulator, który raportuje tylko istotność, pomaga szybciej oszukiwać samych siebie.

Co wiedzieć, zanim zaufasz liczbie

  • "Nieistotny" nie znaczy "brak różnicy". Znaczy, że dane nie potrafią tego rozstrzygnąć. Kafelek z najmniejszym wzrostem, jaki test mógł wykryć, to uczciwy odczyt: jeśli zaobserwowany wzrost jest poniżej tej wartości, test nigdy nie miał szans dać odpowiedzi.
  • P-value to nie szansa, że się mylisz. To szansa na zobaczenie tak dużej różnicy, gdyby oba warianty były identyczne. To, jak prawdopodobne jest, że zwycięzca jest prawdziwy, zależy też od tego, jak często twoje pomysły działają, a zakładka sprawdzenia realiów zamienia to na liczbę.
  • Zatrzymywanie testu pierwszego dnia, gdy pasek zrobi się zielony, to najdroższy nawyk w testach A/B. Codzienne sprawdzanie i wczesne zatrzymanie zmienia 5% fałszywych alarmów w 20% lub więcej. Symulator podglądania pokazuje to na twoim własnym ruchu.
  • Zepsuty podział zatruwa wszystko. Jeśli planowano 50/50, a wyszło 46/54, coś kieruje użytkowników, zanim trafią do testu: warstwa cache, filtr botów, przekierowanie. Kalkulator najpierw to sprawdza i odmawia werdyktu, dopóki test nie przechodzi.
  • Poniżej około 25 konwersji na wariant przybliżenie normalne, na którym opiera się test z, jest szkicem, a nie pomiarem. Kalkulator mówi to wprost, zamiast wypisywać trzy miejsca po przecinku fałszywej precyzji.

Jak korzystać z kalkulatora testów A/B

  1. Wpisz odwiedzających i konwersje dla A i B

    Odwiedzający to osoby przypisane do danego wariantu, a nie odsłony strony. Konwersje to ci, którzy wykonali mierzoną akcję: zarejestrowali się, zapłacili, kliknęli. Obie wartości muszą być liczone tak samo dla obu wariantów.

  2. Wybierz poziom ufności i hipotezę

    Domyślnie jest 95% dwustronnie i to uczciwy wybór, gdy B może być lepsze albo gorsze. Test jednostronny ma sens tylko wtedy, gdy gorsze B zostałoby potraktowane dokładnie tak samo jak brak zmiany, a to zdarza się rzadziej, niż się wydaje.

  3. Przeczytaj werdykt, potem przedział

    Baner mówi, co wspierają liczby. Kafelek wzrostu względnego pokazuje przedział: prawdziwy efekt najpewniej leży gdzieś w nim, a do planowania warto brać dolną granicę, nie estymację punktową.

  4. Sprawdź dwa ostrzeżenia

    Jeśli podział jest oznaczony jako błędny, najpierw napraw test, zanim cokolwiek odczytasz. Jeśli najmniejszy wykrywalny wzrost jest większy niż zaobserwowany, test miał za małą moc: przejdź do zakładki wielkości próby i zobacz, ilu odwiedzających potrzeba.

  5. Skopiuj wynik lub link

    Kopiuj wynik daje podsumowanie do wiadomości lub dokumentu. Kopiuj link umieszcza cztery liczby w adresie URL, więc każdy, kto go otworzy, zobaczy te same obliczenia.

Jak czytać wyniki

Co oznacza każdy kafelek, w jednym zdaniu.

KafelekCzym jestJak go czytać
Wzrost względny(stopa B minus stopa A) podzielone przez stopę AGłówna liczba. Przedział obok to zakres, w którym najpewniej leży prawdziwy wzrost.
P-valueSzansa na tak dużą różnicę, gdyby A i B były identycznePoniżej 0,05 przy 95% ufności oznacza istotność. To nie jest szansa, że wynik jest błędny.
Ufność1 minus p, w procentachLiczba, którą pokazuje większość narzędzi. 87% to nie prawie 95%, to rzut monetą po złej stronie linii.
Szansa, że B jest lepszeBayesowskie prawdopodobieństwo, że prawdziwa stopa B jest wyższa niż AZdanie, którego ludzie szukają. 91% znaczy, że B jest prawdopodobnie lepsze, a nie że jest lepsze o 91%.
Najmniejszy wzrost, jaki test mógł wykryćWzrost względny wykrywalny z mocą 80% przy tych wielkościach grupJeśli zaobserwowany wzrost jest mniejszy, "nieistotny" znaczy "nie dało się stwierdzić".
Podział ruchuZaobserwowany udział odwiedzających w każdym wariancie względem planuOznaczany, gdy odchylenie jest większe, niż pozwala przypadek. Napraw test, zanim odczytasz wyniki.

Trzy testy, trzy różne lekcje

Klasyczne "prawie się udało"

A: 10 000 odwiedzających, 500 konwersji (5,00%). B: 10 000 odwiedzających, 560 konwersji (5,60%). Wzrost względny +12%, p = 0,058.

Nieistotne przy 95%, a przedział sięga od około minus 0,4% do plus 24%. Uczciwy odczyt to "prawdopodobnie mały plus, ale może nic". Najmniejszy wzrost, jaki ten test mógł wykryć, to około 17%, więc efekt 12% zawsze musiał wylądować w szarej strefie. Potrzeba mniej więcej dwa razy więcej ruchu, a nie kolejnego tygodnia nadziei.

Zepsuty podział

A: 5000 odwiedzających, 100 konwersji. B: 4300 odwiedzających, 120 konwersji. Planowany podział 50/50.

B wygląda na wyraźnego zwycięzcę z wynikiem +40%. Kalkulator odmawia takiego werdyktu: podział 5000 do 4300 ma szansę poniżej jednej na milion, by zdarzyć się przypadkiem przy 50/50. Coś usuwa użytkowników z B, zanim zostaną policzeni, często przekierowanie, które nie działa w jednej przeglądarce, albo filtr botów traktujący wariant inaczej. Cokolwiek to jest, obie grupy nie są porównywalne, a wzrost nic nie znaczy.

Mała strona

A: 400 odwiedzających, 12 konwersji (3,0%). B: 400 odwiedzających, 19 konwersji (4,75%). Wzrost względny +58%, p = 0,20.

Wzrost o 58% brzmi ogromnie, a p-value wynosi około 0,19. Przy 12 i 19 konwersjach kalkulator sygnalizuje za mało danych: przy tej skali liczby wahają się tak mocno, że jedna dodatkowa rejestracja przesuwa stopę o ćwierć punktu. Przy takim ruchu najmniejszy wzrost, jaki test mógłby potwierdzić w miesiąc, to ponad 100%. To nie powód, by test trwał dłużej, tylko powód, by zajrzeć do zakładki sprawdzenia realiów.

Błędy, które ten kalkulator ma wyłapywać

  • Czytanie 90% ufności jako "pewnie jest dobrze". Przy 95% granica to 95%. Liczba poniżej znaczy, że dane nie przeskoczyły ustalonej poprzeczki, a błędem jest przesuwanie poprzeczki po obejrzeniu wyników, nie sama liczba.
  • Nazywanie nieistotnego testu remisem. Remis to bardzo wąski przedział wokół zera. Nieistotny test z szerokim przedziałem to pytanie bez odpowiedzi, a zakładka wielkości próby mówi, ile kosztowałoby na nie odpowiedzieć.
  • Ogłaszanie zwycięzcy pierwszego ranka, gdy pasek zrobi się zielony. Symulator podglądania uruchamia dwa tysiące testów, w których nic się nie zmieniło, i pokazuje, ile z nich wdrożyłaby osoba zaglądająca codziennie.
  • Testowanie pięciu wariantów i raportowanie najlepszego przy 95%. Pięć porównań po 5% każde to 23% szansy na fałszywego zwycięzcę. Zakładka wielkości próby sama dzieli alfę, gdy dodajesz warianty.
  • Porównywanie odsłon z unikalnymi użytkownikami albo liczenie konwersji w innym oknie czasowym niż odwiedzających. Test z zakłada, że każdy odwiedzający to jedna niezależna próba, a wszystko inne zawyża ufność.
  • Ignorowanie podziału. Podział 48/52 przy 100 000 odwiedzających to nie przypadek, tylko błąd, a każdy wynik zależny od niego jest niewiarygodny.

Kalkulator testów A/B: FAQ

Jak sprawdzić, czy test A/B jest istotny statystycznie?
Wpisz odwiedzających i konwersje dla każdego wariantu, wybierz poziom ufności (standardem jest 95%) i przeczytaj werdykt. Test jest istotny, gdy p-value jest mniejsze niż 1 minus poziom ufności, czyli poniżej 0,05 przy 95%. Ta strona pokazuje też przedział dla prawdziwego wzrostu i to, czy test w ogóle mógł wykryć efekt, na który patrzysz, czego samo p-value nie powie.
Co oznacza p-value 0,08 w moim teście?
Że gdyby A i B naprawdę konwertowały w tym samym tempie, różnica co najmniej tak duża pojawiałaby się przypadkiem w około 8% przypadków. To nie prawdopodobieństwo, że wynik jest błędny, i nie "92% pewności, że B jest lepsze". Przy 95% ufności oznacza, że test nie przeskoczył poprzeczki. Spójrz na kafelek najmniejszego wykrywalnego wzrostu, by sprawdzić, czy w ogóle mógł.
Czy 90% ufności wystarczy?
Może wystarczyć, jeśli 90% ustalono przed startem testu i akceptujesz jeden fałszywy alarm na dziesięć. Nigdy nie wystarczy natomiast uruchomienie testu przy 95%, zobaczenie 91% i uznanie, że prawdziwym progiem od początku było 90%. Poziom ufności to obietnica, jak często zgadzasz się dać się oszukać, a zmiana go po obejrzeniu danych łamie tę obietnicę.
Ile konwersji potrzeba na wariant?
Nie ma magicznej liczby, ale poniżej około 25 konwersji na wariant test z to zgrubny szkic, a większość prawdziwych testów potrzebuje setek. Liczy się wzrost, który chcesz wykryć: przy bazowej stopie 5% wykrycie wzrostu względnego o 10% przy 95% ufności i 80% mocy wymaga około 31 000 odwiedzających na wariant, czyli mniej więcej 1550 konwersji w każdym. Zakładka wielkości próby liczy to dla twoich stóp.
Czym różni się częstościowe p-value od bayesowskiej szansy, że B jest lepsze?
P-value pyta "jak zaskakująca jest ta różnica, jeśli nic się nie zmieniło?" i daje odpowiedź tak lub nie przy danym progu. Liczba bayesowska pyta "biorąc pod uwagę to, co widzę, jak prawdopodobne jest, że prawdziwa stopa B jest wyższa niż A?" i daje prawdopodobieństwo. Na tych samych danych zwykle zgadzają się co do kierunku: p równe 0,05 odpowiada mniej więcej 97% szansy, że B jest lepsze, w teście dwustronnym. Strona pokazuje oba, bo zdanie bayesowskie to to, co ludzie mają na myśli, mówiąc "ufność", a p-value to liczba, którą pokazuje ich narzędzie.
Dlaczego kalkulator odmawia werdyktu, gdy podział jest nieprawidłowy?
Bo niezgodność proporcji próby (SRM) oznacza, że grupy nie zostały przydzielone losowo, a losowość to cały powód, dla którego test A/B działa. Jeśli planowano 50/50, a zaobserwowany podział ma szansę poniżej jednej na tysiąc, by powstać przypadkiem, jakiś mechanizm decyduje, kto trafia do którego wariantu, i może być powiązany z konwersją. Wzrost, który widzisz, może być efektem tego mechanizmu, a nie twojej zmiany.
Czy ten kalkulator nadaje się do przychodu na odwiedzającego lub średniej wartości zamówienia?
Nie. Ta strona testuje proporcję: każdy odwiedzający albo dokonał konwersji, albo nie. Przychód na odwiedzającego to ciągła, mocno skośna metryka i wymaga testu t lub bootstrapu na kwotach per użytkownik, a do tego potrzebne są surowe dane, a nie cztery sumy. Kalkulator testu t w matematycznych kalkulatorach Coddy porówna średnie, gdy masz wartości dla każdego użytkownika.
Skąd bierze się najmniejszy wykrywalny wzrost?
Z tego samego wzoru co w kalkulatorze wielkości próby, tylko odwróconego. Na podstawie wielkości grup i stopy A znajduje wzrost względny, który 80% testów tej wielkości wykryłoby przy twoim poziomie ufności. Jeśli zaobserwowany wzrost jest mniejszy, test miał za małą moc dla tego efektu, a "nieistotny" nie mówi prawie nic o tym, czy zmiana zadziałała.

Inne narzędzia dla programistów

Ilustracja języków programowania w Coddy

Ucz się programowania z Coddy

ZACZNIJ