Ilu odwiedzających potrzebuje każdy wariant, zanim test cokolwiek powie, i ile to dni przy twoim ruchu. Ustaw najmniejszy wzrost wart wykrycia, ufność i moc, a potem odczytaj liczbę z rozpisanym wzorem.
Ustal wielkość próby, zanim spojrzysz na jakikolwiek wynik
Wielkość próby to obietnica, którą składasz sobie przed startem testu: "Spojrzę na wynik, gdy zobaczy go tyle osób, i ani chwili wcześniej". Bez niej każdy test A/B zamienia się w tę samą historię. Pierwszy tydzień wygląda obiecująco, w drugim wzrost maleje, ktoś pyta, czy to już istotne, a test kończy się w dniu, w którym pasek robi się zielony. Ta strona daje liczbę do wpisania w plan, żeby data końca była faktem, a nie nastrojem.
Obliczenie to standardowa wielkość próby dla dwóch proporcji, ta sama, która stoi za kalkulatorem Evana Millera i Optimizely, i zależy od czterech rzeczy: stopy bazowej, wzrostu, który chcesz móc wykryć, poziomu ufności i mocy. Moc to ta, którą ludzie pomijają. Przy mocy 80% prawdziwy wzrost o podanej wielkości zostaje wykryty osiem razy na dziesięć. Test z połową próby ma znacznie mniej niż połowę mocy, dlatego test o za małej mocy to nie "przybliżona odpowiedź", tylko zwykle brak odpowiedzi.
Krzywa pod wynikiem to część warta zapamiętania. Liczba potrzebnych odwiedzających rośnie z kwadratem odwrotności wzrostu: zmniejsz o połowę wzrost, który chcesz zobaczyć, a potrzebujesz około czterech razy więcej ruchu. Strona, która potwierdza wzrost o 30% w dwa tygodnie, potrzebuje około dziewięć razy więcej czasu, by potwierdzić wzrost o 10%. Jeśli liczba dni wychodzi w miesiącach, kalkulator mówi ci, żeby testować coś większego albo przejść wyżej w lejku do metryki, do której dociera więcej osób, zanim powie ci, żeby czekać.
Od czego zależy wielkość próby
Minimalny wykrywalny efekt to decyzja, a nie pomiar. To najmniejszy wzrost, dla którego naprawdę wdrożysz zmianę. Ustawienie go nisko, żeby test był "czulszy", sprawia, że test jest dłuższy, a nie lepszy.
Wzrost względny i bezwzględny to różne rzeczy. Wzrost względny o 10% przy stopie bazowej 5% to pół punktu procentowego. Ta strona liczy względnie, bo tak raportuje się wyniki, i pokazuje obok docelową stopę, żeby widać było oba.
Dodatkowe warianty kosztują więcej niż ich udział. Testowanie A przeciwko B, C i D to trzy porównania i ufność trzeba między nie podzielić. Kalkulator stosuje poprawkę Bonferroniego i pokazuje alfę, którą faktycznie dostaje każde porównanie.
Dni to sufit, a nie podłoga. Nawet jeśli liczby mówią cztery dni, prowadź test co najmniej pełny tydzień, najlepiej dwa, bo odwiedzający w tygodniu i w weekend konwertują inaczej, a test tylko we wtorki mierzy wtorki.
Moc 80% oznacza, że jeden prawdziwy zwycięzca na pięciu zostaje przeoczony. Jeśli przeoczenie zwycięzcy jest dla ciebie kosztowne, użyj 90% i zaakceptuj większą próbę.
Jak ustalić wielkość testu A/B
1
Wpisz obecną stopę konwersji
Użyj stopy strony lub kroku, który test zmieni, mierzonej na tym samym rodzaju odwiedzających, których zobaczy test. Nie używaj średniej z całej witryny, gdy testujesz jeden krok lejka.
2
Wybierz najmniejszy wzrost wart wykrycia
Zapytaj siebie, jaki wzrost sprawi, że wdrożysz zmianę. To twój minimalny wykrywalny efekt. 10% względnie to częsty wybór dla dojrzałej strony, a przebudowa może uzasadniać 20% lub więcej.
3
Ustaw ufność i moc
95% ufności i 80% mocy to konwencje. Podnieś ufność, gdy wycofanie fałszywego zwycięzcy jest drogie, a moc, gdy przeoczenie zwycięzcy kosztuje dużo.
4
Dodaj dziennych odwiedzających
Wszystkie warianty razem, licząc tylko odwiedzających, którzy dotrą do testu. Wynik zamienia się na dni i pełne tygodnie.
5
Zapisz datę końca
Kalkulator podaje wielkość próby na wariant. Wpisz ją do planu testu razem z datą, która z niej wynika, i nie czytaj wyników wcześniej. Zakładka symulatora podglądania pokazuje dlaczego.
Wielkość próby w skrócie
Odwiedzający na wariant przy 95% ufności i 80% mocy, test dwustronny. Pomnóż przez dwa dla testu z dwoma wariantami.
Stopa bazowa
Wzrost +5%
Wzrost +10%
Wzrost +20%
Wzrost +50%
1%
około 637 000
około 163 000
około 42 700
około 7800
3%
około 208 000
około 53 200
około 13 900
około 2500
5%
około 122 000
około 31 200
około 8200
około 1500
10%
około 57 800
około 14 800
około 3800
około 690
20%
około 25 600
około 6500
około 1700
około 290
Przykłady z obliczeniami
Strona rejestracji z konwersją 5%, cel +10%
Stopa bazowa 5%, minimalny wykrywalny efekt 10% (cel 5,5%), 95% ufności, 80% mocy, test dwustronny. Wynik: około 31 000 odwiedzających na wariant, łącznie 62 000.
Przy 1000 odwiedzających dziennie to 62 dni, czyli dziewięć pełnych tygodni. Wiele zespołów uznałoby to za zbyt długo i albo przetestowałoby odważniejszą zmianę, albo zaakceptowało, że ta strona potrzebuje wzrostu o 20% lub więcej, by dało się ją przetestować w dwa tygodnie.
Krok zamówienia z konwersją 3%, cel +20%
Stopa bazowa 3%, minimalny wykrywalny efekt 20% (cel 3,6%). Wynik: około 13 900 odwiedzających na wariant.
Niższe stopy bazowe wymagają więcej odwiedzających dla tego samego wzrostu względnego, bo jest mniej konwersji do policzenia. Wzrost względny o 20% to tu tylko 0,6 punktu procentowego, a test musi odróżnić 3,0% od 3,6%.
Trzy warianty przeciwko grupie kontrolnej
Stopa bazowa 5%, wzrost 10%, cztery warianty łącznie z kontrolnym. Alfa na porównanie wynosi 0,05 / 3, a próba na wariant rośnie o około jedną trzecią. Suma to cztery razy wartość na wariant.
Dodawanie wariantów to najszybszy sposób, by zamienić dwutygodniowy test w dwumiesięczny. Testuj jeden mocny pomysł przeciwko grupie kontrolnej, a kolejny uruchom potem.
Błędy przy wielkości próby
Ustalanie wielkości testu po obejrzeniu pierwszych wyników. Wzrost, który akurat widać trzeciego dnia, to nie minimalny wykrywalny efekt, tylko szum z własnym zdaniem.
Używanie wzrostu bezwzględnego tam, gdzie chodziło o względny. "Wzrost o 10%" przy stopie bazowej 2% to albo 2,2%, albo 12%, a wielkości próby różnią się setki razy.
Zatrzymanie po osiągnięciu wielkości próby, gdy wynik nie jest istotny, i nazwanie tego porażką. Osiągnięcie wielkości próby oznacza, że test może wykryć podany efekt. Nie mówi nic o mniejszych efektach.
Liczenie odsłon jako odwiedzających. Wzór zakłada, że każda jednostka to jeden niezależny odwiedzający z jednym wynikiem, a powtórne odsłony zawyżają liczbę i ufność.
Kończenie w połowie tygodnia. Jeśli wielkość próby zostaje osiągnięta w czwartek, prowadź test do najbliższej niedzieli. Rozkład dni tygodnia zmienia stopy konwersji bardziej niż większość testowanych zmian.
Wielkość próby: FAQ
Jak długo prowadzić test A/B?
Dopóki każdy wariant nie osiągnie wielkości próby dla wzrostu, który chcesz wykryć, i co najmniej pełny tydzień, najlepiej dwa. Wpisz powyżej dziennych odwiedzających, a kalkulator zamieni wielkość próby na dni i pełne tygodnie. Prowadzenie testu dłużej, niż trzeba, to niewielka strata. Zatrzymanie go wcześniej, bo wynik wygląda dobrze, to sposób, w jaki ogłasza się większość fałszywych zwycięzców.
Czym jest minimalny wykrywalny efekt?
To najmniejszy wzrost, który test ma niezawodnie wyłapać, wybrany przed startem testu. Zwykle podaje się go jako zmianę względną, więc MDE 10% przy stopie bazowej 4% oznacza, że test potrafi odróżnić 4,0% od 4,4%. Mniejsze MDE wymagają dramatycznie więcej odwiedzających: zmniejszenie MDE o połowę mniej więcej czterokrotnie zwiększa próbę.
Co oznacza moc 80%?
Że jeśli prawdziwy wzrost ma dokładnie podaną wielkość, test tej wielkości wyjdzie istotny w 80% przypadków. W pozostałych 20% przeoczy prawdziwego zwycięzcę. Moc to lustrzane odbicie ufności: ufność ogranicza fałszywe alarmy, moc ogranicza przeoczonych zwycięzców.
Dlaczego niższa stopa konwersji wymaga więcej odwiedzających?
Bo test liczy konwersje, a nie odwiedzających. Przy stopie 1% 10 000 odwiedzających daje 100 zdarzeń do porównania, a przy 10% daje 1000. Ten sam wzrost względny jest znacznie łatwiej zobaczyć w drugim przypadku. Dlatego testowanie metryki wyżej w lejku, do której dociera więcej odwiedzających, jest często jedynym sposobem, by mała strona w ogóle mogła testować.
Czy mogę testować więcej niż jeden wariant?
Tak, a kalkulator poprawnie ustala wielkość takiego testu, ale każdy dodatkowy wariant to kolejne porównanie z grupą kontrolną i ufność trzeba między nie podzielić. Cztery warianty przy 95% bez poprawki to 14% szansy na co najmniej jednego fałszywego zwycięzcę. Kalkulator dzieli alfę między porównania, dlatego liczba na wariant rośnie.
Czy to działa dla przychodu lub średniej wartości zamówienia?
Nie, ta strona ustala wielkość testu dla stopy konwersji. Metryki ciągłe, takie jak przychód na odwiedzającego, wymagają wariancji metryki, która zwykle jest znacznie większa niż dla proporcji, więc wielkości próby są odpowiednio większe. Potrzebujesz do tego własnej historycznej wariancji i obliczeń opartych na teście t.