Czy mogę robić testy A/B? Sprawdzenie realiów ruchu
Pytanie, które warto zadać przed pierwszym testem, a nie po dziesiątym. Wpisz miesięcznych odwiedzających, stopę konwersji i wzrost, na który naprawdę zareagujesz, a dostaniesz prostą odpowiedź: działaj, na granicy albo stop i zrób coś innego.
Większość małych stron nie może robić testów A/B i nikt im tego nie mówi
Każdy poradnik o testach A/B pisze firma z milionami odwiedzających. Zespół eksperymentów Microsoftu, Google, Booking.com i Airbnb prowadzą tysiące testów rocznie, a ich rady są dobre dla nich: testuj wszystko, ufaj danym, wdrażaj zwycięzców. Startup z 8000 odwiedzających miesięcznie czyta te same rady, buduje ten sam panel, a potem nie rozumie, dlaczego każdy test kończy się na 87% ufności ze wzrostem, który co tydzień maleje. Nie robi tego źle. Robi coś, co przy tej skali nie działa.
Ta strona wykonuje rachunki, które poradniki pomijają. Przy 8000 odwiedzających miesięcznie i konwersji 3% potwierdzenie wzrostu o 10% wymaga około 106 000 odwiedzających: trzynastu miesięcy całego ruchu, przez cały ten czas z zamrożoną stroną. W cztery tygodnie najmniejszy możliwy do potwierdzenia wzrost to około 40%. To nie są problemy do dostrojenia. Ronny Kohavi, który kierował eksperymentami w Microsofcie i Airbnb, stawia praktyczny próg wykrywania jednocyfrowych wzrostów na kilkuset tysiącach użytkowników. Poniżej tego sugeruje, że testy A/B mogą być przedwczesne, a badania z użytkownikami lepszą inwestycją.
Piszemy to z doświadczenia. Panel Coddy obsłużył około dwudziestu nazwanych eksperymentów, z czego dziesięć to testy cen w pojedynczych krajach, każdy na małym wycinku ruchu, i pokazywał "Kontynuuj", gdy ufność była poniżej 95%. Kilka oznaczono jako udane i wdrożono. Patrząc wstecz z tym kalkulatorem, część tych testów nie mogła wykryć wzrostów, które im przypisano. Uczciwa wersja tamtego panelu to ta strona: na co ten ruch może odpowiedzieć, ile by to trwało i jak często zwycięzca byłby fałszywym alarmem?
Co decyduje, czy możesz testować
Ogranicza cię liczba konwersji miesięcznie, a nie odwiedzających. Strona z 8000 odwiedzających przy 3% ma 240 konwersji miesięcznie do podziału między dwa warianty. Test z potrzebuje setek na wariant, zanim cokolwiek powie.
Wzrost, na który zareagujesz, wyznacza rachunek. Odpowiedz szczerze: jeśli wdrożysz zmianę dla wzrostu o 3%, potrzebujesz testu, który widzi 3%, a prawie żadna mała strona tego nie potrafi.
Czas to koszt, a nie rozwiązanie. Test trwający kwartał zamraża stronę na kwartał, obejmuje sezony i kampanie i kończy się w innym biznesie niż ten, w którym się zaczął.
To, jak często twoje pomysły działają, zmienia znaczenie zwycięzcy. Jeśli jeden pomysł na dziesięć naprawdę rusza metrykę, to przy 95% ufności i 80% mocy ponad jedna trzecia "istotnych" zwycięzców to fałszywe alarmy. Stopa bazowa to nie szczegół techniczny, tylko większość odpowiedzi.
Poniżej progu są lepsze metody. Porozmawiaj z pięcioma użytkownikami, obejrzyj nagrania sesji, wdróż zmianę i porównaj przed i po z szerokimi słupkami błędu albo testuj metrykę, do której dociera więcej odwiedzających, na przykład kliknięcie zamiast zakupu.
Jak przeprowadzić sprawdzenie realiów
1
Wpisz miesięcznych odwiedzających, którzy zobaczą test
Nie całą stronę. Jeśli test dotyczy strony cennika, liczą się odwiedzający cennik. Jeśli to krok zamówienia, liczą się osoby, które do niego docierają.
2
Wpisz obecną stopę konwersji tego kroku
Kalkulator pokazuje, ile konwersji miesięcznie z tego wynika, a to jest prawdziwe ograniczenie.
3
Określ wzrost, na który zareagujesz
Wzrost względny, przy którym wdrożysz zmianę. Większość osób mówi 10% i tak myśli. Jeśli u ciebie to mniej, przyznaj to szczerze.
4
Przeczytaj werdykt i drabinkę
Działaj oznacza mniej niż miesiąc. Na granicy oznacza mniej niż kwartał, przez cały czas z zamrożoną stroną. Stop oznacza, że test nie odpowie na pytanie przy twoim ruchu. Drabinka pokazuje, ile kosztowałyby większe wzrosty.
5
Wybierz stopę bazową i przeczytaj ryzyko fałszywego alarmu
Wybierz, jak często twoje pomysły naprawdę działają. Kafelek pokazuje, jaka część istotnych wyników byłaby przy tej stopie fałszywymi alarmami. Warto zapamiętać tę liczbę, gdy następny test zrobi się zielony.
Miesiące do potwierdzenia wzrostu o 10% przy 95% ufności i 80% mocy
Dwa warianty, każdy odwiedzający trafia do testu. Znajdź swój wiersz i swoją kolumnę.
Odwiedzający miesięcznie
Bazowa 1%
Bazowa 3%
Bazowa 5%
Bazowa 10%
3,000
ponad 100 mies.
35 mies.
21 mies.
9,8 mies.
8,000
41 mies.
13 mies.
7,8 mies.
3,7 mies.
25,000
13 mies.
4,3 mies.
2,5 mies.
5 tyg.
100,000
3,3 mies.
5 tyg.
19 dni
9 dni
500,000
20 dni
6 dni
4 dni
2 dni
Trzy strony, trzy werdykty
SaaS na wczesnym etapie
8000 odwiedzających miesięcznie, 3% rejestracji, chce zobaczyć wzrost o 10%. Werdykt: stop. Około 13 miesięcy i 106 000 odwiedzających. W cztery tygodnie najmniejszy możliwy do potwierdzenia wzrost to około 40%.
Dwieście czterdzieści rejestracji miesięcznie nie rozstrzygnie różnicy 0,3 punktu. Czas zespołu lepiej wydać na rozmowy z pięcioma użytkownikami i na zmiany na tyle duże, że będą widoczne bez testu: nowy nagłówek do nich nie należy, nowy model cenowy może.
Serwis z treściami
50 000 odwiedzających miesięcznie, 2% zapisów do newslettera, chce wzrostu o 10%. Werdykt: na granicy. Około 3,2 miesiąca. W cztery tygodnie najmniejszy możliwy do potwierdzenia wzrost to około 19%.
Da się testować, ale tylko odważne zmiany. Testowanie położenia formularza ma sens, jeśli może przesunąć zapisy o jedną piątą. Testowanie tekstu przycisku nie ma. Alternatywnie testuj kliknięcie prowadzące do formularza, które wykonuje znacznie więcej odwiedzających.
Marketplace
400 000 odwiedzających miesięcznie, 4% konwersji, chce wzrostu o 10%. Werdykt: działaj. Odwiedzający zbiorą się w mniej niż tydzień, ale i tak prowadź test przez dwa pełne tygodnie.
To skala, dla której pisze się poradniki o testach A/B. Pozostałe ryzyko to stopa bazowa: jeśli jeden pomysł na pięć naprawdę działa, mniej więcej co szósty istotny zwycięzca to wciąż fałszywy alarm, a zakładka symulatora podglądania pokazuje, jak szybko to się pogarsza przy codziennym sprawdzaniu.
Błędy przy testach z małym ruchem
Uruchamianie testu mimo wszystko i odczytywanie go przy 85%. Ustalony poziom ufności to obietnica, jak często zgadzasz się dać się oszukać. Odczytywanie poniżej niego po fakcie to to samo, co nieustalenie go wcale.
Testowanie drobnych zmian. Kolory przycisków i zamiany słów dają w najlepszym razie wzrost o kilka procent, czego małe strony nie wykryją. Jeśli już testujesz, testuj coś, co realnie może przesunąć liczbę o jedną trzecią.
Testowanie na dole lejka. Zakupy są rzadkie, kliknięcia częste. Test na kliknięciu prowadzącym do zakupu ma dziesięć razy więcej zdarzeń i ma szansę się zakończyć.
Prowadzenie testu przez pół roku. Sezony, kampanie i zmiany produktu przenikają do niego, a oba warianty w końcu mierzą różne epoki.
Ufanie zwycięzcy, bo był istotny. Gdy wśród twoich pomysłów jest niewielu prawdziwych zwycięzców, istotny wynik częściej jest fałszywym alarmem, niż sugeruje p-value. Kafelek ryzyka fałszywego alarmu przypisuje temu liczbę.
Traktowanie "nieistotnego" jako "pomysł nie wypalił". Przy małym ruchu prawie nic nie jest istotne. Pomysł może być dobry, po prostu test nie mógł tego zobaczyć.
Sprawdzenie realiów: FAQ
Ile ruchu potrzeba do testów A/B?
To zależy od stopy konwersji i wzrostu, który chcesz zobaczyć, dlatego ta strona pyta o oba. Orientacyjnie potwierdzenie wzrostu względnego o 10% przy konwersji 3% wymaga około 100 000 odwiedzających, a wzrostu o 30% około 12 000. Strony z mniej niż 10 000 odwiedzających miesięcznie zwykle mogą wykryć tylko bardzo duże efekty.
Co mała strona powinna robić zamiast testów A/B?
Rozmawiać z użytkownikami, na żywo lub przez rozmowę wideo: pięć rozmów wyłapuje większość problemów na stronie. Oglądać nagrania sesji. Wprowadzać odważne zmiany, wdrażać je i porównywać kilka tygodni przed i po, wiedząc, że to zgrubne porównanie. Testować metryki, do których dociera więcej odwiedzających. A gdy ruch się pojawi, wrócić tutaj i testować porządnie.
Czym jest ryzyko fałszywego alarmu i czym różni się od p-value?
P-value mówi, jak zaskakujący byłby wynik, gdyby nic się nie zmieniło. Ryzyko fałszywego alarmu mówi, ile z testów, które wyszły istotne, nie miało nic za sobą. Zależy od tego, jak często twoje pomysły naprawdę działają: przy stopie bazowej 10%, 95% ufności i 80% mocy około 36% istotnych zwycięzców to fałszywe alarmy. Duże programy eksperymentów podają, że tylko 10 do 33% pomysłów rusza ich metrykę, dlatego stopa bazowa ma tak duże znaczenie.
Czy test trwający 3,5 miesiąca jest naprawdę niemożliwy?
Nie jest niemożliwy i kalkulator do kwartału mówi "na granicy", a nie "stop". Ale strona zamrożona na kwartał to strona, której nikt nie ulepsza, a test obejmujący sezon lub kampanię porównuje dwa różne okresy. Jeśli zmiana jest na tyle duża, by uzasadnić kwartał czekania, prawdopodobnie jest też na tyle duża, by ją wdrożyć i zmierzyć przed i po.
Czy mogę obniżyć ufność do 90%, żeby test był szybszy?
Możesz, jeśli zdecydujesz o tym przed testem i zaakceptujesz jeden fałszywy alarm na dziesięć, dodatkowo do efektu stopy bazowej. To skraca test mniej więcej o jedną trzecią, a nie dziesięciokrotnie, czego mała strona by potrzebowała. Podniesienie testowanego wzrostu pomaga znacznie bardziej.
Dlaczego kalkulator mówi stop, skoro kalkulator wielkości próby podaje liczbę?
Oba używają tego samego wzoru. Strona wielkości próby podaje liczbę, a ta strona dzieli ją przez twój ruch i ocenia wynik. 106 000 odwiedzających to liczba, trzynaście miesięcy to werdykt.