Как понять, статистически значим ли мой A/B-тест?
Введи посетителей и конверсии каждого варианта, выбери уровень уверенности (стандарт - 95%) и прочитай вердикт. Тест значим, когда p-значение ниже единицы минус твоя уверенность, то есть ниже 0.05 при 95%. Эта страница также показывает интервал для настоящего прироста и говорит, мог ли тест вообще обнаружить эффект, на который ты смотришь, чего голое p-значение не умеет.
Что значит p-значение 0.08 для моего теста?
Что если бы A и B на самом деле конвертировали одинаково, разрыв не меньше этого случайно возникал бы примерно в 8% случаев. Это не вероятность того, что результат неверен, и не «92% уверенности, что B лучше». При уверенности 95% это значит, что тест не взял планку; посмотри на плитку наименьшего обнаруживаемого прироста, чтобы понять, мог ли он вообще.
Достаточно ли 90% уверенности?
Может быть, если ты выбрал 90% до начала теста и согласен на одно ложное срабатывание из десяти. Что никогда не достаточно, так это запустить тест на 95%, увидеть 91% и решить, что настоящим порогом всегда было 90%. Уровень уверенности - это обещание о том, как часто ты готов быть обманутым; менять его после просмотра - значит нарушить обещание.
Сколько конверсий нужно на вариант?
Волшебного числа нет, но ниже примерно 25 конверсий на группу z-тест - грубый набросок, а большинству настоящих тестов нужны сотни. Важнее прирост, который ты хочешь обнаружить: при базовой конверсии 5% увидеть относительный прирост 10% с уверенностью 95% и мощностью 80% требует около 31 000 посетителей на вариант, то есть примерно 1 550 конверсий в каждом. Вкладка размера выборки считает это для твоих конверсий.
В чём разница между частотным p-значением и байесовским шансом, что B лучше?
P-значение спрашивает «насколько удивителен такой разрыв, если ничего не изменилось?» и даёт «да» или «нет» по порогу. Байесовское число спрашивает «с учётом того, что я увидел, насколько вероятно, что истинная конверсия B выше, чем у A?» и даёт вероятность. На одних и тех же данных они обычно согласны по направлению: p = 0.05 в двустороннем тесте соответствует примерно 97% шансу, что B лучше. Страница показывает оба, потому что байесовская фраза - та, что люди имеют в виду, говоря «уверенность», а p-значение - то, что печатает их инструмент.
Почему калькулятор отказывается давать вердикт, когда сплит отклоняется?
Потому что перекос выборок означает, что группы назначались не случайно, а рандомизация - единственная причина, по которой A/B-тест вообще работает. Если ты планировал 50/50, а наблюдаемый сплит возникает по случайности реже, чем один раз на тысячу, какой-то механизм решает, кто попадёт в какую группу, и он может быть связан с конверсией. Прирост, который ты видишь, может быть этим механизмом, а не твоим изменением.
Можно ли использовать этот калькулятор для выручки на посетителя или среднего чека?
Нет. Эта страница проверяет долю: каждый посетитель либо сконвертировался, либо нет. Выручка на посетителя - непрерывная и сильно скошенная метрика, ей нужен t-тест или бутстрап на суммах по каждому пользователю, а для этого нужны сырые данные, а не четыре итога. Калькулятор t-теста среди математических калькуляторов Coddy сравнивает средние, когда у тебя есть значения по каждому пользователю.
Откуда берётся наименьший обнаруживаемый прирост?
Из той же формулы, что в калькуляторе размера выборки, только запущенной в обратную сторону. По твоим размерам групп и конверсии A она находит относительный прирост, который 80% тестов такого размера поймали бы при твоём уровне уверенности. Если наблюдаемый прирост ниже него, тесту не хватило мощности для этого эффекта, и «незначимо» почти ничего не говорит о том, сработало ли изменение.