Woher weiß ich, ob mein A/B-Test statistisch signifikant ist?
Gib die Besucher und Conversions jeder Variante ein, wähle ein Konfidenzniveau (95 % ist Standard) und lies das Urteil. Der Test ist signifikant, wenn der p-Wert unter 1 minus deiner Konfidenz liegt, also unter 0,05 bei 95 %. Diese Seite sagt dir außerdem das Intervall für den wahren Lift und ob der Test den Effekt, den du gerade anschaust, überhaupt hätte erkennen können, was ein nackter p-Wert nicht kann.
Was bedeutet ein p-Wert von 0,08 für meinen Test?
Dass, wenn A und B wirklich gleich gut konvertieren würden, ein mindestens so großer Abstand in etwa 8 % der Fälle zufällig auftauchen würde. Es ist nicht die Wahrscheinlichkeit, dass das Ergebnis falsch ist, und es ist nicht "92 % Konfidenz, dass B besser ist". Bei 95 % Konfidenz heißt es, der Test hat die Latte nicht gerissen; schau auf die Kachel mit dem kleinsten erkennbaren Lift, um zu sehen, ob er das je hätte schaffen können.
Reichen 90 % Konfidenz aus?
Können sie, wenn du dich vor dem Teststart für 90 % entschieden hast und eine Falsch-Positiv-Rate von eins zu zehn akzeptierst. Was nie ausreicht: mit 95 % starten, 91 % sehen und beschließen, 90 % sei schon immer die eigentliche Schwelle gewesen. Das Konfidenzniveau ist ein Versprechen darüber, wie oft du bereit bist, dich täuschen zu lassen; es nach dem Hinsehen zu ändern bricht das Versprechen.
Wie viele Conversions brauche ich pro Variante?
Es gibt keine magische Zahl, aber unter etwa 25 Conversions pro Arm ist der z-Test eine grobe Skizze, und die meisten echten Tests brauchen Hunderte. Die Zahl, die zählt, ist der Lift, den du erkennen willst: Bei einer Basisrate von 5 % braucht ein relativer Lift von 10 % bei 95 % Konfidenz und 80 % Power etwa 31.000 Besucher pro Variante, ungefähr 1.550 Conversions je Arm. Der Tab Stichprobengröße rechnet das für deine eigenen Raten.
Was ist der Unterschied zwischen dem frequentistischen p-Wert und der bayesschen Wahrscheinlichkeit, dass B besser ist?
Der p-Wert fragt "wie überraschend ist dieser Abstand, wenn sich nichts geändert hat?" und gibt ein Ja oder Nein an einer Schwelle. Die bayessche Zahl fragt "wie wahrscheinlich liegt die wahre Rate von B über der von A, angesichts dessen, was ich gesehen habe?" und gibt eine Wahrscheinlichkeit. Auf denselben Daten stimmen sie in der Richtung meist überein: Ein p von 0,05 liegt bei einem zweiseitigen Test nahe einer 97-%-Wahrscheinlichkeit, dass B besser ist. Diese Seite zeigt beides, weil der bayessche Satz der ist, den Leute meinen, wenn sie "Konfidenz" sagen, und der p-Wert der ist, den ihr Tool druckt.
Warum verweigert der Rechner das Urteil, wenn der Split nicht stimmt?
Weil ein Sample Ratio Mismatch bedeutet, dass die zwei Gruppen nicht zufällig zugeteilt wurden, und Randomisierung ist der ganze Grund, warum ein A/B-Test funktioniert. Wenn du 50/50 geplant hast und der beobachtete Split eine Wahrscheinlichkeit von unter eins zu tausend hat, zufällig zu entstehen, entscheidet irgendein Mechanismus, wer in welchem Arm landet, und der könnte mit der Conversion zusammenhängen. Der Lift, den du siehst, könnte dieser Mechanismus sein, nicht deine Änderung.
Kann ich diesen Rechner für Umsatz pro Besucher oder den durchschnittlichen Bestellwert nutzen?
Nein. Diese Seite testet einen Anteil: Jeder Besucher hat konvertiert oder nicht. Umsatz pro Besucher ist eine stetige, stark schiefe Metrik und braucht einen t-Test oder einen Bootstrap auf den Beträgen pro Nutzer, wofür man die Rohdaten braucht statt vier Summen. Der t-Test-Rechner in den Coddy-Mathe-Rechnern übernimmt den Vergleich von Mittelwerten, sobald du die Werte pro Nutzer hast.
Woher kommt der kleinste erkennbare Lift?
Aus derselben Formel wie beim Stichprobengrößen-Rechner, rückwärts gerechnet. Aus deinen Armgrößen und der Rate von A findet sie den relativen Lift, den 80 % der Tests dieser Größe bei deinem Konfidenzniveau erwischen würden. Liegt dein beobachteter Lift darunter, war dein Test für diesen Effekt unterpowert, und "nicht signifikant" sagt dann fast nichts darüber, ob die Änderung funktioniert hat.