Menu

A/B-Test-Rechner

Gib die Besucher und Conversions jeder Variante ein. Du bekommst das Urteil in einem Satz, den p-Wert mit Rechenweg, das Intervall, die bayessche Wahrscheinlichkeit, dass B besser ist, einen Check, ob der Traffic-Split intakt ist, und den kleinsten Lift, den dieser Test überhaupt hätte sehen können.

Von Nethanel Bar, Co-founder & CEO

Zuletzt aktualisiert

Bereit, wirklich programmieren zu lernen?

Coddy bringt es dir bei, indem du echten Code im Browser schreibst: interaktive Lektionen, sofortiges Feedback und KI-Hilfe, wenn du feststeckst.

Was dir dieser Rechner sagt, was die anderen verschweigen

Jeder A/B-Test-Rechner spuckt einen p-Wert aus. Die meisten hören da auf, und so kommt es, dass Gründer auf 87 % Konfidenz starren und sich fragen, was das heißen soll. Dieser Rechner beantwortet die Fragen, die wirklich entscheiden, was du als Nächstes tust. Ist der Unterschied größer, als der Zufall ihn erzeugen würde? Wie groß könnte der wahre Lift sein, im schlechtesten und im besten Fall? Wenn der Test "nicht signifikant" ausgeht: Hätte er bei dieser Stichprobengröße überhaupt etwas finden können? Und ist der Traffic-Split selbst gesund, oder vergleichst du zwei Gruppen, die nie gleich waren?

Er rechnet den klassischen z-Test für zwei Anteile, denselben, den Optimizelys klassische Engine, VWOs frequentistischer Modus und jedes Statistiklehrbuch verwenden, und zeigt jede Zeile der Arithmetik: die gepoolte Rate, den Standardfehler, den z-Wert und die Fläche im Rand. Daneben steht die bayessche Antwort, die Wahrscheinlichkeit, dass die wahre Rate von B über der von A liegt, denn "mit 91 % Wahrscheinlichkeit ist B besser" ist der Satz, den die meisten vom p-Wert erhofft hatten, und es ist eine andere Zahl.

Wir haben ihn gebaut, nachdem wir auf unser eigenes Dashboard geschaut haben. Coddy hat etwa zwanzig benannte Experimente laufen lassen, zehn davon Preistests pro Land auf kleinen Traffic-Scheiben, und unser internes Tool zeigte einen Konfidenzbalken mit den Worten "Weiterlaufen lassen" unter 95 %. Das ist optionales Stoppen mit freundlichem Gesicht. Die drei Tabs neben diesem, Stichprobengröße, Realitätscheck und Peeking-Simulator, gibt es, weil ein Rechner, der nur Signifikanz meldet, ein Rechner ist, mit dem du dich schneller selbst täuschst.

Was du wissen solltest, bevor du der Zahl traust

  • "Nicht signifikant" heißt nicht "kein Unterschied". Es heißt, die Daten können es nicht sagen. Die Kachel mit dem kleinsten Lift, den dieser Test sehen konnte, ist die ehrliche Lesart: Liegt dein beobachteter Lift darunter, konnte der Test die Frage nie beantworten.
  • Der p-Wert ist nicht die Wahrscheinlichkeit, dass du falsch liegst. Er ist die Wahrscheinlichkeit, einen so großen Abstand zu sehen, wenn beide Varianten identisch wären. Wie wahrscheinlich der Gewinner echt ist, hängt auch davon ab, wie oft deine Ideen funktionieren, und der Realitätscheck-Tab macht daraus eine Zahl.
  • Am ersten Tag zu stoppen, an dem der Balken grün wird, ist die teuerste Angewohnheit im A/B-Testing. Täglich nachsehen und früh stoppen macht aus 5 % Falsch-Positiv-Rate 20 % oder mehr. Der Peeking-Simulator zeigt es auf deinem eigenen Traffic.
  • Ein kaputter Split vergiftet alles. Wenn du 50/50 geplant hast und 46/54 bekommst, leitet irgendetwas Nutzer um, bevor sie den Test erreichen: eine Caching-Schicht, ein Bot-Filter, ein Redirect. Der Rechner prüft das zuerst und verweigert das Urteil, solange der Check fehlschlägt.
  • Unter etwa 25 Conversions pro Arm ist die Normalapproximation hinter dem z-Test eine Skizze, keine Messung. Der Rechner sagt das, statt drei Nachkommastellen falscher Präzision zu drucken.

So benutzt du den A/B-Test-Rechner

  1. Besucher und Conversions für A und B eingeben

    Besucher sind die Personen, die dieser Variante zugeteilt wurden, nicht Seitenaufrufe. Conversions sind die, die das getan haben, was du misst: registriert, bezahlt, geklickt. Beides muss für beide Arme gleich gezählt werden.

  2. Konfidenz und Hypothese wählen

    95 % zweiseitig ist der Standard und die ehrliche Wahl, wenn B besser oder schlechter sein könnte. Einseitig nur, wenn ein schlechteres B genauso ignoriert würde wie gar keine Änderung, und das ist seltener, als man denkt.

  3. Urteil lesen, dann das Intervall

    Das Banner sagt, was die Zahlen hergeben. Die Kachel mit dem relativen Lift zeigt das Intervall: Der wahre Effekt liegt wahrscheinlich irgendwo darin, und das untere Ende ist die Zahl, mit der du planen solltest, nicht die Punktschätzung.

  4. Die zwei Warnungen prüfen

    Wird der Split markiert, repariere den Test, bevor du irgendetwas anderes liest. Ist der kleinste erkennbare Lift größer als dein beobachteter, war der Test unterpowert: Geh zum Tab Stichprobengröße und sieh nach, wie viele Besucher es bräuchte.

  5. Ergebnis oder Link kopieren

    Ergebnis kopieren gibt dir die Zusammenfassung für eine Nachricht oder ein Dokument. Link kopieren packt die vier Zahlen in die URL, sodass jeder, der ihn öffnet, dieselbe Rechnung sieht.

Die Ausgaben lesen

Was jede Kachel bedeutet, in einer Zeile.

KachelWas es istWie du es liest
Relativer Lift(Rate B minus Rate A) geteilt durch Rate ADie Schlagzeile. Das Intervall daneben ist der Bereich, in dem der wahre Lift wahrscheinlich liegt.
p-WertWahrscheinlichkeit eines so großen Abstands, wenn A und B identisch wärenUnter 0,05 bei 95 % Konfidenz heißt signifikant. Es ist nicht die Wahrscheinlichkeit, dass das Ergebnis falsch ist.
Konfidenz1 minus p, in ProzentDie Zahl, die die meisten Tools drucken. 87 % ist nicht fast 95 %; es ist eine Münze auf der falschen Seite der Linie.
Wahrscheinlichkeit, dass B besser istBayessche Wahrscheinlichkeit, dass die wahre Rate von B über der von A liegtDer Satz, den alle wollen. 91 % heißt, B ist wahrscheinlich besser, nicht, dass B 91 % besser ist.
Kleinster Lift, den dieser Test sehen konnteDer relative Lift, der bei 80 % Power mit diesen Armgrößen erkennbar istLiegt dein beobachteter Lift darunter, heißt "nicht signifikant" nur "konnte es nicht sagen".
Traffic-SplitBeobachteter Besucheranteil je Arm gegen den PlanMarkiert, wenn der Split stärker abweicht, als der Zufall erlaubt. Repariere den Test, bevor du Ergebnisse liest.

Drei Tests, drei verschiedene Lektionen

Der Klassiker: fast geschafft

A: 10.000 Besucher, 500 Conversions (5,00 %). B: 10.000 Besucher, 560 Conversions (5,60 %). Relativer Lift +12 %, p = 0,058.

Nicht signifikant bei 95 %, und das Intervall reicht von etwa minus 0,4 % bis plus 24 %. Die ehrliche Lesart ist "wahrscheinlich ein kleines Plus, könnte auch nichts sein". Der kleinste Lift, den dieser Test erkennen konnte, liegt bei etwa 17 %, also war ein 12-%-Effekt von Anfang an dazu verdammt, in der Grauzone zu landen. Es braucht ungefähr doppelt so viel Traffic, nicht noch eine Woche Hoffen.

Der kaputte Split

A: 5.000 Besucher, 100 Conversions. B: 4.300 Besucher, 120 Conversions. Geplanter Split 50/50.

B sieht mit +40 % nach einem klaren Gewinner aus. Der Rechner weigert sich, das zu sagen: Ein Split von 5.000 zu 4.300 hat bei 50/50 eine Wahrscheinlichkeit von unter eins zu einer Million, zufällig zustande zu kommen. Irgendetwas entfernt Nutzer aus B, bevor sie gezählt werden, oft ein Redirect, der in einem Browser fehlschlägt, oder ein Bot-Filter, der die Variante anders behandelt. Was auch immer es ist: Die zwei Gruppen sind nicht vergleichbar und der Lift ist bedeutungslos.

Die kleine Website

A: 400 Besucher, 12 Conversions (3,0 %). B: 400 Besucher, 19 Conversions (4,75 %). Relativer Lift +58 %, p = 0,20.

Ein Lift von 58 % klingt gewaltig, und der p-Wert liegt bei etwa 0,19. Mit 12 und 19 Conversions markiert der Rechner zu wenig Daten: Die Zahlen schwanken bei dieser Größe so stark, dass eine einzige zusätzliche Anmeldung die Rate um einen Viertelpunkt verschiebt. Bei diesem Traffic liegt der kleinste Lift, den der Test in einem Monat bestätigen könnte, über 100 %. Das ist kein Grund, ihn länger laufen zu lassen; es ist ein Grund, den Realitätscheck-Tab zu lesen.

Fehler, die dieser Rechner abfangen soll

  • 90 % Konfidenz als "passt schon" lesen. Bei 95 % liegt die Linie bei 95 %. Eine Zahl darunter heißt, die Daten haben die Latte nicht gerissen, die du gesetzt hast, und die Latte nach dem Hinsehen zu verschieben ist der Fehler, nicht die Zahl.
  • Einen nicht signifikanten Test ein Unentschieden nennen. Ein Unentschieden ist ein winziges Intervall um null. Ein nicht signifikanter Test mit breitem Intervall ist eine unbeantwortete Frage, und der Tab Stichprobengröße sagt, was die Antwort kosten würde.
  • Am ersten Morgen, an dem der Balken grün wird, einen Gewinner ausrufen. Der Peeking-Simulator lässt zweitausend Tests laufen, in denen sich nichts geändert hat, und zeigt, wie viele davon ein täglicher Gucker ausgeliefert hätte.
  • Fünf Varianten testen und die beste bei 95 % melden. Fünf Vergleiche mit je 5 % sind eine 23-%-Chance auf einen Scheingewinner. Der Tab Stichprobengröße teilt Alpha für dich auf, wenn du Varianten hinzufügst.
  • Seitenaufrufe mit eindeutigen Nutzern vergleichen oder Conversions über ein anderes Zeitfenster zählen als Besucher. Der z-Test nimmt an, dass jeder Besucher ein unabhängiger Versuch ist; alles andere bläht die Konfidenz auf.
  • Den Split ignorieren. Ein 48/52-Split bei 100.000 Besuchern ist kein Zufall; es ist ein Bug, und jedes Ergebnis dahinter ist unbrauchbar.

FAQ zum A/B-Test-Rechner

Woher weiß ich, ob mein A/B-Test statistisch signifikant ist?
Gib die Besucher und Conversions jeder Variante ein, wähle ein Konfidenzniveau (95 % ist Standard) und lies das Urteil. Der Test ist signifikant, wenn der p-Wert unter 1 minus deiner Konfidenz liegt, also unter 0,05 bei 95 %. Diese Seite sagt dir außerdem das Intervall für den wahren Lift und ob der Test den Effekt, den du gerade anschaust, überhaupt hätte erkennen können, was ein nackter p-Wert nicht kann.
Was bedeutet ein p-Wert von 0,08 für meinen Test?
Dass, wenn A und B wirklich gleich gut konvertieren würden, ein mindestens so großer Abstand in etwa 8 % der Fälle zufällig auftauchen würde. Es ist nicht die Wahrscheinlichkeit, dass das Ergebnis falsch ist, und es ist nicht "92 % Konfidenz, dass B besser ist". Bei 95 % Konfidenz heißt es, der Test hat die Latte nicht gerissen; schau auf die Kachel mit dem kleinsten erkennbaren Lift, um zu sehen, ob er das je hätte schaffen können.
Reichen 90 % Konfidenz aus?
Können sie, wenn du dich vor dem Teststart für 90 % entschieden hast und eine Falsch-Positiv-Rate von eins zu zehn akzeptierst. Was nie ausreicht: mit 95 % starten, 91 % sehen und beschließen, 90 % sei schon immer die eigentliche Schwelle gewesen. Das Konfidenzniveau ist ein Versprechen darüber, wie oft du bereit bist, dich täuschen zu lassen; es nach dem Hinsehen zu ändern bricht das Versprechen.
Wie viele Conversions brauche ich pro Variante?
Es gibt keine magische Zahl, aber unter etwa 25 Conversions pro Arm ist der z-Test eine grobe Skizze, und die meisten echten Tests brauchen Hunderte. Die Zahl, die zählt, ist der Lift, den du erkennen willst: Bei einer Basisrate von 5 % braucht ein relativer Lift von 10 % bei 95 % Konfidenz und 80 % Power etwa 31.000 Besucher pro Variante, ungefähr 1.550 Conversions je Arm. Der Tab Stichprobengröße rechnet das für deine eigenen Raten.
Was ist der Unterschied zwischen dem frequentistischen p-Wert und der bayesschen Wahrscheinlichkeit, dass B besser ist?
Der p-Wert fragt "wie überraschend ist dieser Abstand, wenn sich nichts geändert hat?" und gibt ein Ja oder Nein an einer Schwelle. Die bayessche Zahl fragt "wie wahrscheinlich liegt die wahre Rate von B über der von A, angesichts dessen, was ich gesehen habe?" und gibt eine Wahrscheinlichkeit. Auf denselben Daten stimmen sie in der Richtung meist überein: Ein p von 0,05 liegt bei einem zweiseitigen Test nahe einer 97-%-Wahrscheinlichkeit, dass B besser ist. Diese Seite zeigt beides, weil der bayessche Satz der ist, den Leute meinen, wenn sie "Konfidenz" sagen, und der p-Wert der ist, den ihr Tool druckt.
Warum verweigert der Rechner das Urteil, wenn der Split nicht stimmt?
Weil ein Sample Ratio Mismatch bedeutet, dass die zwei Gruppen nicht zufällig zugeteilt wurden, und Randomisierung ist der ganze Grund, warum ein A/B-Test funktioniert. Wenn du 50/50 geplant hast und der beobachtete Split eine Wahrscheinlichkeit von unter eins zu tausend hat, zufällig zu entstehen, entscheidet irgendein Mechanismus, wer in welchem Arm landet, und der könnte mit der Conversion zusammenhängen. Der Lift, den du siehst, könnte dieser Mechanismus sein, nicht deine Änderung.
Kann ich diesen Rechner für Umsatz pro Besucher oder den durchschnittlichen Bestellwert nutzen?
Nein. Diese Seite testet einen Anteil: Jeder Besucher hat konvertiert oder nicht. Umsatz pro Besucher ist eine stetige, stark schiefe Metrik und braucht einen t-Test oder einen Bootstrap auf den Beträgen pro Nutzer, wofür man die Rohdaten braucht statt vier Summen. Der t-Test-Rechner in den Coddy-Mathe-Rechnern übernimmt den Vergleich von Mittelwerten, sobald du die Werte pro Nutzer hast.
Woher kommt der kleinste erkennbare Lift?
Aus derselben Formel wie beim Stichprobengrößen-Rechner, rückwärts gerechnet. Aus deinen Armgrößen und der Rate von A findet sie den relativen Lift, den 80 % der Tests dieser Größe bei deinem Konfidenzniveau erwischen würden. Liegt dein beobachteter Lift darunter, war dein Test für diesen Effekt unterpowert, und "nicht signifikant" sagt dann fast nichts darüber, ob die Änderung funktioniert hat.

Weitere Entwickler-Tools

Illustration der Programmiersprachen bei Coddy

Lerne mit Coddy zu programmieren

LOS GEHT'S