Menu

Stichprobengrößen-Rechner für A/B-Tests

Wie viele Besucher jede Variante braucht, bevor der Test überhaupt etwas sagen kann, und wie viele Tage das bei deinem Traffic sind. Setze den kleinsten Lift, der sich zu erkennen lohnt, die Konfidenz und die Power, und lies die Anzahl mit der Formel darunter.

Von Nethanel Bar, Co-founder & CEO

Zuletzt aktualisiert

Bereit, wirklich programmieren zu lernen?

Coddy bringt es dir bei, indem du echten Code im Browser schreibst: interaktive Lektionen, sofortiges Feedback und KI-Hilfe, wenn du feststeckst.

Lege die Stichprobengröße fest, bevor du ein einziges Ergebnis anschaust

Eine Stichprobengröße ist ein Versprechen, das du dir selbst gibst, bevor der Test startet: "Ich schaue mir das Ergebnis an, wenn so viele Leute es gesehen haben, und nicht vorher." Ohne sie driftet jeder A/B-Test in dieselbe Geschichte. Die erste Woche sieht vielversprechend aus, in der zweiten schrumpft der Lift, jemand fragt, ob es schon signifikant ist, und der Test endet an dem Tag, an dem der Balken grün wird. Diese Seite gibt dir die Zahl für den Plan, damit das Enddatum eine Tatsache ist und keine Stimmung.

Die Rechnung ist die Standard-Stichprobengröße für zwei Anteile, dieselbe hinter Evan Millers Rechner und dem von Optimizely, und sie hängt von vier Dingen ab: der Basisrate, dem Lift, den du erkennen können willst, dem Konfidenzniveau und der Power. Power ist das, was alle überspringen. Bei 80 % Power wird ein echter Lift in der genannten Größe acht von zehn Mal erwischt; ein Test mit der halben Stichprobe hat weit weniger als die halbe Power, und deshalb ist ein unterpowerter Test nicht "eine gröbere Antwort", sondern meist gar keine.

Die Kurve unter dem Ergebnis ist der Teil, den du dir merken solltest. Die benötigten Besucher wachsen mit dem Quadrat von eins durch den Lift: Halbiere den Lift, den du sehen willst, und du brauchst etwa viermal so viel Traffic. Eine Website, die einen 30-%-Lift in zwei Wochen bestätigen kann, braucht etwa neunmal so lange für einen 10-%-Lift. Wenn die Tage in Monaten herauskommen, sagt dir der Rechner, dass du etwas Größeres testen oder im Funnel nach oben zu einer Metrik gehen solltest, die mehr Leute erreichen, bevor er dir sagt, dass du warten sollst.

Wovon die Stichprobengröße abhängt

  • Der kleinste erkennbare Effekt ist eine Entscheidung, keine Messung. Es ist der kleinste Lift, für den du die Änderung wirklich ausliefern würdest. Ihn niedrig zu setzen, um den Test "empfindlicher" zu machen, macht den Test länger, nicht besser.
  • Relative und absolute Lifts sind zwei verschiedene Tiere. Ein relativer Lift von 10 % auf eine Basisrate von 5 % ist ein halber Prozentpunkt. Diese Seite rechnet relativ, weil Ergebnisse so berichtet werden, und zeigt die Zielrate daneben, damit du beides siehst.
  • Zusätzliche Varianten kosten mehr als ihren Anteil. A gegen B, C und D zu testen sind drei Vergleiche, und die Konfidenz muss auf sie aufgeteilt werden. Der Rechner wendet die Bonferroni-Korrektur an und zeigt das Alpha, das jeder Vergleich tatsächlich bekommt.
  • Tage sind eine Obergrenze, keine Untergrenze. Auch wenn die Zahlen vier Tage sagen, lass mindestens eine volle Woche laufen, besser zwei, denn Wochentags- und Wochenendbesucher konvertieren unterschiedlich, und ein Test nur am Dienstag misst Dienstage.
  • 80 % Power heißt, einer von fünf echten Gewinnern wird verpasst. Wenn ein verpasster Gewinner für dich teuer ist, nimm 90 % und akzeptiere die größere Stichprobe.

So dimensionierst du einen A/B-Test

  1. Aktuelle Conversion-Rate eingeben

    Nimm die Rate der Seite oder des Schritts, den der Test verändert, gemessen an derselben Art von Besuchern, die der Test sehen wird. Nimm keinen Website-Durchschnitt, wenn du einen einzelnen Funnel-Schritt testest.

  2. Kleinsten lohnenden Lift wählen

    Frag dich, welcher Lift dich die Änderung ausliefern ließe. Das ist dein kleinster erkennbarer Effekt. 10 % relativ ist eine übliche Wahl für eine ausgereifte Seite; ein Redesign rechtfertigt vielleicht 20 % oder mehr.

  3. Konfidenz und Power setzen

    95 % Konfidenz und 80 % Power sind die Konventionen. Erhöhe die Konfidenz, wenn ein Scheingewinner teuer zurückzurollen ist; erhöhe die Power, wenn ein verpasster Gewinner teuer ist, weil du ihn liegen lässt.

  4. Tägliche Besucher eintragen

    Alle Varianten zusammen, und nur die Besucher, die den Test erreichen werden. Das Ergebnis wird in Tage und ganze Wochen umgerechnet.

  5. Enddatum aufschreiben

    Der Rechner gibt dir die Stichprobengröße pro Variante. Schreib sie mit dem Datum, das daraus folgt, in den Testplan, und lies keine Ergebnisse davor. Der Tab Peeking-Simulator zeigt, warum.

Stichprobengröße auf einen Blick

Besucher pro Variante bei 95 % Konfidenz und 80 % Power, zweiseitig. Für einen Test mit zwei Armen mal zwei nehmen.

Basisrate+5 % Lift+10 % Lift+20 % Lift+50 % Lift
1 %etwa 637.000etwa 163.000etwa 42.700etwa 7.800
3 %etwa 208.000etwa 53.200etwa 13.900etwa 2.500
5 %etwa 122.000etwa 31.200etwa 8.200etwa 1.500
10 %etwa 57.800etwa 14.800etwa 3.800etwa 690
20 %etwa 25.600etwa 6.500etwa 1.700etwa 290

Durchgerechnete Beispiele

Eine Anmeldeseite bei 5 %, auf der Suche nach +10 %

Basisrate 5 %, kleinster erkennbarer Effekt 10 % (Ziel 5,5 %), 95 % Konfidenz, 80 % Power, zweiseitig. Ergebnis: etwa 31.000 Besucher pro Variante, 62.000 insgesamt.

Bei 1.000 Besuchern am Tag sind das 62 Tage, also neun ganze Wochen. Viele Teams würden das zu lang finden und entweder eine mutigere Änderung testen oder akzeptieren, dass diese Seite einen Lift von 20 % oder mehr braucht, um in zwei Wochen testbar zu sein.

Ein Checkout-Schritt bei 3 %, auf der Suche nach +20 %

Basisrate 3 %, kleinster erkennbarer Effekt 20 % (Ziel 3,6 %). Ergebnis: etwa 13.900 Besucher pro Variante.

Niedrigere Basisraten brauchen für denselben relativen Lift mehr Besucher, weil es weniger Conversions zu zählen gibt. Ein relativer Lift von 20 % sind hier nur 0,6 Prozentpunkte, und der Test muss 3,0 % von 3,6 % unterscheiden.

Drei Varianten gegen eine Kontrolle

Basisrate 5 %, Lift 10 %, vier Varianten inklusive Kontrolle. Das Alpha pro Vergleich wird 0,05 / 3, und die Stichprobe pro Variante wächst um etwa ein Drittel; die Gesamtzahl ist das Vierfache des Werts pro Variante.

Varianten hinzuzufügen ist der schnellste Weg, aus einem Zwei-Wochen-Test einen Zwei-Monate-Test zu machen. Teste eine starke Idee gegen die Kontrolle; die nächste Idee kommt danach dran.

Fehler bei der Stichprobengröße

  • Den Test dimensionieren, nachdem man erste Ergebnisse gesehen hat. Der Lift, den du zufällig an Tag drei beobachtest, ist nicht der kleinste erkennbare Effekt; er ist Rauschen mit einer Meinung.
  • Einen absoluten Lift verwenden, wo ein relativer gemeint war. Ein "10-%-Lift" auf 2 % Basisrate ist entweder 2,2 % oder 12 %, und die Stichprobengrößen unterscheiden sich um das Hundertfache.
  • Bei Erreichen der Stichprobengröße ohne signifikantes Ergebnis stoppen und es eine Niederlage nennen. Die Stichprobengröße zu erreichen heißt, der Test kann den genannten Effekt erkennen. Über kleinere Effekte sagt das nichts.
  • Seitenaufrufe als Besucher zählen. Die Formel nimmt an, dass jede Einheit ein unabhängiger Besucher mit einem Ergebnis ist; wiederholte Aufrufe blähen die Anzahl und die Konfidenz auf.
  • Mitten in einer Woche aufhören. Wenn die Stichprobengröße an einem Donnerstag erreicht ist, lass bis zum folgenden Sonntag laufen; der Wochentagsmix verändert Conversion-Raten stärker als die meisten getesteten Änderungen.

FAQ zur Stichprobengröße

Wie lange sollte ich einen A/B-Test laufen lassen?
Bis jede Variante die Stichprobengröße für den Lift erreicht hat, den du erkennen willst, und mindestens eine volle Woche, besser zwei. Trag oben deine täglichen Besucher ein, und der Rechner macht aus der Stichprobengröße Tage und ganze Wochen. Länger als nötig zu laufen ist eine kleine Verschwendung; früh aufzuhören, weil das Ergebnis gut aussieht, ist der Weg, auf dem die meisten Scheingewinner ausgerufen werden.
Was ist der kleinste erkennbare Effekt (MDE)?
Der kleinste Lift, den der Test zuverlässig erwischen soll, vor dem Test festgelegt. Er wird meist als relative Änderung angegeben, ein MDE von 10 % auf 4 % Basisrate heißt also, der Test kann 4,0 % von 4,4 % unterscheiden. Kleinere MDEs brauchen drastisch mehr Besucher: Den MDE zu halbieren vervierfacht die Stichprobe ungefähr.
Was bedeuten 80 % Power?
Dass ein Test dieser Größe in 80 % der Fälle signifikant ausgeht, wenn der wahre Lift genau die Größe hat, die du genannt hast. In den anderen 20 % verpasst er einen echten Gewinner. Power ist das Spiegelbild der Konfidenz: Konfidenz begrenzt Fehlalarme, Power begrenzt verpasste Gewinner.
Warum braucht eine niedrigere Conversion-Rate mehr Besucher?
Weil der Test Conversions zählt, nicht Besucher. Bei 1 % geben dir 10.000 Besucher 100 Ereignisse zum Vergleichen; bei 10 % geben sie dir 1.000. Derselbe relative Lift ist im zweiten Fall viel leichter zu sehen. Deshalb ist das Testen einer Metrik weiter oben im Funnel, die mehr Besucher erreichen, oft der einzige Weg, wie eine kleine Website überhaupt testen kann.
Kann ich mehr als eine Variante laufen lassen?
Ja, und der Rechner dimensioniert das korrekt, aber jede zusätzliche Variante ist ein weiterer Vergleich gegen die Kontrolle, und die Konfidenz muss zwischen ihnen aufgeteilt werden. Vier Varianten bei 95 % ohne Korrektur sind eine 14-%-Chance auf mindestens einen Scheingewinner. Der Rechner teilt Alpha auf die Vergleiche auf, und deshalb wächst die Zahl pro Variante.
Funktioniert das für Umsatz oder durchschnittlichen Bestellwert?
Nein, diese Seite dimensioniert einen Test auf eine Conversion-Rate. Stetige Metriken wie Umsatz pro Besucher brauchen die Varianz der Metrik, die meist weit größer ist als die eines Anteils, und die Stichprobengrößen sind entsprechend größer. Dafür brauchst du deine eigene historische Varianz und eine Rechnung auf Basis des t-Tests.

Weitere Entwickler-Tools

Illustration der Programmiersprachen bei Coddy

Lerne mit Coddy zu programmieren

LOS GEHT'S