Die Frage, die man vor dem ersten Test stellt, nicht nach dem zehnten. Gib deine monatlichen Besucher, deine Conversion-Rate und den Lift ein, auf den du wirklich reagieren würdest, und bekomm eine klare Antwort: los, grenzwertig, oder stopp und mach etwas anderes.
Die meisten kleinen Websites können nicht A/B-testen, und niemand sagt es ihnen
Jeder A/B-Testing-Leitfaden wird von einer Firma mit Millionen Besuchern geschrieben. Microsofts Experimentier-Team, Google, Booking.com und Airbnb fahren Tausende Tests im Jahr, und ihr Rat ist für sie richtig: alles testen, den Daten vertrauen, ausliefern, was gewinnt. Ein Startup mit 8.000 Besuchern im Monat liest denselben Rat, baut dasselbe Dashboard und versteht dann nicht, warum jeder Test bei 87 % Konfidenz endet, mit einem Lift, der jede Woche schrumpft. Es macht nichts falsch. Es macht etwas, das bei dieser Größe nicht funktioniert.
Diese Seite macht die Rechnung, die die Leitfäden überspringen. Bei 8.000 Besuchern im Monat und 3 % Conversion braucht die Bestätigung eines 10-%-Lifts etwa 106.000 Besucher: dreizehn Monate lang jeden Besucher, den du hast, mit eingefrorener Seite die ganze Zeit. In vier Wochen liegt der kleinste bestätigbare Lift bei etwa 40 %. Das sind keine Feinjustierungsprobleme. Ronny Kohavi, der das Experimentieren bei Microsoft und Airbnb leitete, setzt die praktische Untergrenze für einstellige Lifts bei ein paar hunderttausend Nutzern an; darunter, sagt er, ist A/B-Testing womöglich verfrüht und Nutzerforschung das bessere Investment.
Wir schreiben das aus Erfahrung. Coddys eigenes Dashboard hat etwa zwanzig benannte Experimente gefahren, zehn davon Preistests in einzelnen Ländern, jeder auf einer kleinen Traffic-Scheibe, und meldete "Weiterlaufen lassen", sobald die Konfidenz unter 95 % lag. Mehrere wurden als erfolgreich markiert und ausgeliefert. Im Rückblick mit diesem Rechner hätten manche dieser Tests die Lifts, die ihnen zugeschrieben wurden, gar nicht erkennen können. Die ehrliche Version dieses Dashboards ist diese Seite: Was kann dieser Traffic beantworten, wie lange würde es dauern, und wie oft wäre ein Gewinner ein Fehlalarm?
Was entscheidet, ob du testen kannst
Conversions pro Monat, nicht Besucher, sind die Zahl, die dich begrenzt. Eine Seite mit 8.000 Besuchern bei 3 % hat 240 Conversions im Monat, die auf zwei Arme verteilt werden. Der z-Test braucht Hunderte pro Arm, bevor er irgendetwas sagt.
Der Lift, auf den du reagieren würdest, bestimmt die Rechnung. Sei ehrlich dabei: Wenn du eine Änderung für einen 3-%-Lift ausliefern würdest, brauchst du einen Test, der 3 % sehen kann, und das kann fast keine kleine Website.
Zeit ist ein Preis, keine Lösung. Ein Test, der ein Quartal dauert, friert die Seite ein Quartal lang ein, überspannt Saisons und Kampagnen und endet in einem anderen Geschäft, als er begonnen hat.
Wie oft deine Ideen funktionieren, verändert, was ein Gewinner bedeutet. Wenn eine Idee von zehn die Metrik wirklich bewegt, dann sind bei 95 % Konfidenz und 80 % Power mehr als ein Drittel deiner "signifikanten" Gewinner Fehlalarme. Die Basisrate ist keine Formalie; sie ist der Großteil der Antwort.
Unter der Grenze gibt es bessere Methoden. Sprich mit fünf Nutzern, schau dir Session-Aufzeichnungen an, liefere die Änderung aus und vergleiche vorher und nachher mit breiten Fehlerbalken, oder teste eine Metrik, die mehr Besucher erreichen, etwa einen Klick statt eines Kaufs.
So machst du den Realitätscheck
1
Monatliche Besucher eingeben, die den Test sehen würden
Nicht die ganze Website. Läuft der Test auf der Preisseite, sind es die Besucher der Preisseite. Ist es ein Checkout-Schritt, sind es die Leute, die diesen Schritt erreichen.
2
Aktuelle Conversion-Rate dieses Schritts eingeben
Der Rechner zeigt die Conversions pro Monat, die daraus folgen, und das ist die eigentliche Grenze.
3
Den Lift nennen, auf den du reagieren würdest
Der relative Lift, der dich die Änderung ausliefern ließe. Die meisten sagen 10 % und meinen es; sei ehrlich, wenn deiner kleiner ist.
4
Urteil und Leiter lesen
Los heißt unter einem Monat. Grenzwertig heißt unter einem Quartal, mit die ganze Zeit eingefrorener Seite. Stopp heißt, der Test kann die Frage bei deinem Traffic nicht beantworten. Die Leiter zeigt, was größere Lifts stattdessen kosten würden.
5
Basisrate wählen und Falsch-Positiv-Risiko lesen
Wähle, wie oft deine Ideen wirklich funktionieren. Die Kachel zeigt, welcher Anteil der signifikanten Ergebnisse bei dieser Rate Fehlalarme wären, und das ist die Zahl, die du dir merken solltest, wenn ein Test das nächste Mal grün wird.
Monate bis zur Bestätigung eines 10-%-Lifts bei 95 % Konfidenz, 80 % Power
Zwei Arme, jeder Besucher geht in den Test. Lies deine Zeile und deine Spalte.
Monatliche Besucher
1 % Basisrate
3 % Basisrate
5 % Basisrate
10 % Basisrate
3.000
über 100 Monate
35 Monate
21 Monate
9,8 Monate
8.000
41 Monate
13 Monate
7,8 Monate
3,7 Monate
25.000
13 Monate
4,3 Monate
2,5 Monate
5 Wochen
100.000
3,3 Monate
5 Wochen
19 Tage
9 Tage
500.000
20 Tage
6 Tage
4 Tage
2 Tage
Drei Websites, drei Urteile
Das Early-Stage-SaaS
8.000 Besucher im Monat, 3 % Anmelderate, will einen 10-%-Lift sehen. Urteil: stopp. Etwa 13 Monate und 106.000 Besucher. In vier Wochen liegt der kleinste bestätigbare Lift bei etwa 40 %.
Zweihundertvierzig Anmeldungen im Monat können keinen Unterschied von 0,3 Punkten auflösen. Die Zeit des Teams ist besser investiert in das Fünf-Nutzer-Interview und in Änderungen, die groß genug sind, um sich ohne Test zu zeigen: Eine neue Headline gehört nicht dazu; ein neues Preismodell vielleicht schon.
Die Content-Website
50.000 Besucher im Monat, 2 % Newsletter-Anmelderate, will einen 10-%-Lift. Urteil: grenzwertig. Etwa 3,2 Monate. In vier Wochen liegt der kleinste bestätigbare Lift bei etwa 19 %.
Testbar, aber nur für mutige Änderungen. Die Platzierung des Formulars zu testen ist in Ordnung, wenn sie die Anmeldungen um ein Fünftel bewegen könnte; Button-Texte zu testen ist es nicht. Oder teste den Klick zum Formular, den weit mehr Besucher machen.
Der Marktplatz
400.000 Besucher im Monat, 4 % Conversion, will einen 10-%-Lift. Urteil: los. Die Besucher kommen in unter einer Woche zusammen; lass trotzdem zwei ganze Wochen laufen.
Das ist die Größe, für die die A/B-Testing-Leitfäden geschrieben sind. Das verbleibende Risiko ist die Basisrate: Wenn eine Idee von fünf wirklich funktioniert, ist ungefähr einer von sechs signifikanten Gewinnern immer noch ein Fehlalarm, und der Tab Peeking-Simulator zeigt, wie schnell das mit täglichem Nachsehen schlimmer wird.
Fehler beim Testen mit wenig Traffic
Den Test trotzdem laufen lassen und bei 85 % ablesen. Das Konfidenzniveau, das du setzt, ist ein Versprechen darüber, wie oft du dich täuschen lässt. Es im Nachhinein darunter abzulesen ist dasselbe, wie nie eines gesetzt zu haben.
Winzige Änderungen testen. Button-Farben und Wortwechsel erzeugen bestenfalls Lifts von ein paar Prozent, die kleine Websites nicht erkennen können. Wenn du testen musst, teste etwas, das die Zahl plausibel um ein Drittel bewegen könnte.
Am unteren Ende des Funnels testen. Käufe sind selten; Klicks sind häufig. Ein Test auf dem Klick, der zum Kauf führt, hat zehnmal so viele Ereignisse und kann fertig werden.
Einen Test sechs Monate laufen lassen. Saisons, Kampagnen und Produktänderungen sickern alle hinein, und die zwei Arme messen am Ende verschiedene Epochen.
Einem Gewinner trauen, weil er signifikant war. Mit wenigen echten Gewinnern unter deinen Ideen ist ein signifikantes Ergebnis öfter ein Fehlalarm, als der p-Wert nahelegt. Die Kachel Falsch-Positiv-Risiko macht daraus eine Zahl.
"Nicht signifikant" als "die Idee ist gescheitert" lesen. Bei wenig Traffic ist fast nichts signifikant. Die Idee könnte gut sein; der Test konnte sie nur nicht sehen.
FAQ zum Realitätscheck
Wie viel Traffic brauche ich für einen A/B-Test?
Das hängt von deiner Conversion-Rate und dem Lift ab, den du sehen willst, und deshalb fragt diese Seite nach beidem. Als Faustregel: Einen relativen Lift von 10 % auf 3 % Conversion-Rate zu bestätigen braucht etwa 100.000 Besucher; einen Lift von 30 % zu bestätigen etwa 12.000. Websites unter 10.000 Besuchern im Monat können meist nur sehr große Effekte erkennen.
Was sollte eine kleine Website statt A/B-Tests machen?
Mit Nutzern sprechen, persönlich oder per Call: Fünf Gespräche finden die meisten Probleme auf einer Seite. Session-Aufzeichnungen anschauen. Mutige Änderungen machen, ausliefern und ein paar Wochen vorher und nachher vergleichen, im Wissen, dass der Vergleich grob ist. Metriken testen, die mehr Besucher erreichen. Und wenn der Traffic da ist, hierher zurückkommen und richtig testen.
Was ist das Falsch-Positiv-Risiko und warum ist es etwas anderes als der p-Wert?
Der p-Wert sagt dir, wie überraschend das Ergebnis wäre, wenn sich nichts geändert hätte. Das Falsch-Positiv-Risiko sagt dir, wie viele der Tests, die signifikant ausgingen, nichts dahinter hatten. Es hängt davon ab, wie oft deine Ideen wirklich funktionieren: Bei einer Basisrate von 10 %, 95 % Konfidenz und 80 % Power sind etwa 36 % der signifikanten Gewinner Fehlalarme. Große Experimentierprogramme berichten, dass nur 10 bis 33 % der Ideen ihre Metrik bewegen, und deshalb zählt die Basisrate so sehr.
Ist ein Test über 3,5 Monate wirklich unmöglich?
Nicht unmöglich, und der Rechner sagt bis zu einem Quartal "grenzwertig" statt "stopp". Aber eine Seite, die ein Quartal lang eingefroren ist, ist eine Seite, die niemand verbessert, und ein Test, der eine Saison oder eine Kampagne überspannt, vergleicht zwei verschiedene Zeiträume. Wenn die Änderung groß genug ist, um ein Quartal Warten zu rechtfertigen, ist sie wahrscheinlich groß genug, um sie auszuliefern und vorher und nachher zu messen.
Kann ich die Konfidenz auf 90 % senken, damit der Test schneller geht?
Kannst du, wenn du das vor dem Test entscheidest und eine Fehlalarmrate von eins zu zehn zusätzlich zum Basisraten-Effekt akzeptierst. Es verkürzt den Test um etwa ein Drittel, nicht um den Faktor zehn, den eine kleine Website bräuchte. Den Lift zu erhöhen, auf den du testest, hilft viel mehr.
Warum sagt der Rechner stopp, wenn der Stichprobengrößen-Rechner eine Zahl liefert?
Beide nutzen dieselbe Formel. Die Seite zur Stichprobengröße nennt dir die Anzahl; diese Seite teilt sie durch deinen Traffic und beurteilt das Ergebnis. 106.000 Besucher sind eine Zahl; dreizehn Monate sind ein Urteil.