登録率5%のページで+10%を狙う
ベースライン5%、最小検出効果10%(目標5.5%)、信頼水準95%、検出力80%、両側。結果: バリエーションあたり約31,000人、合計62,000人。
1日1,000人の訪問者なら62日、つまり丸9週間です。多くのチームはこれを長すぎると考え、もっと大胆な変更をテストするか、このページが2週間でテスト可能になるには20%以上の改善が必要だと受け入れるかのどちらかを選ぶでしょう。
テストが何かを語れるようになるまでに各バリエーションに必要な訪問者数と、それがあなたのトラフィックで何日にあたるか。検出する価値のある最小の改善率、信頼水準、検出力を設定して、人数を公式つきで読み取ってください。
最終更新
Coddyはブラウザ上で実際にコードを書きながら学ぶサービスです。インタラクティブなレッスン、即時フィードバック、行き詰まったときのAIサポート付き。
サンプルサイズとは、テストを始める前に自分自身と交わす約束です: 「この人数が見終わったら結果を見る。それより前には見ない。」それがないと、どのA/Bテストも同じ物語に流れていきます。最初の週は有望に見え、2週目に改善率が縮み、誰かが「もう有意?」と尋ね、バーが緑になった日にテストは終わります。このページは計画書に書く数字を与えます。終了日を気分ではなく事実にするためです。
計算は標準的な2標本比率のサンプルサイズで、Evan Millerの計算ツールやOptimizelyのものと同じ公式です。依存するのは4つ: ベースライン率、検出できるようにしたい改善率、信頼水準、検出力。検出力は多くの人が飛ばす項目です。検出力80%なら、指定した大きさの本物の改善は10回に8回捕まります。サンプルが半分のテストは検出力が半分よりはるかに低くなり、だから検出力不足のテストは「粗い答え」ではなく、たいてい答えがまったく出ないのです。
結果の下の曲線が、覚えておく価値のある部分です。必要な訪問者数は改善率の逆数の2乗に比例して増えます: 見たい改善率を半分にすると、必要なトラフィックは約4倍です。30%の改善を2週間で確認できるサイトが、10%の改善を確認するには約9倍の期間がかかります。日数が月単位で出てきたら、それは「待て」と言う前に、もっと大きなものをテストするか、より多くの人が到達するファネル上流の指標に移れ、と計算ツールが言っているのです。
テストで変更するページやステップの率を、テストが見るのと同じ種類の訪問者で測ったものを使ってください。1つのファネルステップをテストするときにサイト全体の平均を使ってはいけません。
どれだけの改善があれば変更を出荷するかを自問してください。それが最小検出効果です。成熟したページなら相対10%がよくある選択で、リデザインなら20%以上が妥当かもしれません。
信頼水準95%と検出力80%が慣例です。偽の勝者の巻き戻しが高くつくなら信頼水準を上げ、勝者を取り逃がすのが高くつくなら検出力を上げてください。
全バリエーション合計で、テストに到達する訪問者だけを数えます。結果が日数と週数に換算されます。
このツールはバリエーションあたりのサンプルサイズを出します。それが示す日付とともにテスト計画に記入し、その前に結果を読まないでください。理由は途中確認シミュレーターのタブが示します。
信頼水準95%、検出力80%、両側検定でのバリエーションあたりの訪問者数。2群のテストなら2倍してください。
| ベースライン率 | +5%の改善 | +10%の改善 | +20%の改善 | +50%の改善 |
|---|---|---|---|---|
| 1% | 約637,000 | 約163,000 | 約42,700 | 約7,800 |
| 3% | 約208,000 | 約53,200 | 約13,900 | 約2,500 |
| 5% | 約122,000 | 約31,200 | 約8,200 | 約1,500 |
| 10% | 約57,800 | 約14,800 | 約3,800 | 約690 |
| 20% | 約25,600 | 約6,500 | 約1,700 | 約290 |
ベースライン5%、最小検出効果10%(目標5.5%)、信頼水準95%、検出力80%、両側。結果: バリエーションあたり約31,000人、合計62,000人。
1日1,000人の訪問者なら62日、つまり丸9週間です。多くのチームはこれを長すぎると考え、もっと大胆な変更をテストするか、このページが2週間でテスト可能になるには20%以上の改善が必要だと受け入れるかのどちらかを選ぶでしょう。
ベースライン3%、最小検出効果20%(目標3.6%)。結果: バリエーションあたり約13,900人。
ベースラインが低いほど、同じ相対改善率でもより多くの訪問者が必要です。数えられるコンバージョンが少ないからです。ここでの20%の相対改善はわずか0.6ポイントで、テストは3.0%と3.6%を区別しなければなりません。
ベースライン5%、改善率10%、コントロールを含めて4バリエーション。比較あたりのアルファは0.05 / 3になり、バリエーションあたりのサンプルは約3分の1増加。合計はバリエーションあたりの数字の4倍。
バリエーションを増やすのは、2週間のテストを2か月のテストに変える最速の方法です。強いアイデアを1つコントロールと比べ、次のアイデアはその後に走らせましょう。