Menu

A/Bテスト サンプルサイズ計算ツール

テストが何かを語れるようになるまでに各バリエーションに必要な訪問者数と、それがあなたのトラフィックで何日にあたるか。検出する価値のある最小の改善率、信頼水準、検出力を設定して、人数を公式つきで読み取ってください。

著者 Nethanel Bar, Co-founder & CEO

最終更新

本気でプログラミングを学びませんか?

Coddyはブラウザ上で実際にコードを書きながら学ぶサービスです。インタラクティブなレッスン、即時フィードバック、行き詰まったときのAIサポート付き。

結果を1つでも見る前にサンプルサイズを決める

サンプルサイズとは、テストを始める前に自分自身と交わす約束です: 「この人数が見終わったら結果を見る。それより前には見ない。」それがないと、どのA/Bテストも同じ物語に流れていきます。最初の週は有望に見え、2週目に改善率が縮み、誰かが「もう有意?」と尋ね、バーが緑になった日にテストは終わります。このページは計画書に書く数字を与えます。終了日を気分ではなく事実にするためです。

計算は標準的な2標本比率のサンプルサイズで、Evan Millerの計算ツールやOptimizelyのものと同じ公式です。依存するのは4つ: ベースライン率、検出できるようにしたい改善率、信頼水準、検出力。検出力は多くの人が飛ばす項目です。検出力80%なら、指定した大きさの本物の改善は10回に8回捕まります。サンプルが半分のテストは検出力が半分よりはるかに低くなり、だから検出力不足のテストは「粗い答え」ではなく、たいてい答えがまったく出ないのです。

結果の下の曲線が、覚えておく価値のある部分です。必要な訪問者数は改善率の逆数の2乗に比例して増えます: 見たい改善率を半分にすると、必要なトラフィックは約4倍です。30%の改善を2週間で確認できるサイトが、10%の改善を確認するには約9倍の期間がかかります。日数が月単位で出てきたら、それは「待て」と言う前に、もっと大きなものをテストするか、より多くの人が到達するファネル上流の指標に移れ、と計算ツールが言っているのです。

サンプルサイズは何で決まるか

  • 最小検出効果は測定値ではなく決断です。実際に出荷する気になる最小の改善率のことです。テストを「より敏感」にしようと低く設定すると、テストは良くなるのではなく長くなります。
  • 相対改善率と絶対改善率はまったく別物です。ベースライン5%に対する10%の相対改善は0.5ポイントです。このページは結果が報告される形に合わせて相対値で計算し、両方が見えるように目標の率を横に表示します。
  • 追加のバリエーションは、その頭数以上にコストがかかります。AをB、C、Dと比べるのは3つの比較で、信頼水準をそれらに分けなければなりません。このツールはボンフェローニ補正を適用し、各比較が実際に使えるアルファを表示します。
  • 日数は上限ではなく下限です。数字が4日と言っていても、最低でも丸1週間、できれば2週間走らせてください。平日と週末では訪問者のコンバージョンが異なり、火曜日だけのテストは火曜日を測っているにすぎません。
  • 検出力80%とは、本物の勝者の5件に1件を見逃すという意味です。勝者を見逃すのが高くつくなら、90%にして大きめのサンプルを受け入れてください。

A/Bテストのサイズの決め方

  1. 現在のコンバージョン率を入力する

    テストで変更するページやステップの率を、テストが見るのと同じ種類の訪問者で測ったものを使ってください。1つのファネルステップをテストするときにサイト全体の平均を使ってはいけません。

  2. 検出する価値のある最小の改善率を選ぶ

    どれだけの改善があれば変更を出荷するかを自問してください。それが最小検出効果です。成熟したページなら相対10%がよくある選択で、リデザインなら20%以上が妥当かもしれません。

  3. 信頼水準と検出力を設定する

    信頼水準95%と検出力80%が慣例です。偽の勝者の巻き戻しが高くつくなら信頼水準を上げ、勝者を取り逃がすのが高くつくなら検出力を上げてください。

  4. 1日の訪問者数を追加する

    全バリエーション合計で、テストに到達する訪問者だけを数えます。結果が日数と週数に換算されます。

  5. 終了日を書き留める

    このツールはバリエーションあたりのサンプルサイズを出します。それが示す日付とともにテスト計画に記入し、その前に結果を読まないでください。理由は途中確認シミュレーターのタブが示します。

サンプルサイズ早見表

信頼水準95%、検出力80%、両側検定でのバリエーションあたりの訪問者数。2群のテストなら2倍してください。

ベースライン率+5%の改善+10%の改善+20%の改善+50%の改善
1%約637,000約163,000約42,700約7,800
3%約208,000約53,200約13,900約2,500
5%約122,000約31,200約8,200約1,500
10%約57,800約14,800約3,800約690
20%約25,600約6,500約1,700約290

計算例

登録率5%のページで+10%を狙う

ベースライン5%、最小検出効果10%(目標5.5%)、信頼水準95%、検出力80%、両側。結果: バリエーションあたり約31,000人、合計62,000人。

1日1,000人の訪問者なら62日、つまり丸9週間です。多くのチームはこれを長すぎると考え、もっと大胆な変更をテストするか、このページが2週間でテスト可能になるには20%以上の改善が必要だと受け入れるかのどちらかを選ぶでしょう。

率3%のチェックアウトステップで+20%を狙う

ベースライン3%、最小検出効果20%(目標3.6%)。結果: バリエーションあたり約13,900人。

ベースラインが低いほど、同じ相対改善率でもより多くの訪問者が必要です。数えられるコンバージョンが少ないからです。ここでの20%の相対改善はわずか0.6ポイントで、テストは3.0%と3.6%を区別しなければなりません。

コントロールに対して3つのバリエーション

ベースライン5%、改善率10%、コントロールを含めて4バリエーション。比較あたりのアルファは0.05 / 3になり、バリエーションあたりのサンプルは約3分の1増加。合計はバリエーションあたりの数字の4倍。

バリエーションを増やすのは、2週間のテストを2か月のテストに変える最速の方法です。強いアイデアを1つコントロールと比べ、次のアイデアはその後に走らせましょう。

サンプルサイズのミス

  • 初期の結果を見てからテストのサイズを決めること。3日目にたまたま観測した改善率は最小検出効果ではなく、意見を持ったノイズです。
  • 相対改善率のつもりで絶対改善率を使うこと。ベースライン2%に対する「10%の改善」は2.2%にも12%にもなり、サンプルサイズは数百倍違います。
  • サンプルサイズに達したところで結果が有意でないからと、負けと呼ぶこと。サンプルサイズに達したとは、指定した効果を検出できるという意味です。それより小さな効果については何も語りません。
  • ページビューを訪問者として数えること。公式は各単位を1人の独立した訪問者と1つの結果として扱います。繰り返しの閲覧は件数と信頼度を水増しします。
  • 週の途中で終えること。木曜日にサンプルサイズに達したら、次の日曜日まで走らせてください。曜日構成はたいていのテスト対象の変更よりも大きくコンバージョン率を動かします。

サンプルサイズのよくある質問

A/Bテストはどのくらいの期間走らせるべきですか?
各バリエーションが、検出したい改善率に対するサンプルサイズに達するまで、そして最低でも丸1週間、できれば2週間です。上に1日の訪問者数を入力すると、このツールがサンプルサイズを日数と週数に換算します。必要以上に長く走らせるのは小さな無駄ですが、結果が良さそうだからと早く止めるのは、偽の勝者が宣言される最大の原因です。
最小検出効果とは何ですか?
テストが確実に捕まえるように設計された最小の改善率で、テストの前に決めます。通常は相対的な変化で表し、ベースライン4%に対する10%のMDEなら、テストは4.0%と4.4%を区別できるという意味です。MDEが小さいほど必要な訪問者数は劇的に増えます: MDEを半分にすると、サンプルはおよそ4倍になります。
検出力80%とはどういう意味ですか?
本当の改善率がちょうど指定した大きさなら、この規模のテストは80%の確率で有意な結果を出す、という意味です。残りの20%は本物の勝者を見逃します。検出力は信頼水準の鏡像です: 信頼水準は偽の警報を抑え、検出力は勝者の見逃しを抑えます。
コンバージョン率が低いほど、なぜ多くの訪問者が必要なのですか?
テストが数えるのは訪問者ではなくコンバージョンだからです。率1%なら訪問者10,000人で比較できるイベントは100件、10%なら1,000件です。同じ相対改善率でも後者のほうがはるかに見えやすいのです。だからファネルの上流にある、より多くの訪問者が到達する指標でテストすることが、小さなサイトがそもそもテストできる唯一の方法になることが多いのです。
バリエーションを2つ以上走らせてもいいですか?
はい、このツールは正しくサイズを計算しますが、追加のバリエーションはそれぞれコントロールとの新たな比較で、信頼水準をそれらの間で分け合う必要があります。補正なしで4バリエーションを95%で走らせると、少なくとも1つの偽の勝者が出る確率は14%です。このツールは比較の間でアルファを分割するので、バリエーションあたりの数字が増えます。
売上や平均注文額にも使えますか?
いいえ、このページはコンバージョン率のテストのサイズを決めます。訪問者あたりの売上のような連続指標にはその指標の分散が必要で、通常は比率の分散よりはるかに大きく、サンプルサイズもそれに応じて大きくなります。それらには過去の分散データと、t検定に基づく計算が必要です。

その他の開発者ツール

Coddyのプログラミング言語のイラスト

Coddyでコードを学ぼう

始める