Menu

A/Bテストできる? トラフィックの現実チェック

10回目のテストの後ではなく、最初のテストの前に問うべき質問です。月間訪問者数、コンバージョン率、実際に行動に移す改善率を入力すると、率直な答えが返ってきます: Go、Stretch、それともStopして別のことをするか。

著者 Nethanel Bar, Co-founder & CEO

最終更新

本気でプログラミングを学びませんか?

Coddyはブラウザ上で実際にコードを書きながら学ぶサービスです。インタラクティブなレッスン、即時フィードバック、行き詰まったときのAIサポート付き。

ほとんどの小さなサイトはA/Bテストできないのに、誰もそれを教えてくれない

A/Bテストのガイドはどれも、数百万の訪問者を持つ企業が書いています。Microsoftの実験チーム、Google、Booking.com、Airbnbは年に数千件のテストを走らせ、彼らのアドバイスは彼らにとって正しい: すべてをテストし、データを信じ、勝ったものを出荷せよ。月間8,000人の訪問者のスタートアップが同じアドバイスを読み、同じダッシュボードを作り、そしてなぜどのテストも信頼度87%で、週ごとに縮む改善率とともに終わるのか理解できません。やり方が間違っているのではありません。その規模では機能しないことをやっているのです。

このページはガイドが飛ばす算術をやります。月間8,000人の訪問者がコンバージョン率3%なら、10%の改善を確認するには約106,000人の訪問者が必要です: 持っている訪問者すべてを13か月分、しかもその間ずっとページを凍結して。4週間で確認できる最小の改善率は約40%です。これは調整で解決する問題ではありません。MicrosoftとAirbnbで実験を率いたRonny Kohaviは、1桁台の改善率を検出する実用的な下限を数十万ユーザーとし、それ以下ではA/Bテストは時期尚早で、ユーザーリサーチのほうが良い投資かもしれないと述べています。

これは自分たちの経験から書いています。Coddyのダッシュボードは名前のついた実験を20件ほど走らせ、そのうち10件は単一の国での価格テストで、それぞれ少量のトラフィックで行い、信頼度が95%を下回るあいだは「続行してください」と報告していました。いくつかは成功と記録され、出荷されました。この計算ツールで振り返ると、それらのテストの一部は、認められた改善率を検出できるはずがありませんでした。あのダッシュボードの正直な版がこのページです: このトラフィックで何に答えられるか、どれくらいかかるか、そして勝者が偽の警報である頻度はどれくらいか?

テストできるかどうかを決めるもの

  • あなたを制約する数字は訪問者数ではなく、月間コンバージョン数です。月間8,000人、率3%のページには、2つの群で分け合う月240件のコンバージョンしかありません。z検定が何かを語るには1群あたり数百件が必要です。
  • 行動に移す改善率が請求額を決めます。正直に: 3%の改善で変更を出荷するなら、3%を見分けられるテストが必要で、小さなサイトでそれができるところはほぼありません。
  • 時間は解決策ではなくコストです。四半期かかるテストは四半期のあいだページを凍結し、季節やキャンペーンをまたぎ、始めたときとは別のビジネスで終わります。
  • あなたのアイデアが当たる頻度が、勝者の意味を変えます。10件に1件のアイデアしか本当に指標を動かさないなら、信頼水準95%・検出力80%で「有意な」勝者の3分の1以上が偽の警報です。基礎率は細かい話ではなく、答えの大部分です。
  • 線の下には、もっと良い方法があります。5人のユーザーと話す、セッション録画を見る、変更を出荷して前後を広い誤差幅で比べる、あるいは購入ではなくクリックのように、より多くの訪問者が到達する指標でテストする。

現実チェックのやり方

  1. テストを見る月間訪問者数を入力する

    サイト全体ではありません。テストが料金ページにあるなら料金ページの訪問者。チェックアウトのステップなら、そのステップに到達する人です。

  2. そのステップの現在のコンバージョン率を入力する

    これが意味する月間コンバージョン数が表示されます。それが本当の制約です。

  3. 行動に移す改善率を決める

    変更を出荷する気になる相対改善率です。多くの人は10%と言い、本気でそう思っています。あなたの数字がもっと小さいなら正直に。

  4. 結論とラダーを読む

    Goは1か月未満。Stretchは四半期未満で、その間ページは凍結。Stopは、あなたのトラフィックではテストがその問いに答えられないという意味です。ラダーは、より大きな改善率ならいくらかかるかを示します。

  5. 基礎率を選んで偽陽性リスクを読む

    あなたのアイデアが実際に当たる頻度を選んでください。タイルは、その率で有意な結果のうちどれだけが偽の警報かを示します。次にテストが緑になったときに思い出すべき数字です。

10%の改善を信頼水準95%・検出力80%で確認するまでの月数

2群、全訪問者がテストに参加。自分の行と列を読んでください。

月間訪問者数ベースライン1%ベースライン3%ベースライン5%ベースライン10%
3,000100か月超35か月21か月9.8か月
8,00041か月13か月7.8か月3.7か月
25,00013か月4.3か月2.5か月5週間
100,0003.3か月5週間19日9日
500,00020日6日4日2日

3つのサイト、3つの結論

初期段階のSaaS

月間訪問者8,000人、登録率3%、10%の改善を見たい。結論: Stop。約13か月と106,000人の訪問者。4週間で確認できる最小の改善率は約40%。

月240件の登録では0.3ポイントの差は解決できません。チームの時間は、5人のユーザーインタビューと、テストなしでも現れるほど大きな変更に使うほうが有益です: 新しい見出しはそれに当たりませんが、新しい料金モデルなら当たるかもしれません。

コンテンツサイト

月間訪問者50,000人、ニュースレター登録率2%、10%の改善を望む。結論: Stretch。約3.2か月。4週間で確認できる最小の改善率は約19%。

テスト可能ですが、大胆な変更に限ります。フォームの配置のテストは、登録を5分の1動かす可能性があるなら妥当です。ボタンの文言のテストはそうではありません。代わりに、はるかに多くの訪問者が行うフォームへのクリックでテストするのも手です。

マーケットプレイス

月間訪問者400,000人、コンバージョン率4%、10%の改善を望む。結論: Go。訪問者は1週間以内に集まる。それでも丸2週間走らせること。

これがA/Bテストのガイドが想定している規模です。残るリスクは基礎率です: 5件に1件のアイデアしか本当に効かないなら、有意な勝者のおよそ6件に1件はまだ偽の警報で、途中確認シミュレーターのタブは毎日の確認でそれがどれほど速く悪化するかを示します。

少ないトラフィックでのテストのミス

  • それでもテストを走らせて85%で読むこと。設定した信頼水準は、騙されることをどのくらいの頻度で受け入れるかの約束です。後からそれを下回る値で読むのは、最初から設定しなかったのと同じです。
  • 小さな変更をテストすること。ボタンの色や言葉の入れ替えはせいぜい数パーセントの改善しか生まず、小さなサイトには検出できません。テストするなら、数字を3分の1動かしてもおかしくないものをテストしてください。
  • ファネルの最下部でテストすること。購入は稀で、クリックは頻繁です。購入につながるクリックでのテストはイベント数が10倍あり、完了できます。
  • テストを6か月走らせること。季節、キャンペーン、プロダクトの変更がすべて漏れ込み、2つの群は異なる時代を測ることになります。
  • 有意だったからと勝者を信じること。アイデアの中に本物の勝者が少なければ、有意な結果はp値が示唆する以上の頻度で偽の警報です。偽陽性リスクのタイルがそれを数字にします。
  • 「有意差なし」を「アイデアが失敗した」と受け取ること。トラフィックが少なければ、ほぼ何も有意になりません。アイデアは良かったかもしれず、テストがそれを見られなかっただけです。

現実チェックのよくある質問

A/Bテストにはどのくらいのトラフィックが必要ですか?
コンバージョン率と見たい改善率によります。だからこのページは両方を尋ねます。目安として、コンバージョン率3%で10%の相対改善を確認するには約100,000人の訪問者、30%の改善なら約12,000人です。月間訪問者10,000人未満のサイトは、通常、非常に大きな効果しか検出できません。
小さなサイトはA/Bテストの代わりに何をすべきですか?
ユーザーと話してください。対面でも通話でも、5回の会話でページの問題の大半が見つかります。セッション録画を見る。大胆な変更を加えて出荷し、粗い比較だと承知のうえで数週間の前後を比べる。より多くの訪問者が到達する指標でテストする。そしてトラフィックが集まったら、ここに戻ってきちんとテストしてください。
偽陽性リスクとは何で、p値とどう違うのですか?
p値は、何も変わっていなかったらこの結果はどれくらい意外か、を示します。偽陽性リスクは、有意と出たテストのうち、背後に何もなかったものがどれだけあるかを示します。それはあなたのアイデアが実際に当たる頻度に依存します: 基礎率10%、信頼水準95%、検出力80%なら、有意な勝者の約36%が偽の警報です。大規模な実験プログラムの報告では、指標を動かすアイデアは10〜33%にすぎず、だから基礎率がこれほど重要なのです。
3.5か月のテストは本当に無理ですか?
無理ではなく、このツールも四半期までは「Stop」ではなく「Stretch」と言います。しかし四半期のあいだ凍結されたページは、誰も改善していないページです。季節やキャンペーンをまたぐテストは、2つの異なる期間を比べています。四半期の待機を正当化できるほど大きな変更なら、出荷して前後を測るのに十分な大きさでもあるはずです。
テストを速くするために信頼水準を90%に下げてもいいですか?
テストの前に決め、基礎率の効果に加えて10回に1回の偽の警報率を受け入れるなら、可能です。テストはおよそ3分の1短くなりますが、小さなサイトが必要とする10分の1にはなりません。テストする改善率を上げるほうがはるかに効きます。
サンプルサイズ計算ツールは数字を出すのに、なぜこのツールはStopと言うのですか?
どちらも同じ公式を使っています。サンプルサイズのページは人数を伝え、このページはそれをあなたのトラフィックで割って結果を判定します。106,000人の訪問者は数字です。13か月は結論です。

その他の開発者ツール

Coddyのプログラミング言語のイラスト

Coddyでコードを学ぼう

始める