毎日確認する人
コンバージョン率5%、1日1,000人の訪問者、28日間、毎朝確認。私たちの実行では: 途中確認する人は2,000件のA/Aテストのうち約28%で勝者を宣言。最後に一度だけ読むと4.5%。
誰かが毎日見ていたから慎重に感じられたテストで、偽の警報率は6倍です。それらの「勝者」の半分はBを、半分はAを勝者にしました。見つけるべきものが何もなかったからです。
AとBが同じページである2,000件のテストを、あなたのトラフィックで走らせます。毎日確認する人がそのうち何件を勝者と呼んだか、そして終了日まで待つ人が同じテストに何件騙されるかを見てください。
最終更新
Coddyはブラウザ上で実際にコードを書きながら学ぶサービスです。インタラクティブなレッスン、即時フィードバック、行き詰まったときのAIサポート付き。
その習慣とはこうです。テストを始め、毎朝ダッシュボードを開く。バーはじわじわ上がり、下がり、また上がり、ある火曜日に95%を越える。あなたは勝者を宣言し、出荷して、次へ進む。問題は、p値はさまようということです。2つのバリエーションが同一のテストでも、p値は偶然にある日0.05を割ります。後でまた戻るだけです。最初に割った時点で止めるということは、通り過ぎる途中で捕まえるということで、持っていたはずの信頼水準は消えています。
その効果の大きさに人は驚きます。信頼水準95%で最後に一度だけ読むテストは、およそ20回に1回騙されます。それが同意した取引です。同じテストを4週間毎日読み、最初に緑になった日に止めると、シミュレーターは何も変わっていないテストの4分の1以上で偽の勝者を示すのが普通です。Evan Millerの元の記事は毎日確認する人で20%超としており、Optimizelyは顧客の偽陽性率がそれを越えたため2015年に統計エンジンを作り直しました。毎日ではなく毎週確認すれば被害はおよそ半分になりますが、なくなりはしません。
ここのシミュレーションは、自分が何であるかについて正直です: 各テストは両群の真の率でコンバージョンを抽選し、確認のたびにそれまでに集まったすべてのデータに通常の2標本比率のz検定を走らせ、途中確認する人がどこで止めるかを記録します。チャートの各線は1つのテスト、各点は誰かが結果を発表していたはずの朝です。本当の改善率を+10%に設定すると物語の残り半分が見えます: 途中確認する人は本物の効果を早く捕まえますが、改善率は誇張されており、効果がゼロでも同じくらい熱心に「勝って」いたはずです。
シミュレーションはあなたの実際の率でコンバージョンを抽選するので、p値のさまよい方は実際に目にするノイズと一致します。
毎日、3日ごと、毎週。途中確認する人の率と正直な率の差が、その習慣の代償です。
それですべてのテストがA/Aテストになります: どの勝者も構造上、偽の警報です。その後で+10%や+30%に切り替えて、本物の効果に対する途中確認する人の様子を見てください。
途中確認する人の率は、毎日確認する人が勝者を宣言した頻度です。終了日の率は選んだアルファに近いはずで、そうなら正直なテストは約束どおりに働いています。
実行のたびに新しいランダムなテストを抽選します。率は少し動きますが、差は動きません。
信頼水準95%で、最後に一度だけ正直に読めば騙されるのは約5%。最初に有意になった確認で止める人について、シミュレーションと文献からの概算値。
| 確認頻度 | 4週間での確認回数 | 偽の勝者 |
|---|---|---|
| 最後に一度だけ | 1 | 約5% |
| 毎週 | 4 | 約10〜13% |
| 3日ごと | 9〜10 | 約15〜20% |
| 毎日 | 28 | 約25〜30% |
| 12週間毎日 | 84 | 35%超 |
コンバージョン率5%、1日1,000人の訪問者、28日間、毎朝確認。私たちの実行では: 途中確認する人は2,000件のA/Aテストのうち約28%で勝者を宣言。最後に一度だけ読むと4.5%。
誰かが毎日見ていたから慎重に感じられたテストで、偽の警報率は6倍です。それらの「勝者」の半分はBを、半分はAを勝者にしました。見つけるべきものが何もなかったからです。
同じトラフィック、同じ期間、週に一度確認。私たちの実行では: 途中確認する人は約12%、最後に読むと5%。
28回ではなく4回見るだけで大きく改善しますが、それでも約束した率の2倍以上です。約束を守れる確認回数は1回しかありません。
同じトラフィックでBの本当の改善率を+10%に設定。28日での正直なテストは、このトラフィックでこれほど小さな改善に対しては検出力が限られる。途中確認する人は運の良い日に、より頻繁に早期停止する。
これが誘惑的なケースです: 途中確認する人のほうが速く何かを見つけているように見えます。しかし止めた日は改善率が最も大きく見えた日なので、出荷される推定値は膨らんでおり、同じ習慣は改善率をゼロにしても「勝者」を見つけていたはずです。