A/Bテストに統計的有意差があるかどうか、どう判断すればいいですか?
各バリエーションの訪問者数とコンバージョン数を入力し、信頼水準(95%が標準)を選んで、結論を読んでください。p値が「1 − 信頼水準」を下回れば有意、つまり95%なら0.05未満です。このページはさらに、本当の改善率の区間と、いま見ている効果をこのテストが検出できたのかどうかも示します。p値だけではわからないことです。
テストのp値が0.08というのはどういう意味ですか?
AとBが本当に同じ率でコンバージョンしていたとしても、これ以上の差が偶然に約8%の頻度で現れる、という意味です。結果が間違っている確率ではなく、「Bが優れている信頼度が92%」でもありません。信頼水準95%では基準を越えていないということなので、検出可能な最小の改善率のタイルを見て、そもそも越えられたのかを確認してください。
信頼度90%で十分ですか?
テストを始める前に90%と決め、10回に1回の偽陽性率を受け入れるなら、十分な場合もあります。決して十分でないのは、95%で走らせて91%を見てから「本当は90%が基準だった」と決めることです。信頼水準は、どのくらいの頻度で騙されてもよいかについての約束であり、見てから変えれば約束は壊れます。
バリエーションごとに何件のコンバージョンが必要ですか?
魔法の数字はありませんが、1群あたり約25件を下回るとz検定は粗いスケッチにすぎず、実際のテストの多くは数百件を必要とします。重要なのは検出したい改善率です: ベースライン5%で、10%の相対改善を信頼水準95%・検出力80%で見るには、バリエーションあたり約31,000人の訪問者、つまりそれぞれ約1,550件のコンバージョンが必要です。サンプルサイズのタブがあなたの率で計算します。
頻度論のp値と、ベイズの「Bが優れている確率」の違いは何ですか?
p値は「何も変わっていないとしたら、この差はどれくらい意外か?」と問い、閾値でイエスかノーを返します。ベイズの数字は「観測したものを踏まえて、Bの真の率がAを上回る可能性はどれくらいか?」と問い、確率を返します。同じデータなら方向はたいてい一致します: 両側検定でpが0.05なら、Bが優れている確率は97%前後です。このページが両方を表示するのは、人が「信頼度」と言うときに意味しているのはベイズの一文で、ツールが表示するのはp値だからです。
配分がずれているとき、なぜ結論を出してくれないのですか?
サンプル比率の不一致(SRM)は、2つのグループがランダムに割り当てられていないことを意味し、ランダム化こそA/Bテストが機能する理由そのものだからです。50/50の計画に対して、観測された配分が偶然に起きる確率が1,000分の1未満なら、誰をどちらの群に入れるかを何らかの仕組みが決めており、それがコンバージョンと相関している可能性があります。見えている改善率は、あなたの変更ではなくその仕組みかもしれません。
訪問者あたりの売上や平均注文額にもこのツールを使えますか?
使えません。このページは比率を検定します: 各訪問者はコンバージョンしたかしなかったかのどちらかです。訪問者あたりの売上は連続的で強く歪んだ指標なので、ユーザーごとの金額に対するt検定かブートストラップが必要で、4つの合計値ではなく生データが要ります。ユーザーごとの値が手元にあれば、Coddyの数学計算ツールにあるt検定計算ツールが平均の比較を扱います。
検出可能な最小の改善率はどこから来るのですか?
サンプルサイズ計算ツールと同じ公式を逆向きに走らせたものです。群のサイズとAの率から、この規模のテストの80%があなたの信頼水準で捕まえられる相対改善率を求めます。観測した改善率がそれを下回るなら、その効果に対してテストの検出力は不足しており、「有意差なし」は変更が効いたかどうかについてほとんど何も語りません。