A/B testimin istatistiksel olarak anlamlı olup olmadığını nasıl anlarım?
Her varyantın ziyaretçi ve dönüşüm sayılarını gir, bir güven düzeyi seç (%95 standarttır) ve kararı oku. Test, p-değeri 1 eksi güven düzeyinin altındayken anlamlıdır; yani %95'te 0.05'in altında. Bu sayfa ayrıca gerçek artış için aralığı ve testin baktığın etkiyi saptayabilecek durumda olup olmadığını söyler; çıplak bir p-değeri bunu yapamaz.
Testim için 0.08'lik bir p-değeri ne anlama gelir?
A ve B gerçekten aynı oranda dönüşüm sağlasaydı, en az bu kadar büyük bir farkın şans eseri yaklaşık %8 oranında ortaya çıkacağı anlamına gelir. Sonucun yanlış olma olasılığı değildir ve "B'nin daha iyi olduğuna %92 güven" de değildir. %95 güvende, testin çıtayı geçmediği anlamına gelir; geçip geçemeyeceğini görmek için en küçük saptanabilir artış kutusuna bak.
%90 güven yeterli mi?
Olabilir; %90'a test başlamadan önce karar verdiysen ve onda bir yanlış pozitif oranını kabul ediyorsan. Asla yeterli olmayan şey, %95'te çalıştırıp %91 görüp aslında eşiğin başından beri %90 olduğuna karar vermektir. Güven düzeyi, ne sıklıkla kandırılmayı kabul ettiğine dair bir sözdür; baktıktan sonra değiştirmek sözü bozar.
Varyant başına kaç dönüşüme ihtiyacım var?
Sihirli bir sayı yok, ama kol başına yaklaşık 25 dönüşümün altında z-testi kaba bir taslaktır ve gerçek testlerin çoğu yüzlercesine ihtiyaç duyar. Önemli olan sayı saptamak istediğin artıştır: %5 taban oranında %10'luk göreli bir artışı %95 güven ve %80 güçle görmek, varyant başına yaklaşık 31,000 ziyaretçi, yani her birinde kabaca 1,550 dönüşüm gerektirir. Örneklem büyüklüğü sekmesi bunu senin oranların için hesaplar.
Frekansçı p-değeri ile B'nin daha iyi olma Bayes olasılığı arasındaki fark nedir?
p-değeri "hiçbir şey değişmediyse bu fark ne kadar şaşırtıcı?" diye sorar ve bir eşikte evet ya da hayır verir. Bayes sayısı "gördüklerime göre B'nin gerçek oranının A'nınkinin üstünde olma ihtimali ne?" diye sorar ve bir olasılık verir. Aynı veride genellikle yön olarak uyuşurlar: çift yönlü bir testte 0.05'lik bir p, B'nin daha iyi olma ihtimalinde %97'ye yakın oturur. Bu sayfa ikisini de gösterir, çünkü Bayes cümlesi insanların "güven" derken kastettiği şeydir ve p-değeri araçlarının yazdırdığı şeydir.
Hesaplayıcı dağılım saptığında neden karar vermeyi reddediyor?
Çünkü örneklem oranı uyuşmazlığı, iki grubun rastgele atanmadığı anlamına gelir ve rastgele atama bir A/B testinin işe yaramasının bütün sebebidir. 50/50 planladıysan ve gözlenen dağılımın şans eseri oluşma ihtimali binde birin altındaysa, bir mekanizma kimin hangi kola düşeceğine karar veriyor ve bu dönüşümle ilişkili olabilir. Gördüğün artış senin değişikliğin değil, o mekanizma olabilir.
Bu hesaplayıcıyı ziyaretçi başına gelir veya ortalama sipariş değeri için kullanabilir miyim?
Hayır. Bu sayfa bir oranı test eder: her ziyaretçi ya dönüşüm sağladı ya sağlamadı. Ziyaretçi başına gelir sürekli ve ağır çarpık bir ölçüttür; kullanıcı başına tutarlar üzerinde bir t-testi veya bootstrap gerektirir, bu da dört toplam yerine ham veri ister. Coddy matematik hesaplayıcılarındaki t-testi hesaplayıcı, kullanıcı başına değerlerin elindeyken ortalama karşılaştırmasını yapar.
En küçük saptanabilir artış nereden geliyor?
Örneklem büyüklüğü hesaplayıcıyla aynı formülden, tersine çalıştırılmış. Kol büyüklüklerin ve A'nın oranı verildiğinde, bu büyüklükteki testlerin %80'inin senin güven düzeyinde yakalayacağı göreli artışı bulur. Gözlediğin artış bunun altındaysa, testinin gücü o etki için yetersizdi ve "anlamlı değil", değişikliğin işe yarayıp yaramadığı hakkında neredeyse hiçbir bilgi taşımaz.