Menu

A/B Test Hesaplayıcı

Her varyantın ziyaretçi ve dönüşüm sayılarını yaz. Tek cümlelik bir karar, çözümüyle birlikte p-değeri, aralık, B'nin daha iyi olma Bayes olasılığı, trafik dağılımının bozuk olmadığını doğrulayan bir kontrol ve bu testin görebileceği en küçük artışı alırsın.

Yazan Nethanel Bar, Co-founder & CEO

Son güncelleme

Gerçekten kod yazmayı öğrenmeye hazır mısın?

Coddy, tarayıcında gerçek kod yazarak öğretir: etkileşimli dersler, anında geri bildirim ve takıldığında yapay zekâ desteği.

Bu hesaplayıcının diğerlerinin söylemediği ne söylediği

Her A/B test hesaplayıcı bir p-değeri yazdırır. Çoğu orada durur ve kurucular böyle %87 güvene bakıp ne anlama geldiğini merak eder hâlde kalır. Bu hesaplayıcı, sonraki adımını gerçekten belirleyen sorulara cevap verir. Fark, şansın üreteceğinden büyük mü? Gerçek artış en kötü ve en iyi ihtimalle ne kadar olabilir? Test "anlamlı değil" çıktıysa, bu örneklem büyüklüğünde herhangi bir şey bulabilir miydi? Ve trafik dağılımının kendisi sağlıklı mı, yoksa hiçbir zaman eşit olmamış iki grubu mu karşılaştırıyorsun?

Standart iki oranlı z-testini çalıştırır; Optimizely'nin klasik motorunun, VWO'nun frekansçı modunun ve her istatistik ders kitabının kullandığı aynı test; ve aritmetiğin her satırını gösterir: birleştirilmiş oran, standart hata, z-skoru ve kuyruk alanı. Yanında Bayes cevabı durur, B'nin gerçek oranının A'nınkinin üstünde olma olasılığı; çünkü "B'nin daha iyi olma ihtimali %91" çoğu insanın p-değerinden duymayı umduğu cümledir ve farklı bir sayıdır.

Bunu kendi panelimize baktıktan sonra yaptık. Coddy yaklaşık yirmi adlandırılmış deney yürüttü, onu küçük trafik dilimlerinde ülke bazlı fiyat testiydi ve iç aracımız %95'in altında "Çalıştırmaya devam et" yazan bir güven çubuğu gösteriyordu. Bu, güler yüzlü bir isteğe bağlı durdurma. Bunun yanındaki üç sekme, örneklem büyüklüğü, gerçeklik testi ve gözetleme simülatörü, şunun için var: yalnızca anlamlılık raporlayan bir hesaplayıcı, kendini daha hızlı kandırmana yardım eden bir hesaplayıcıdır.

Sayıya güvenmeden önce bilinmesi gerekenler

  • "Anlamlı değil", "fark yok" demek değildir. Verinin söyleyemediği anlamına gelir. Bu testin görebileceği en küçük artışı söyleyen kutu dürüst okumadır: gözlediğin artış onun altındaysa, test zaten hiçbir zaman cevap verecek durumda değildi.
  • p-değeri, senin yanılma ihtimalin değildir. İki varyant özdeş olsaydı bu kadar büyük bir fark görme ihtimalidir. Kazananın gerçek olma ihtimali, fikirlerinin ne sıklıkla işe yaradığına da bağlıdır; gerçeklik testi sekmesi bunu bir sayıya çevirir.
  • Çubuğun yeşile döndüğü ilk gün durmak, A/B testindeki en pahalı alışkanlıktır. Her gün kontrol edip erken durmak, %5'lik yanlış pozitif oranını %20'ye veya daha fazlasına çıkarır. Gözetleme simülatörü bunun kendi trafiğinde olduğunu gösterir.
  • Bozuk bir dağılım her şeyi zehirler. 50/50 planlayıp 46/54 aldıysan, bir şey kullanıcıları teste ulaşmadan önce yönlendiriyor: bir önbellek katmanı, bir bot filtresi, bir yönlendirme. Hesaplayıcı önce bu kontrolü çalıştırır ve kontrol başarısız olduğu sürece karar vermeyi reddeder.
  • Kol başına yaklaşık 25 dönüşümün altında, z-testinin arkasındaki normal yaklaşım bir ölçüm değil, bir taslaktır. Hesaplayıcı üç ondalık basamak sahte hassasiyet yazdırmak yerine bunu söyler.

A/B test hesaplayıcı nasıl kullanılır

  1. A ve B için ziyaretçi ve dönüşüm sayılarını gir

    Ziyaretçiler, o varyanta atanan kişilerdir, sayfa görüntülemeleri değil. Dönüşümler, ölçtüğün şeyi yapanlardır: kaydolan, ödeyen, tıklayan. İkisi de her iki kol için aynı şekilde sayılmalı.

  2. Güven düzeyini ve hipotezi seç

    %95 çift yönlü varsayılandır ve B daha iyi ya da daha kötü olabilecekken dürüst seçimdir. Tek yönlü, yalnızca daha kötü bir B'nin değişiklik yokmuş gibi tamamen aynı şekilde göz ardı edileceği durumlar içindir; bu, insanların sandığından daha nadirdir.

  3. Kararı, sonra aralığı oku

    Şerit, sayıların neyi desteklediğini söyler. Göreli artış kutusu aralığı gösterir: gerçek etki muhtemelen onun içinde herhangi bir yerde oturur ve planlama yapılacak sayı nokta tahmini değil, alt uçtur.

  4. İki uyarıyı kontrol et

    Dağılım işaretlendiyse, başka bir şey okumadan önce testi düzelt. En küçük saptanabilir artış gözlediğin artıştan büyükse, testin gücü yetersizdi: örneklem büyüklüğü sekmesine git ve kaç ziyaretçi gerekeceğine bak.

  5. Sonucu veya bağlantıyı kopyala

    Sonucu kopyala, bir mesaj veya belge için özeti verir. Bağlantıyı kopyala, dört sayıyı URL'ye koyar; böylece kim açarsa aynı hesaplamayı görür.

Çıktıları okumak

Her kutunun anlamı, tek satırda.

KutuNe olduğuNasıl okunacağı
Göreli artış(B oranı eksi A oranı) bölü A oranıManşet. Yanındaki aralık, gerçek artışın muhtemelen oturduğu bölgedir.
p-değeriA ve B özdeş olsaydı bu kadar büyük bir fark görme ihtimali%95 güvende 0.05'in altı anlamlı demektir. Sonucun yanlış olma ihtimali değildir.
Güven1 eksi p, yüzde olarakÇoğu aracın yazdırdığı sayı. %87, neredeyse %95 değildir; çizginin yanlış tarafında kalmış bir yazı turadır.
B'nin daha iyi olma ihtimaliB'nin gerçek oranının A'nınkinin üstünde olma Bayes olasılığıİnsanların istediği cümle. %91, B'nin muhtemelen daha iyi olduğu demektir, %91 daha iyi olduğu değil.
Bu testin görebileceği en küçük artışBu kol büyüklükleriyle %80 güçte saptanabilen göreli artışGözlediğin artış bunun altındaysa, "anlamlı değil", "söyleyemedi" demektir.
Trafik dağılımıHer koldaki gözlenen ziyaretçi payı, plana karşıDağılım şansın izin verdiğinden fazla saptığında işaretlenir. Sonuçları okumadan önce testi düzelt.

Üç test, üç farklı ders

Klasik "az kaldı"

A: 10,000 ziyaretçi, 500 dönüşüm (%5.00). B: 10,000 ziyaretçi, 560 dönüşüm (%5.60). Göreli artış +%12, p = 0.058.

%95'te anlamlı değil ve aralık yaklaşık eksi %0.4'ten artı %24'e uzanıyor. Dürüst okuma "muhtemelen küçük bir pozitif, hiçbir şey de olabilir". Bu testin saptayabileceği en küçük artış yaklaşık %17, yani %12'lik bir etki her zaman gri bölgeye düşecekti. Bir hafta daha umut etmek değil, kabaca iki kat trafik gerekiyor.

Bozuk dağılım

A: 5,000 ziyaretçi, 100 dönüşüm. B: 4,300 ziyaretçi, 120 dönüşüm. Planlanan dağılım 50/50.

B, +%40 ile net bir kazanan gibi görünüyor. Hesaplayıcı bunu söylemeyi reddeder: 50/50'de 5,000'e 4,300'lük bir dağılımın kazara oluşma ihtimali milyonda birin altındadır. Bir şey, kullanıcıları sayılmadan önce B'den çıkarıyor; çoğu zaman bir tarayıcıda başarısız olan bir yönlendirme ya da varyanta farklı davranan bir bot filtresi. Ne olursa olsun, iki grup karşılaştırılabilir değil ve artış anlamsız.

Küçük site

A: 400 ziyaretçi, 12 dönüşüm (%3.0). B: 400 ziyaretçi, 19 dönüşüm (%4.75). Göreli artış +%58, p = 0.20.

%58'lik bir artış devasa geliyor ve p-değeri yaklaşık 0.19. 12 ve 19 dönüşümle hesaplayıcı düşük veri uyarısı verir: bu büyüklükte sayılar o kadar oynar ki fazladan tek bir kayıt oranı çeyrek puan kaydırır. Bu trafikte testin bir ayda doğrulayabileceği en küçük artış %100'ün üstündedir. Bu, daha uzun çalıştırmak için bir sebep değil; gerçeklik testi sekmesini okumak için bir sebep.

Bu hesaplayıcının yakalamak için yapıldığı hatalar

  • %90 güveni "muhtemelen iyidir" diye okumak. %95'te çizgi %95'tir. Onun altındaki sayı, verinin senin koyduğun çıtayı geçmediği anlamına gelir; hata sayı değil, baktıktan sonra çıtayı oynatmaktır.
  • Anlamlı olmayan bir teste berabere demek. Berabere, sıfır etrafında küçücük bir aralıktır. Geniş aralıklı anlamlı olmayan bir test cevaplanmamış bir sorudur ve örneklem büyüklüğü sekmesi onu cevaplamanın neye mal olacağını söyler.
  • Çubuğun yeşile döndüğü ilk sabah kazanan ilan etmek. Gözetleme simülatörü hiçbir şeyin değişmediği iki bin test çalıştırır ve günlük bakan birinin kaçını yayına alacağını gösterir.
  • Beş varyant test edip en iyisini %95'te raporlamak. Her biri %5'ten beş karşılaştırma, sahte bir kazanan için %23 ihtimaldir. Varyant eklediğinde örneklem büyüklüğü sekmesi alfayı senin için böler.
  • Sayfa görüntülemelerini tekil kullanıcılarla karşılaştırmak ya da dönüşümleri ziyaretçilerden farklı bir pencerede saymak. z-testi her ziyaretçinin bir bağımsız deneme olduğunu varsayar; başka her şey güveni şişirir.
  • Dağılımı görmezden gelmek. 100,000 ziyaretçide 48/52'lik bir dağılım şans değildir; bir hatadır ve onun altındaki her sonuç güvenilmezdir.

A/B test hesaplayıcı SSS

A/B testimin istatistiksel olarak anlamlı olup olmadığını nasıl anlarım?
Her varyantın ziyaretçi ve dönüşüm sayılarını gir, bir güven düzeyi seç (%95 standarttır) ve kararı oku. Test, p-değeri 1 eksi güven düzeyinin altındayken anlamlıdır; yani %95'te 0.05'in altında. Bu sayfa ayrıca gerçek artış için aralığı ve testin baktığın etkiyi saptayabilecek durumda olup olmadığını söyler; çıplak bir p-değeri bunu yapamaz.
Testim için 0.08'lik bir p-değeri ne anlama gelir?
A ve B gerçekten aynı oranda dönüşüm sağlasaydı, en az bu kadar büyük bir farkın şans eseri yaklaşık %8 oranında ortaya çıkacağı anlamına gelir. Sonucun yanlış olma olasılığı değildir ve "B'nin daha iyi olduğuna %92 güven" de değildir. %95 güvende, testin çıtayı geçmediği anlamına gelir; geçip geçemeyeceğini görmek için en küçük saptanabilir artış kutusuna bak.
%90 güven yeterli mi?
Olabilir; %90'a test başlamadan önce karar verdiysen ve onda bir yanlış pozitif oranını kabul ediyorsan. Asla yeterli olmayan şey, %95'te çalıştırıp %91 görüp aslında eşiğin başından beri %90 olduğuna karar vermektir. Güven düzeyi, ne sıklıkla kandırılmayı kabul ettiğine dair bir sözdür; baktıktan sonra değiştirmek sözü bozar.
Varyant başına kaç dönüşüme ihtiyacım var?
Sihirli bir sayı yok, ama kol başına yaklaşık 25 dönüşümün altında z-testi kaba bir taslaktır ve gerçek testlerin çoğu yüzlercesine ihtiyaç duyar. Önemli olan sayı saptamak istediğin artıştır: %5 taban oranında %10'luk göreli bir artışı %95 güven ve %80 güçle görmek, varyant başına yaklaşık 31,000 ziyaretçi, yani her birinde kabaca 1,550 dönüşüm gerektirir. Örneklem büyüklüğü sekmesi bunu senin oranların için hesaplar.
Frekansçı p-değeri ile B'nin daha iyi olma Bayes olasılığı arasındaki fark nedir?
p-değeri "hiçbir şey değişmediyse bu fark ne kadar şaşırtıcı?" diye sorar ve bir eşikte evet ya da hayır verir. Bayes sayısı "gördüklerime göre B'nin gerçek oranının A'nınkinin üstünde olma ihtimali ne?" diye sorar ve bir olasılık verir. Aynı veride genellikle yön olarak uyuşurlar: çift yönlü bir testte 0.05'lik bir p, B'nin daha iyi olma ihtimalinde %97'ye yakın oturur. Bu sayfa ikisini de gösterir, çünkü Bayes cümlesi insanların "güven" derken kastettiği şeydir ve p-değeri araçlarının yazdırdığı şeydir.
Hesaplayıcı dağılım saptığında neden karar vermeyi reddediyor?
Çünkü örneklem oranı uyuşmazlığı, iki grubun rastgele atanmadığı anlamına gelir ve rastgele atama bir A/B testinin işe yaramasının bütün sebebidir. 50/50 planladıysan ve gözlenen dağılımın şans eseri oluşma ihtimali binde birin altındaysa, bir mekanizma kimin hangi kola düşeceğine karar veriyor ve bu dönüşümle ilişkili olabilir. Gördüğün artış senin değişikliğin değil, o mekanizma olabilir.
Bu hesaplayıcıyı ziyaretçi başına gelir veya ortalama sipariş değeri için kullanabilir miyim?
Hayır. Bu sayfa bir oranı test eder: her ziyaretçi ya dönüşüm sağladı ya sağlamadı. Ziyaretçi başına gelir sürekli ve ağır çarpık bir ölçüttür; kullanıcı başına tutarlar üzerinde bir t-testi veya bootstrap gerektirir, bu da dört toplam yerine ham veri ister. Coddy matematik hesaplayıcılarındaki t-testi hesaplayıcı, kullanıcı başına değerlerin elindeyken ortalama karşılaştırmasını yapar.
En küçük saptanabilir artış nereden geliyor?
Örneklem büyüklüğü hesaplayıcıyla aynı formülden, tersine çalıştırılmış. Kol büyüklüklerin ve A'nın oranı verildiğinde, bu büyüklükteki testlerin %80'inin senin güven düzeyinde yakalayacağı göreli artışı bulur. Gözlediğin artış bunun altındaysa, testinin gücü o etki için yetersizdi ve "anlamlı değil", değişikliğin işe yarayıp yaramadığı hakkında neredeyse hiçbir bilgi taşımaz.

Diğer geliştirici araçları

Coddy programlama dilleri çizimi

Coddy ile kodlamayı öğren

BAŞLA