Menu

A/B Testi Gözetleme Simülatörü

A ve B'nin aynı sayfa olduğu iki bin test, senin trafiğinde çalıştırılmış. Her gün gözetleyen birinin kaçına kazanan diyeceğini ve aynı testlerin bitiş tarihini bekleyen birini kaç kez kandırdığını izle.

Yazan Nethanel Bar, Co-founder & CEO

Son güncelleme

Gerçekten kod yazmayı öğrenmeye hazır mısın?

Coddy, tarayıcında gerçek kod yazarak öğretir: etkileşimli dersler, anında geri bildirim ve takıldığında yapay zekâ desteği.

A/B testindeki en pahalı alışkanlık, senin sayılarında simüle edilmiş

Alışkanlık şu. Bir test başlatırsın ve her sabah paneli açarsın. Çubuk yavaşça yükselir, düşer, yine yükselir ve bir salı günü %95'i geçer. Sonucu ilan eder, kazananı yayına alır ve devam edersin. Sorun şu ki p-değeri gezinir. İki varyantın özdeş olduğu bir testte bile p-değeri bazı günler şans eseri 0.05'i geçer; sonra geri döner. İlk geçişte durmak, onu geçerken yakalamak demektir ve sahip olduğunu sandığın güven düzeyi gitmiştir.

Etkinin büyüklüğü insanları şaşırtır. %95 güvende, sonunda bir kez okunan bir test seni yirmide bir kandırır; imzaladığın anlaşma budur. Aynı testi dört hafta boyunca her gün oku ve ilk yeşil günde dur; simülatör tipik olarak hiçbir şeyin değişmediği testlerin dörtte biri veya daha fazlasında sahte bir kazanan gösterir. Evan Miller'ın ilk yazısı bunu günlük gözetleyen için %20'nin üstüne koydu; Optimizely 2015'te istatistik motorunu yeniden kurdu, çünkü müşterilerinin yanlış pozitif oranı bunun üstüne çıkmıştı. Günlük yerine haftalık kontrol etmek hasarı kabaca yarıya indirir ama ortadan kaldırmaz.

Buradaki simülasyon ne olduğu konusunda dürüsttür: her test iki kol için de gerçek oranda dönüşüm çeker, her bakışta o ana kadar toplanan her şey üzerinde sıradan iki oranlı z-testini çalıştırır ve gözetleyenin nerede duracağını kaydeder. Grafikteki her yol bir testtir; her nokta birinin sonuç ilan edeceği bir sabahtır. Hikâyenin diğer yarısını görmek için gerçek artışı +%10'a ayarla: gözetleyen gerçek bir etkiyi erken yakalar ama abartılı bir artışla ve etki sıfır olsaydı da aynı hevesle "kazanmış" olurdu.

Simülasyonun gösterdiği

  • p-değeri rastgele bir yürüyüştür. Sıfır hipotezi altında herhangi bir tek bakışta düzgün dağılmıştır; bu da herhangi bir sabah 0.05'in altında oturma ihtimalinin %5 olduğu anlamına gelir. Yirmi sekiz sabah boyunca bu ihtimaller birikir.
  • Yanlış pozitif oranı, testin ne kadar sürdüğüne değil, kaç kez baktığına bağlıdır. Haftalık okunan dört haftalık bir test, günlük okunan iki haftalık bir testten daha az kandırılır.
  • Erken durmalar artışı abartır. Gözetleyen şanslı bir günde durduğunda, o günkü gözlenen artış tanım gereği alışılmadık biçimde büyüktür. Yayına alındıktan sonra "sönen" kazananlar çoğu zaman buydu.
  • Çözüm ya disiplin ya da farklı bir testtir. Disiplin: örneklem büyüklüğünü ve bitiş tarihini önceden sabitle ve bir kez oku. Farklı bir test: Optimizely, Statsig ve Eppo'nun kullandığı her zaman geçerli p-değerleri gibi ardışık yöntemler, örneklem büyüklüğü karşılığında sürekli okunmak üzere kurulmuştur.
  • Bayes panelleri bağışık değildir. Her gün kontrol edilen ve bir eşikte harekete geçilen en-iyi-olma olasılığı, aynı sorunu farklı bir kostümle taşır.

Simülatör nasıl kullanılır

  1. Dönüşüm oranını ve günlük ziyaretçilerini gir

    Simülasyon senin gerçek oranında dönüşüm çeker; böylece p-değerinin gezinmesi gerçekten göreceğin gürültüyle eşleşir.

  2. Planlanan süreyi ve ne sıklıkla baktığını ayarla

    Her gün, üç günde bir ya da haftada bir. Gözetleyenin oranı ile dürüst oran arasındaki fark, o alışkanlığın bedelidir.

  3. Gerçek artışı yok'ta bırak

    Bu her testi bir A/A testi yapar: her kazanan yapısı gereği sahte alarmdır. Gözetleyeni gerçek bir etkide görmek için sonra +%10 veya +%30'a geç.

  4. İki büyük sayıyı oku

    Gözetleyenin oranı, günlük kontrol edenin ne sıklıkla kazanan ilan ettiğidir. Bitiş tarihi oranı seçtiğin alfaya yakın olmalı; öyleyse dürüst test vaat ettiğini yapıyordur.

  5. Tekrar çalıştır

    Her çalıştırma yeni rastgele testler çeker. Oranlar biraz oynar; fark oynamaz.

A/A testlerinde tipik yanlış pozitif oranları

%95 güvende, sonunda tek bir dürüst okuma yaklaşık %5 oranında kandırılır. İlk anlamlı bakışta duran bir gözetleyen için simülasyondan ve literatürden kaba rakamlar.

Bakma sıklığı4 haftada bakışSahte kazananlar
Bir kez, sonunda1yaklaşık %5
Haftada bir4yaklaşık %10 ile %13
3 günde bir9 ile 10yaklaşık %15 ile %20
Her gün28yaklaşık %25 ile %30
12 hafta boyunca her gün84%35'ten fazla

Üç alışkanlık, simüle edilmiş

Günlük kontrol eden

%5 dönüşüm, günde 1,000 ziyaretçi, 28 gün, her sabah kontrol edilmiş. Bizim çalıştırmamızda: gözetleyen 2,000 A/A testin yaklaşık %28'inde kazanan ilan etti; sonunda bir kez okuyunca %4.5.

Biri her gün izlediği için dikkatli hissettiren bir test için sahte alarm oranının altı katı. O "kazananların" yarısı B'yi, yarısı A'yı taçlandırdı; çünkü bulunacak bir şey yoktu.

Haftalık kontrol eden

Aynı trafik, aynı süre, haftada bir kontrol edilmiş. Bizim çalıştırmamızda: gözetleyen için yaklaşık %12, sonunda %5'e karşı.

Yirmi sekiz yerine dört kez bakmak çok yardım eder ve yine de vaat edilen oranın iki katından fazlasını verir. Sözü tutan tek bakış sayısı birdir.

Gerçek +%10'luk bir artış

Aynı trafikte B'nin gerçek artışını +%10'a ayarla. 28 günlük dürüst testin bu trafikte bu kadar küçük bir artış için gücü sınırlıdır; gözetleyen şanslı günlerde daha sık erken durur.

Baştan çıkarıcı durum bu: gözetleyen bir şeyleri daha hızlı buluyor gibi görünür. Ama durduğu günler artışın en büyük göründüğü günlerdir; yani yayına alınan tahmin şişiktir ve aynı alışkanlık artış sıfıra ayarlıyken de bir "kazanan" bulurdu.

Gözetleme hataları

  • İlk anlamlı sabahta durmak. Bütün sayfa bu. Güven düzeyi yalnızca sonucu bir kez okursan söylediği anlama gelir.
  • "Az kalmış" bir testi uzatmak. Sonuç neredeyse anlamlı diye daha uzun çalıştırmaya karar vermek tersine gözetlemedir ve yanlış pozitif oranını aynı şekilde şişirir.
  • "Sadece bir şey bozulmadı mı diye" her gün kontrol etmek. Hatalara bakmak iyidir; p-değerine bakmak değildir. Bitiş tarihine kadar artışa değil, trafik dağılımına ve hata oranlarına bak.
  • Bir Bayes panelinin gözetlemeyi güvenli kıldığına inanmak. Her gün kontrol ettiğin bir olasılık eşiğinde harekete geçmek aynı şişmeye sahiptir.
  • Artışı durduğun günden raporlamak. Erken durmak zorundaysan aralığı raporla ve gerçek artışın nokta tahmininden küçük olmasını bekle.

Gözetleme SSS

A/B testinde gözetleme sorunu nedir?
Sabit ufuklu bir testi tekrar tekrar okuyup anlamlı göründüğü ilk anda durmak. Veri gelirken p-değeri dalgalandığı için her bakış, eşiği şans eseri geçmek için bir şans daha demektir. %95 güvende bir ay boyunca her gün okunan bir test, hiçbir şey değişmemişken güven düzeyinin vaat ettiği %5 yerine kabaca dörtte bir oranında sahte kazanan üretir.
Testime bitmeden bakmak yanlış mı?
Bakmak sorun değil; harekete geçmek sorun. Trafiğin eşit bölündüğünü, iki varyantın da yüklendiğini ve dönüşümlerin kaydedildiğini kontrol et. Artışı veya güveni okuma ve gördüklerinin bitiş tarihini iki yönde de değiştirmesine izin verme.
Sürekli kontrol etmek istiyorsam nasıl A/B testi yaparım?
Ardışık bir yöntem kullan. Her zaman geçerli p-değerleri, grup ardışık tasarımlar ve benzerleri her an okunmak üzere kurulmuştur; bunun bedelini aynı güç için daha büyük bir örneklem büyüklüğüyle öderler. Çoğu modern platform birini sunar. Bu simülatör klasik sabit ufuklu testi modeller, çünkü çoğu elektronik tablo ve panel hesaplaması, bu sitenin diğer sekmeleri dahil, odur.
Haftada bir kontrol edersem gözetleme önemli mi?
Daha az, ama evet. %95'te dört hafta boyunca dört bakış tipik olarak yanlış pozitif oranını ikiye katlar. Vaat edilen oranı koruyan tek bakış sayısı birdir.
Simülatör neden A/A testleri kullanıyor?
Çünkü özdeş kollarla her kazanan yapısı gereği sahte alarmdır; yani simülatörün raporladığı oran, simüle edilen alışkanlığın tam olarak yanlış pozitif oranıdır. Gerçek bir artışı açmak diğer tarafı gösterir: gözetleyen şanslı günlerde erken durur ve şişik bir etki raporlar.
Bayes testi gözetleme sorununu çözer mi?
Tek başına değil. Sürekli okunan ve sabit bir eşikte harekete geçilen bir Bayes olasılığı, Georgi Georgiev ve başkalarının gösterdiği gibi, yanlış kararları aynı şekilde şişirir. Uygun bir karar kuralı ve önsele sahip Bayes yöntemleri sürekli izleme altında iyi davranabilir, ama tek başına "Bayes" çözüm değildir.

Diğer geliştirici araçları

Coddy programlama dilleri çizimi

Coddy ile kodlamayı öğren

BAŞLA