איך יודעים אם A/B test מובהק סטטיסטית?
הזינו את המבקרים וההמרות של כל גרסה, בחרו רמת ביטחון (95% היא הסטנדרט) וקראו את ההכרעה. המבחן מובהק כשה-p-value קטן מ-1 פחות רמת הביטחון, כלומר מתחת ל-0.05 ב-95%. הדף הזה גם מציג את רווח הסמך לשיפור האמיתי ואם המבחן בכלל יכול היה לזהות את האפקט שאתם מסתכלים עליו, דבר ש-p-value לבדו לא יכול לעשות.
מה המשמעות של p-value של 0.08 במבחן שלי?
שאם A ו-B היו ממירות באמת באותו שיעור, פער גדול לפחות כמו זה היה מופיע במקרה בערך ב-8% מהפעמים. זו לא ההסתברות שהתוצאה שגויה, וזה לא "92% ביטחון ש-B טובה יותר". ב-95% ביטחון פירוש הדבר שהמבחן לא עבר את הרף; הסתכלו על אריח השיפור הקטן ביותר שניתן לזהות כדי לראות אם הוא בכלל יכול היה.
האם 90% ביטחון מספיק טוב?
זה יכול להיות, אם החלטתם על 90% לפני שהמבחן התחיל ואתם מקבלים שיעור חיובי שגוי של אחד לעשרה. מה שלעולם לא מספיק טוב הוא להריץ ב-95%, לראות 91%, ולהחליט ש-90% היה הסף האמיתי מההתחלה. רמת הביטחון היא הבטחה לגבי התדירות שבה אתם מוכנים להיות מרומים; שינוי שלה אחרי שהסתכלתם שובר את ההבטחה.
כמה המרות צריך לכל גרסה?
אין מספר קסם, אבל מתחת לכ-25 המרות לכל גרסה מבחן z הוא סקיצה גסה, ורוב המבחנים האמיתיים צריכים מאות. המספר שחשוב הוא השיפור שאתם רוצים לזהות: בשיעור בסיס של 5%, זיהוי שיפור יחסי של 10% ב-95% ביטחון ו-80% עוצמה דורש כ-31,000 מבקרים לכל גרסה, בערך 1,550 המרות בכל אחת. לשונית גודל המדגם מחשבת את זה לפי השיעורים שלכם.
מה ההבדל בין ה-p-value הפרקוונטיסטי לבין הסיכוי הבייסיאני ש-B טובה יותר?
ה-p-value שואל "כמה מפתיע הפער הזה אם שום דבר לא השתנה?" ונותן כן או לא לפי סף. המספר הבייסיאני שואל "בהינתן מה שראיתי, כמה סביר שהשיעור האמיתי של B גבוה משל A?" ונותן הסתברות. על אותם נתונים הם בדרך כלל מסכימים על הכיוון: p של 0.05 מקביל לסיכוי של כ-97% ש-B טובה יותר במבחן דו-צדדי. הדף מציג את שניהם כי המשפט הבייסיאני הוא מה שאנשים מתכוונים אליו כשהם אומרים "ביטחון", וה-p-value הוא מה שהכלי שלהם מדפיס.
למה המחשבון מסרב לתת הכרעה כשהחלוקה סוטה?
כי חוסר התאמה ביחס המדגם (sample ratio mismatch) פירושו ששתי הקבוצות לא שויכו באקראי, והאקראיות היא כל הסיבה ש-A/B test עובד. אם תכננתם 50/50 ולחלוקה שנצפתה יש סיכוי של פחות מאחד לאלף להיווצר במזל, מנגנון כלשהו מחליט מי נוחת באיזו גרסה, והוא עשוי להיות מתואם עם ההמרה. השיפור שאתם רואים עשוי להיות המנגנון הזה, לא השינוי שלכם.
אפשר להשתמש במחשבון הזה להכנסה למבקר או לערך הזמנה ממוצע?
לא. הדף הזה בודק פרופורציה: כל מבקר או שהמיר או שלא. הכנסה למבקר היא מדד רציף ומוטה מאוד, והיא דורשת מבחן t או bootstrap על הסכומים לכל משתמש, וזה דורש את הנתונים הגולמיים ולא ארבעה סכומים. מחשבון מבחן t במחשבוני המתמטיקה של Coddy מטפל בהשוואת ממוצעים ברגע שיש לכם את הערכים לכל משתמש.
מאיפה מגיע השיפור הקטן ביותר שניתן לזהות?
מאותה נוסחה של מחשבון גודל המדגם, מורצת לאחור. בהינתן גדלי הגרסאות והשיעור של A, הוא מוצא את השיפור היחסי ש-80% מהמבחנים בגודל הזה היו תופסים ברמת הביטחון שלכם. אם השיפור שנצפה קטן ממנו, למבחן לא הייתה מספיק עוצמה לאפקט הזה, ו"לא מובהק" כמעט לא אומר דבר על השאלה אם השינוי עבד.