כמה מבקרים כל גרסה צריכה לפני שהמבחן יכול לומר משהו, וכמה ימים זה בתנועה שלכם. קבעו את השיפור הקטן ביותר ששווה לזהות, את רמת הביטחון ואת העוצמה, וקראו את המספר עם הנוסחה מתחתיו.
גודל מדגם הוא הבטחה שאתם נותנים לעצמכם לפני שהמבחן מתחיל: "אסתכל על התוצאה כשכך וכך אנשים יראו אותה, ולא לפני כן." בלעדיו, כל A/B test נסחף לאותו סיפור. השבוע הראשון נראה מבטיח, בשבוע השני השיפור מתכווץ, מישהו שואל אם זה כבר מובהק, והמבחן נגמר ביום שהפס הופך לירוק. הדף הזה נותן לכם את המספר לכתוב בתוכנית, כך שתאריך הסיום יהיה עובדה ולא מצב רוח.
החישוב הוא גודל המדגם הסטנדרטי לשתי פרופורציות, זה שמאחורי המחשבון של Evan Miller ושל Optimizely, והוא תלוי בארבעה דברים: שיעור הבסיס, השיפור שאתם רוצים להיות מסוגלים לזהות, רמת הביטחון והעוצמה. העוצמה היא זו שאנשים מדלגים עליה. בעוצמה של 80%, שיפור אמיתי בגודל שציינתם נתפס שמונה פעמים מעשר; למבחן עם חצי מהמדגם יש הרבה פחות מחצי מהעוצמה, ולכן מבחן בלי מספיק עוצמה הוא לא "תשובה גסה יותר" אלא בדרך כלל אין תשובה בכלל.
העקומה מתחת לתוצאה היא החלק ששווה לזכור. מספר המבקרים הנדרש גדל עם הריבוע של אחד חלקי השיפור: חצו את השיפור שאתם רוצים לראות ותצטרכו בערך פי ארבעה תנועה. אתר שיכול לאשר שיפור של 30% בשבועיים צריך בערך פי תשעה זמן כדי לאשר שיפור של 10%. אם מספר הימים יוצא בחודשים, זה המחשבון שאומר לכם לבדוק משהו גדול יותר, או לעלות במשפך למדד שיותר אנשים מגיעים אליו, לפני שהוא אומר לכם לחכות.
במה תלוי גודל המדגם
האפקט המינימלי לזיהוי הוא החלטה, לא מדידה. זה השיפור הקטן ביותר שבשבילו הייתם באמת משיקים. קביעה נמוכה שלו כדי שהמבחן יהיה "רגיש יותר" הופכת את המבחן לארוך יותר, לא לטוב יותר.
שיפור יחסי ושיפור מוחלט הם חיות שונות. שיפור יחסי של 10% על בסיס של 5% הוא חצי נקודת אחוז. הדף הזה עובד במונחים יחסיים כי כך מדווחות תוצאות, ומציג לצדם את שיעור היעד כדי שתראו את שניהם.
גרסאות נוספות עולות יותר מחלקן היחסי. בדיקת A מול B, C ו-D היא שלוש השוואות, ואת רמת הביטחון צריך לחלק ביניהן. המחשבון מחיל את חלוקת בונפרוני ומציג את האלפא שכל השוואה מקבלת בפועל.
ימים הם תקרה, לא רצפה. גם כשהמספרים אומרים ארבעה ימים, הריצו לפחות שבוע שלם, רצוי שניים, כי מבקרים באמצע השבוע ובסוף השבוע ממירים אחרת, ומבחן של ימי שלישי בלבד מודד ימי שלישי.
עוצמה של 80% פירושה שמנצחת אמיתית אחת מחמש מפוספסת. אם פספוס מנצחת יקר לכם, השתמשו ב-90% וקבלו מדגם גדול יותר.
איך לקבוע את גודל ה-A/B test
1
הזינו את שיעור ההמרה הנוכחי
השתמשו בשיעור של הדף או השלב שהמבחן ישנה, כפי שנמדד על אותו סוג מבקרים שהמבחן יראה. אל תשתמשו בממוצע של כל האתר כשאתם בודקים שלב אחד במשפך.
2
בחרו את השיפור הקטן ביותר ששווה לזהות
שאלו איזה שיפור היה גורם לכם להשיק את השינוי. זה האפקט המינימלי לזיהוי שלכם. 10% יחסי הוא בחירה נפוצה לדף בוגר; עיצוב מחדש עשוי להצדיק 20% ומעלה.
3
קבעו ביטחון ועוצמה
95% ביטחון ו-80% עוצמה הם המוסכמות. העלו את הביטחון כשמנצחת שגויה יקרה לביטול; העלו את העוצמה כשמנצחת שפוספסה יקרה להשאיר על השולחן.
4
הוסיפו את המבקרים היומיים
כל הגרסאות יחד, כשסופרים רק את המבקרים שיגיעו למבחן. התוצאה הופכת לימים ולשבועות שלמים.
5
רשמו את תאריך הסיום
המחשבון נותן לכם את גודל המדגם לכל גרסה. הכניסו אותו לתוכנית המבחן עם התאריך שנגזר ממנו, ואל תקראו תוצאות לפניו. לשונית סימולטור ההצצות מראה למה.
גודל מדגם במבט אחד
מבקרים לכל גרסה ב-95% ביטחון ו-80% עוצמה, דו-צדדי. הכפילו בשתיים למבחן עם שתי גרסאות.
שיעור בסיס
שיפור +5%
שיפור +10%
שיפור +20%
שיפור +50%
1%
כ-637,000
כ-163,000
כ-42,700
כ-7,800
3%
כ-208,000
כ-53,200
כ-13,900
כ-2,500
5%
כ-122,000
כ-31,200
כ-8,200
כ-1,500
10%
כ-57,800
כ-14,800
כ-3,800
כ-690
20%
כ-25,600
כ-6,500
כ-1,700
כ-290
דוגמאות מחושבות
דף הרשמה ב-5%, מחפשים +10%
בסיס 5%, אפקט מינימלי לזיהוי 10% (יעד 5.5%), 95% ביטחון, 80% עוצמה, דו-צדדי. תוצאה: כ-31,000 מבקרים לכל גרסה, 62,000 בסך הכול.
ב-1,000 מבקרים ביום זה 62 ימים, כלומר תשעה שבועות שלמים. צוותים רבים היו אומרים שזה ארוך מדי, ובודקים שינוי נועז יותר או מקבלים שהדף הזה צריך שיפור של 20% ומעלה כדי להיות בר בדיקה בשבועיים.
שלב בקופה ב-3%, מחפשים +20%
בסיס 3%, אפקט מינימלי לזיהוי 20% (יעד 3.6%). תוצאה: כ-13,900 מבקרים לכל גרסה.
בסיסים נמוכים יותר צריכים יותר מבקרים לאותו שיפור יחסי, כי יש פחות המרות לספור. שיפור יחסי של 20% כאן הוא רק 0.6 נקודות אחוז, והמבחן צריך להבדיל בין 3.0% ל-3.6%.
שלוש גרסאות מול ביקורת
בסיס 5%, שיפור 10%, ארבע גרסאות כולל הביקורת. האלפא לכל השוואה הופכת ל-0.05 / 3, והמדגם לכל גרסה גדל בכשליש; הסך הכול הוא פי ארבעה מהמספר לכל גרסה.
הוספת גרסאות היא הדרך המהירה ביותר להפוך מבחן של שבועיים למבחן של חודשיים. בדקו רעיון חזק אחד מול הביקורת; הריצו את הרעיון הבא אחר כך.
טעויות בגודל מדגם
לקבוע את גודל המבחן אחרי שראיתם תוצאות מוקדמות. השיפור שבמקרה נצפה ביום השלישי הוא לא האפקט המינימלי לזיהוי; הוא רעש עם דעה.
להשתמש בשיפור מוחלט כשהתכוונו ליחסי. "שיפור של 10%" על בסיס של 2% הוא או 2.2% או 12%, וגדלי המדגם שונים פי מאות.
לעצור בגודל המדגם כשהתוצאה לא מובהקת ולקרוא לזה הפסד. הגעה לגודל המדגם פירושה שהמבחן יכול לזהות את האפקט שציינתם. היא לא אומרת דבר על אפקטים קטנים יותר.
לספור צפיות בדף כמבקרים. הנוסחה מניחה שכל יחידה היא מבקר בלתי תלוי אחד עם תוצאה אחת; צפיות חוזרות מנפחות את הספירה ואת הביטחון.
לסיים בשבוע חלקי. אם מגיעים לגודל המדגם ביום חמישי, הריצו עד יום ראשון שאחריו; תמהיל ימי השבוע משנה את שיעורי ההמרה יותר מרוב השינויים הנבדקים.
שאלות נפוצות על גודל מדגם
כמה זמן צריך להריץ A/B test?
עד שכל גרסה מגיעה לגודל המדגם עבור השיפור שאתם רוצים לזהות, ולפחות שבוע שלם, רצוי שניים. הזינו למעלה את המבקרים היומיים והמחשבון יהפוך את גודל המדגם לימים ולשבועות שלמים. הרצה ארוכה מהנדרש היא בזבוז קטן; עצירה מוקדמת כי התוצאה נראית טוב היא הדרך שבה מוכרזות רוב המנצחות השגויות.
מה זה אפקט מינימלי לזיהוי (MDE)?
השיפור הקטן ביותר שהמבחן מתוכנן לתפוס באופן אמין, שנבחר לפני המבחן. הוא מבוטא בדרך כלל כשינוי יחסי, כך ש-MDE של 10% על בסיס של 4% פירושו שהמבחן יכול להבדיל בין 4.0% ל-4.4%. MDE קטן יותר דורש הרבה יותר מבקרים: חציית ה-MDE מכפילה בערך פי ארבעה את המדגם.
מה המשמעות של עוצמה של 80%?
שאם השיפור האמיתי הוא בדיוק בגודל שציינתם, מבחן בגודל הזה ייצא מובהק ב-80% מהפעמים. ב-20% האחרים הוא מפספס מנצחת אמיתית. עוצמה היא תמונת הראי של ביטחון: ביטחון מגביל אזעקות שווא, עוצמה מגבילה מנצחות שפוספסו.
למה שיעור המרה נמוך יותר צריך יותר מבקרים?
כי המבחן סופר המרות, לא מבקרים. בשיעור של 1%, 10,000 מבקרים נותנים לכם 100 אירועים להשוואה; ב-10% הם נותנים 1,000. אותו שיפור יחסי הרבה יותר קל לראות במקרה השני. לכן בדיקה על מדד גבוה יותר במשפך, שיותר מבקרים מגיעים אליו, היא לעתים קרובות הדרך היחידה שבה אתר קטן יכול לבדוק בכלל.
אפשר להריץ יותר מגרסה אחת?
כן, והמחשבון קובע את הגודל נכון, אבל כל גרסה נוספת היא עוד השוואה מול הביקורת ואת רמת הביטחון צריך לחלק ביניהן. ארבע גרסאות ב-95% בלי תיקון הן סיכוי של 14% למנצחת שגויה אחת לפחות. המחשבון מחלק את האלפא בין ההשוואות, ולכן המספר לכל גרסה גדל.
זה עובד להכנסות או לערך הזמנה ממוצע?
לא, הדף הזה קובע גודל למבחן על שיעור המרה. מדדים רציפים כמו הכנסה למבקר צריכים את השונות של המדד, שבדרך כלל גדולה בהרבה משל פרופורציה, וגדלי המדגם גדולים בהתאם. לשם כך צריך את השונות ההיסטורית שלכם וחישוב מבוסס מבחן t.