Menu

מחשבון A/B Test

הקלידו את מספר המבקרים וההמרות של כל גרסה. תקבלו את השורה התחתונה במשפט אחד, את ה-p-value עם כל החישוב, את רווח הסמך, את הסיכוי הבייסיאני ש-B טובה יותר, בדיקה שחלוקת התנועה תקינה, ואת השיפור הקטן ביותר שהמבחן הזה היה יכול לזהות אי פעם.

מאת Nethanel Bar, Co-founder & CEO

עודכן לאחרונה

מוכנים ללמוד תכנות באמת?

ב-Coddy לומדים דרך כתיבת קוד אמיתי בדפדפן: שיעורים אינטראקטיביים, משוב מיידי ועזרה מ-AI כשנתקעים.

מה המחשבון הזה אומר לכם ואחרים לא

כל מחשבון A/B test מדפיס p-value. רובם עוצרים שם, וכך מייסדים מוצאים את עצמם בוהים ב-87% ביטחון ותוהים מה זה אומר. המחשבון הזה עונה על השאלות שבאמת קובעות מה תעשו הלאה. האם ההבדל גדול ממה שמקריות הייתה מייצרת? כמה גדול יכול להיות השיפור האמיתי, במקרה הגרוע ובמקרה הטוב? אם המבחן יצא "לא מובהק", האם הוא בכלל יכול היה למצוא משהו בגודל המדגם הזה? והאם חלוקת התנועה עצמה תקינה, או שאתם משווים שתי קבוצות שמעולם לא היו שוות?

הוא מריץ את מבחן z הסטנדרטי לשתי פרופורציות, אותו מבחן שמשמש את המנוע הקלאסי של Optimizely, את המצב הפרקוונטיסטי של VWO וכל ספר לימוד בסטטיסטיקה, ומציג כל שורה בחשבון: השיעור המאוחד, שגיאת התקן, ציון ה-z והשטח בזנב. לצדו מופיעה התשובה הבייסיאנית, ההסתברות שהשיעור האמיתי של B גבוה משל A, כי "יש סיכוי של 91% ש-B טובה יותר" הוא המשפט שרוב האנשים קיוו שה-p-value ייתן להם, וזה מספר אחר.

בנינו אותו אחרי שהסתכלנו על הדשבורד שלנו. ב-Coddy הרצנו כעשרים ניסויים עם שם, עשרה מהם מבחני תמחור לפי מדינה על פרוסות קטנות של תנועה, והכלי הפנימי שלנו הציג פס ביטחון עם המילים "להמשיך להריץ" מתחת ל-95%. זו עצירה אופציונלית עם פנים ידידותיות. שלוש הלשוניות שליד הלשונית הזו, גודל מדגם, בדיקת המציאות וסימולטור ההצצות, קיימות כי מחשבון שמדווח רק על מובהקות הוא מחשבון שעוזר לכם לרמות את עצמכם מהר יותר.

מה לדעת לפני שסומכים על המספר

  • "לא מובהק" לא אומר "אין הבדל". הוא אומר שהנתונים לא יכולים להכריע. האריח שמציג את השיפור הקטן ביותר שהמבחן יכול לזהות הוא הקריאה הכנה: אם השיפור שנצפה קטן ממנו, המבחן מעולם לא היה אמור לתת תשובה.
  • ה-p-value הוא לא הסיכוי שאתם טועים. הוא הסיכוי לראות פער גדול כזה אם שתי הגרסאות היו זהות. עד כמה סביר שהמנצחת אמיתית תלוי גם בתדירות שבה הרעיונות שלכם עובדים, ולשונית בדיקת המציאות הופכת את זה למספר.
  • לעצור ביום הראשון שבו הפס הופך לירוק הוא ההרגל היקר ביותר ב-A/B testing. בדיקה יומית ועצירה מוקדמת הופכות שיעור חיובי שגוי של 5% ל-20% ויותר. סימולטור ההצצות מראה את זה קורה על התנועה שלכם.
  • חלוקה שבורה מרעילה הכול. אם תכננתם 50/50 וקיבלתם 46/54, משהו מנתב משתמשים לפני שהם מגיעים למבחן: שכבת מטמון, מסנן בוטים, הפניה. המחשבון מריץ את הבדיקה הזו ראשונה ומסרב לתת הכרעה כל עוד היא נכשלת.
  • מתחת לכ-25 המרות לכל גרסה, הקירוב הנורמלי שעליו מבוסס מבחן z הוא סקיצה, לא מדידה. המחשבון אומר את זה במקום להדפיס שלוש ספרות אחרי הנקודה של דיוק מדומה.

איך להשתמש במחשבון A/B test

  1. הזינו מבקרים והמרות עבור A ו-B

    מבקרים הם האנשים ששויכו לגרסה הזו, לא צפיות בדף. המרות הן אלה שעשו את הפעולה שאתם מודדים: נרשמו, שילמו, לחצו. את שניהם צריך לספור באותה דרך בשתי הגרסאות.

  2. בחרו רמת ביטחון והשערה

    95% דו-צדדי הוא ברירת המחדל והבחירה הכנה כש-B יכולה להיות טובה יותר או גרועה יותר. חד-צדדי מתאים רק כש-B גרועה תזכה בדיוק לאותו יחס כמו חוסר שינוי, וזה נדיר יותר ממה שנדמה.

  3. קראו את ההכרעה, ואז את רווח הסמך

    הבאנר אומר מה המספרים תומכים בו. אריח השיפור היחסי מציג את רווח הסמך: האפקט האמיתי נמצא כנראה בכל מקום בתוכו, והקצה התחתון הוא המספר לתכנן לפיו, לא האומדן הנקודתי.

  4. בדקו את שתי האזהרות

    אם החלוקה מסומנת, תקנו את המבחן לפני שקוראים כל דבר אחר. אם השיפור הקטן ביותר שניתן לזהות גדול מהשיפור שנצפה, למבחן לא הייתה מספיק עוצמה: עברו ללשונית גודל המדגם וראו כמה מבקרים היה צריך.

  5. העתיקו את התוצאה או את הקישור

    העתקת התוצאה נותנת סיכום להודעה או למסמך. העתקת הקישור שמה את ארבעת המספרים בכתובת, כך שמי שפותח אותה רואה את אותו חישוב.

איך לקרוא את התוצאות

מה כל אריח אומר, בשורה אחת.

אריחמה זהאיך לקרוא אותו
שיפור יחסי(שיעור B פחות שיעור A) חלקי שיעור Aהכותרת. רווח הסמך שלצדו הוא הטווח שבו השיפור האמיתי נמצא כנראה.
p-valueהסיכוי לפער גדול כזה אם A ו-B היו זהותמתחת ל-0.05 ב-95% ביטחון פירושו מובהק. זה לא הסיכוי שהתוצאה שגויה.
ביטחון1 פחות p, באחוזיםהמספר שרוב הכלים מדפיסים. 87% זה לא כמעט 95%; זה מטבע בצד הלא נכון של הקו.
הסיכוי ש-B טובה יותרההסתברות הבייסיאנית שהשיעור האמיתי של B גבוה משל Aהמשפט שאנשים רוצים. 91% פירושו ש-B כנראה טובה יותר, לא שהיא טובה ב-91%.
השיפור הקטן ביותר שהמבחן יכול לזהותהשיפור היחסי שניתן לזהות בעוצמה של 80% בגדלי הגרסאות האלהאם השיפור שנצפה קטן ממנו, "לא מובהק" פירושו "לא ניתן היה לדעת".
חלוקת תנועההחלק שנצפה מהמבקרים בכל גרסה לעומת התכנוןמסומן כשהחלוקה סוטה יותר ממה שמקריות מאפשרת. תקנו את המבחן לפני שקוראים תוצאות.

שלושה מבחנים, שלושה לקחים שונים

הכמעט הקלאסי

A: 10,000 מבקרים, 500 המרות (5.00%). B: 10,000 מבקרים, 560 המרות (5.60%). שיפור יחסי +12%, p = 0.058.

לא מובהק ב-95%, ורווח הסמך נע מכמינוס 0.4% עד פלוס 24%. הקריאה הכנה היא "כנראה שיפור חיובי קטן, ייתכן שכלום". השיפור הקטן ביותר שהמבחן הזה יכול לזהות הוא כ-17%, כך שאפקט של 12% תמיד היה נוחת באזור האפור. הוא צריך בערך פי שניים תנועה, לא עוד שבוע של תקווה.

החלוקה השבורה

A: 5,000 מבקרים, 100 המרות. B: 4,300 מבקרים, 120 המרות. חלוקה מתוכננת 50/50.

B נראית כמנצחת ברורה עם +40%. המחשבון מסרב לומר זאת: לחלוקה של 5,000 מול 4,300 יש סיכוי של פחות מאחד למיליון לקרות במקרה בחלוקה של 50/50. משהו מוציא משתמשים מ-B לפני שהם נספרים, לרוב הפניה שנכשלת בדפדפן אחד, או מסנן בוטים שמתייחס לגרסה אחרת. מה שזה לא יהיה, שתי הקבוצות אינן ברות השוואה והשיפור חסר משמעות.

האתר הקטן

A: 400 מבקרים, 12 המרות (3.0%). B: 400 מבקרים, 19 המרות (4.75%). שיפור יחסי +58%, p = 0.20.

שיפור של 58% נשמע עצום, וה-p-value הוא בערך 0.19. עם 12 ו-19 המרות המחשבון מסמן מעט נתונים: בגודל הזה המספרים קופצים כל כך שהרשמה אחת נוספת מזיזה את השיעור ברבע נקודה. בתנועה כזו, השיפור הקטן ביותר שהמבחן יכול לאשר בחודש הוא מעל 100%. זו לא סיבה להריץ אותו יותר זמן; זו סיבה לקרוא את לשונית בדיקת המציאות.

טעויות שהמחשבון הזה בנוי לתפוס

  • לקרוא 90% ביטחון כ"כנראה בסדר". ב-95% הקו הוא 95%. מספר מתחתיו פירושו שהנתונים לא עברו את הרף שקבעתם, והזזת הרף אחרי שהסתכלתם היא הטעות, לא המספר.
  • לקרוא למבחן לא מובהק תיקו. תיקו הוא רווח סמך זעיר סביב אפס. מבחן לא מובהק עם רווח סמך רחב הוא שאלה שלא נענתה, ולשונית גודל המדגם אומרת כמה יעלה לענות עליה.
  • להכריז על מנצחת בבוקר הראשון שבו הפס הופך לירוק. סימולטור ההצצות מריץ אלפיים מבחנים שבהם שום דבר לא השתנה ומראה כמה מהם מי שמציץ כל יום היה משיק.
  • לבדוק חמש גרסאות ולדווח על הטובה ביותר ב-95%. חמש השוואות של 5% כל אחת הן סיכוי של 23% למנצחת מדומה. לשונית גודל המדגם מחלקת את אלפא בשבילכם כשמוסיפים גרסאות.
  • להשוות צפיות בדף למשתמשים ייחודיים, או לספור המרות על חלון זמן שונה מזה של המבקרים. מבחן z מניח שכל מבקר הוא ניסוי בלתי תלוי אחד; כל דבר אחר מנפח את רמת הביטחון.
  • להתעלם מהחלוקה. חלוקה של 48/52 על 100,000 מבקרים היא לא מקריות; היא באג, וכל תוצאה שנגזרת ממנה לא אמינה.

שאלות נפוצות על מחשבון A/B test

איך יודעים אם A/B test מובהק סטטיסטית?
הזינו את המבקרים וההמרות של כל גרסה, בחרו רמת ביטחון (95% היא הסטנדרט) וקראו את ההכרעה. המבחן מובהק כשה-p-value קטן מ-1 פחות רמת הביטחון, כלומר מתחת ל-0.05 ב-95%. הדף הזה גם מציג את רווח הסמך לשיפור האמיתי ואם המבחן בכלל יכול היה לזהות את האפקט שאתם מסתכלים עליו, דבר ש-p-value לבדו לא יכול לעשות.
מה המשמעות של p-value של 0.08 במבחן שלי?
שאם A ו-B היו ממירות באמת באותו שיעור, פער גדול לפחות כמו זה היה מופיע במקרה בערך ב-8% מהפעמים. זו לא ההסתברות שהתוצאה שגויה, וזה לא "92% ביטחון ש-B טובה יותר". ב-95% ביטחון פירוש הדבר שהמבחן לא עבר את הרף; הסתכלו על אריח השיפור הקטן ביותר שניתן לזהות כדי לראות אם הוא בכלל יכול היה.
האם 90% ביטחון מספיק טוב?
זה יכול להיות, אם החלטתם על 90% לפני שהמבחן התחיל ואתם מקבלים שיעור חיובי שגוי של אחד לעשרה. מה שלעולם לא מספיק טוב הוא להריץ ב-95%, לראות 91%, ולהחליט ש-90% היה הסף האמיתי מההתחלה. רמת הביטחון היא הבטחה לגבי התדירות שבה אתם מוכנים להיות מרומים; שינוי שלה אחרי שהסתכלתם שובר את ההבטחה.
כמה המרות צריך לכל גרסה?
אין מספר קסם, אבל מתחת לכ-25 המרות לכל גרסה מבחן z הוא סקיצה גסה, ורוב המבחנים האמיתיים צריכים מאות. המספר שחשוב הוא השיפור שאתם רוצים לזהות: בשיעור בסיס של 5%, זיהוי שיפור יחסי של 10% ב-95% ביטחון ו-80% עוצמה דורש כ-31,000 מבקרים לכל גרסה, בערך 1,550 המרות בכל אחת. לשונית גודל המדגם מחשבת את זה לפי השיעורים שלכם.
מה ההבדל בין ה-p-value הפרקוונטיסטי לבין הסיכוי הבייסיאני ש-B טובה יותר?
ה-p-value שואל "כמה מפתיע הפער הזה אם שום דבר לא השתנה?" ונותן כן או לא לפי סף. המספר הבייסיאני שואל "בהינתן מה שראיתי, כמה סביר שהשיעור האמיתי של B גבוה משל A?" ונותן הסתברות. על אותם נתונים הם בדרך כלל מסכימים על הכיוון: p של 0.05 מקביל לסיכוי של כ-97% ש-B טובה יותר במבחן דו-צדדי. הדף מציג את שניהם כי המשפט הבייסיאני הוא מה שאנשים מתכוונים אליו כשהם אומרים "ביטחון", וה-p-value הוא מה שהכלי שלהם מדפיס.
למה המחשבון מסרב לתת הכרעה כשהחלוקה סוטה?
כי חוסר התאמה ביחס המדגם (sample ratio mismatch) פירושו ששתי הקבוצות לא שויכו באקראי, והאקראיות היא כל הסיבה ש-A/B test עובד. אם תכננתם 50/50 ולחלוקה שנצפתה יש סיכוי של פחות מאחד לאלף להיווצר במזל, מנגנון כלשהו מחליט מי נוחת באיזו גרסה, והוא עשוי להיות מתואם עם ההמרה. השיפור שאתם רואים עשוי להיות המנגנון הזה, לא השינוי שלכם.
אפשר להשתמש במחשבון הזה להכנסה למבקר או לערך הזמנה ממוצע?
לא. הדף הזה בודק פרופורציה: כל מבקר או שהמיר או שלא. הכנסה למבקר היא מדד רציף ומוטה מאוד, והיא דורשת מבחן t או bootstrap על הסכומים לכל משתמש, וזה דורש את הנתונים הגולמיים ולא ארבעה סכומים. מחשבון מבחן t במחשבוני המתמטיקה של Coddy מטפל בהשוואת ממוצעים ברגע שיש לכם את הערכים לכל משתמש.
מאיפה מגיע השיפור הקטן ביותר שניתן לזהות?
מאותה נוסחה של מחשבון גודל המדגם, מורצת לאחור. בהינתן גדלי הגרסאות והשיעור של A, הוא מוצא את השיפור היחסי ש-80% מהמבחנים בגודל הזה היו תופסים ברמת הביטחון שלכם. אם השיפור שנצפה קטן ממנו, למבחן לא הייתה מספיק עוצמה לאפקט הזה, ו"לא מובהק" כמעט לא אומר דבר על השאלה אם השינוי עבד.

כלי פיתוח נוספים

איור של שפות התכנות ב-Coddy

ללמוד תכנות עם Coddy

להתחיל