كيف أعرف أن اختبار A/B الخاص بي دال إحصائيًا؟
أدخل الزوار والتحويلات لكل نسخة، واختر مستوى ثقة (95% هو المعيار)، واقرأ الحكم. يكون الاختبار دالًا عندما تكون القيمة الاحتمالية p أقل من 1 ناقص ثقتك، أي أقل من 0.05 عند 95%. هذه الصفحة تخبرك أيضًا بفترة التحسن الحقيقي وهل كان بوسع الاختبار رصد الأثر الذي تنظر إليه، وهو ما لا تستطيعه قيمة p مجردة.
ماذا تعني قيمة p تساوي 0.08 لاختباري؟
أنه لو كانت A وB تحوّلان فعلًا بالمعدل نفسه، لظهرت فجوة بهذا الحجم على الأقل نحو 8% من المرات بالصدفة. ليست احتمال أن تكون النتيجة خاطئة، وليست «ثقة 92% أن B أفضل». عند ثقة 95% تعني أن الاختبار لم يتجاوز العتبة؛ انظر إلى بطاقة أصغر تحسن قابل للرصد لترى هل كان بوسعه ذلك أصلًا.
هل ثقة 90% كافية؟
قد تكون، إذا قررت 90% قبل بدء الاختبار وقبلت معدل إيجابيات كاذبة بنسبة واحد من عشرة. أما ما ليس كافيًا أبدًا فهو أن تشتغل عند 95%، وترى 91%، وتقرر أن 90% كانت العتبة الحقيقية طوال الوقت. مستوى الثقة وعد بشأن كم مرة تقبل أن تُخدع؛ وتغييره بعد النظر ينقض الوعد.
كم تحويلًا أحتاج لكل نسخة؟
لا يوجد رقم سحري، لكن تحت نحو 25 تحويلًا لكل ذراع يكون اختبار z تخطيطًا تقريبيًا، ومعظم الاختبارات الحقيقية تحتاج إلى المئات. الرقم المهم هو التحسن الذي تريد رصده: عند معدل أساس 5%، رؤية تحسن نسبي 10% بثقة 95% وقوة 80% تحتاج إلى نحو 31,000 زائر لكل نسخة، أي نحو 1,550 تحويلًا لكل منها. تبويب حجم العينة يحسبه لمعدلاتك أنت.
ما الفرق بين القيمة الاحتمالية التكرارية والاحتمال البايزي أن B أفضل؟
القيمة الاحتمالية تسأل «ما مدى إثارة هذه الفجوة للدهشة لو لم يتغير شيء؟» وتعطي نعم أو لا عند عتبة. والرقم البايزي يسأل «بالنظر إلى ما رأيته، ما احتمال أن يكون المعدل الحقيقي لـ B أعلى من معدل A؟» ويعطي احتمالًا. على البيانات نفسها يتفقان عادة في الاتجاه: p تساوي 0.05 تقع قرب احتمال 97% أن B أفضل في اختبار بطرفين. هذه الصفحة تعرض الاثنين لأن الجملة البايزية هي ما يقصده الناس عندما يقولون «ثقة»، والقيمة الاحتمالية هي ما تطبعه أداتهم.
لماذا ترفض الحاسبة إعطاء حكم عندما يكون التقسيم منحرفًا؟
لأن عدم تطابق نسبة العينة يعني أن المجموعتين لم تُوزَّعا عشوائيًا، والعشوائية هي السبب الكامل الذي يجعل اختبار A/B يعمل. إذا خططت لـ 50/50 وكان احتمال ظهور التقسيم المشاهد بالحظ أقل من واحد في الألف، فهناك آلية ما تقرر من يقع في أي ذراع، وقد تكون مرتبطة بالتحويل. والتحسن الذي تراه قد يكون تلك الآلية، لا تغييرك.
هل يمكنني استخدام هذه الحاسبة للإيراد لكل زائر أو متوسط قيمة الطلب؟
لا. هذه الصفحة تختبر نسبة: كل زائر إما حوّل أو لم يحوّل. الإيراد لكل زائر مقياس متصل شديد الالتواء ويحتاج إلى اختبار t أو بوتستراب على مبالغ كل مستخدم، وهذا يحتاج إلى البيانات الخام لا إلى أربعة مجاميع. حاسبة اختبار t في حاسبات الرياضيات على Coddy تتولى مقارنة المتوسطات متى توفرت لديك قيم كل مستخدم.
من أين يأتي أصغر تحسن قابل للرصد؟
من الصيغة نفسها التي تستخدمها حاسبة حجم العينة، مُشغَّلة بالعكس. بالنظر إلى أحجام ذراعيك ومعدل A، تجد التحسن النسبي الذي كان 80% من الاختبارات بهذا الحجم ستلتقطه عند مستوى ثقتك. إذا كان التحسن الذي رصدته أقل منه، فاختبارك كان ضعيف القوة لذلك الأثر، و«غير دال» لا تحمل تقريبًا أي معلومة عن نجاح التغيير من عدمه.