Menu
flag Ar iconالعربيةdown icon

حاسبة حجم العينة لاختبار A/B

كم زائرًا تحتاج كل نسخة قبل أن يستطيع الاختبار قول أي شيء، وكم يومًا يعني ذلك بزياراتك. حدد أصغر تحسن يستحق الرصد، والثقة، والقوة، واقرأ العدد مع الصيغة تحته.

بقلم Nethanel Bar, Co-founder & CEO

آخر تحديث

هل أنت مستعد لتعلّم البرمجة فعلاً؟

يعلّمك Coddy عبر كتابة كود حقيقي في متصفحك: دروس تفاعلية، وملاحظات فورية، ومساعدة بالذكاء الاصطناعي عندما تتعثر.

قرر حجم العينة قبل أن تنظر إلى نتيجة واحدة

حجم العينة وعد تقطعه لنفسك قبل بدء الاختبار: «سأنظر إلى النتيجة عندما يراها هذا العدد من الناس، وليس قبل ذلك.» بدونه، ينزلق كل اختبار A/B إلى القصة نفسها. الأسبوع الأول يبدو واعدًا، وفي الأسبوع الثاني ينكمش التحسن، ويسأل أحدهم هل صار دالًا بعد، وينتهي الاختبار يوم يتحول الشريط إلى الأخضر. هذه الصفحة تعطيك الرقم لتكتبه في الخطة، فيصبح تاريخ الانتهاء حقيقة لا مزاجًا.

الحساب هو حجم العينة القياسي للنسبتين، وهو ما يقف خلف حاسبة إيفان ميلر وحاسبة Optimizely، ويعتمد على أربعة أشياء: معدل الأساس، والتحسن الذي تريد أن تكون قادرًا على رصده، ومستوى الثقة، والقوة. القوة هي ما يتخطاه الناس. عند قوة 80%، يُلتقط تحسن حقيقي بالحجم الذي سميته ثماني مرات من كل عشر؛ واختبار بنصف العينة قوته أقل بكثير من النصف، ولهذا الاختبار ضعيف القوة ليس «جوابًا أخشن» بل عادة لا جواب على الإطلاق.

المنحنى تحت النتيجة هو الجزء الذي يستحق التذكر. الزوار اللازمون ينمون مع مربع واحد على التحسن: نصّف التحسن الذي تريد رؤيته وستحتاج إلى نحو أربعة أضعاف الزيارات. موقع يستطيع تأكيد تحسن 30% في أسبوعين يحتاج إلى نحو تسعة أضعاف المدة لتأكيد تحسن 10%. وإذا خرج عدد الأيام بالأشهر، فهذه الحاسبة تقول لك اختبر شيئًا أكبر، أو اصعد في القمع إلى مقياس يصل إليه ناس أكثر، قبل أن تقول لك انتظر.

على ماذا يعتمد حجم العينة

  • أصغر أثر قابل للرصد قرار لا قياس. هو أصغر تحسن ستطلق التغيير فعلًا من أجله. وضبطه منخفضًا لجعل الاختبار «أكثر حساسية» يجعله أطول، لا أفضل.
  • التحسن النسبي والمطلق كائنان مختلفان. تحسن نسبي 10% على معدل أساس 5% هو نصف نقطة مئوية. هذه الصفحة تعمل بالنسبي لأن النتائج تُبلَّغ هكذا، وتعرض المعدل المستهدف بجانبه لترى الاثنين.
  • النسخ الإضافية تكلف أكثر من حصتها. اختبار A مقابل B وC وD ثلاث مقارنات، ويجب تقسيم الثقة عليها. الحاسبة تطبق تقسيم بونفيروني وتعرض α التي تحصل عليها كل مقارنة فعلًا.
  • الأيام سقف لا أرضية. حتى عندما تقول الأرقام أربعة أيام، شغّل أسبوعًا كاملًا على الأقل، والأفضل أسبوعين، لأن زوار أيام الأسبوع وعطلة نهايته يحوّلون بشكل مختلف واختبار الثلاثاء فقط يقيس أيام الثلاثاء.
  • قوة 80% تعني أن فائزًا حقيقيًا واحدًا من كل خمسة يفوت. إذا كان تفويت فائز مكلفًا لك، فاستخدم 90% واقبل العينة الأكبر.

كيف تحدد حجم اختبار A/B

  1. أدخل معدل التحويل الحالي

    استخدم معدل الصفحة أو الخطوة التي سيغيرها الاختبار، مقيسًا على النوع نفسه من الزوار الذين سيراهم الاختبار. لا تستخدم متوسطًا على مستوى الموقع عندما تختبر خطوة واحدة في القمع.

  2. اختر أصغر تحسن يستحق الرصد

    اسأل ما التحسن الذي سيجعلك تطلق التغيير. ذلك هو أصغر أثر قابل للرصد لديك. 10% نسبي خيار شائع لصفحة ناضجة؛ وإعادة تصميم قد تبرر 20% أو أكثر.

  3. حدد الثقة والقوة

    ثقة 95% وقوة 80% هما العرف. ارفع الثقة عندما يكون التراجع عن فائز زائف مكلفًا؛ وارفع القوة عندما يكون ترك فائز فائت على الطاولة مكلفًا.

  4. أضف زوارك اليوميين

    كل النسخ معًا، مع عدّ الزوار الذين سيصلون إلى الاختبار فقط. تتحول النتيجة إلى أيام وأسابيع كاملة.

  5. اكتب تاريخ الانتهاء

    الحاسبة تعطيك حجم العينة لكل نسخة. ضعه في خطة الاختبار مع التاريخ الذي يعنيه، ولا تقرأ النتائج قبله. تبويب محاكي الاستراق يبين السبب.

حجم العينة في لمحة

الزوار لكل نسخة عند ثقة 95% وقوة 80%، بطرفين. اضرب في اثنين لاختبار بذراعين.

معدل الأساستحسن +5%تحسن +10%تحسن +20%تحسن +50%
1%نحو 637,000نحو 163,000نحو 42,700نحو 7,800
3%نحو 208,000نحو 53,200نحو 13,900نحو 2,500
5%نحو 122,000نحو 31,200نحو 8,200نحو 1,500
10%نحو 57,800نحو 14,800نحو 3,800نحو 690
20%نحو 25,600نحو 6,500نحو 1,700نحو 290

أمثلة محلولة

صفحة تسجيل عند 5%، تبحث عن +10%

معدل الأساس 5%، أصغر أثر قابل للرصد 10% (الهدف 5.5%)، ثقة 95%، قوة 80%، طرفان. النتيجة: نحو 31,000 زائر لكل نسخة، 62,000 في المجموع.

عند 1,000 زائر في اليوم يعني ذلك 62 يومًا، أي تسعة أسابيع كاملة. فرق كثيرة ستعدّ ذلك طويلًا جدًا وإما تختبر تغييرًا أجرأ أو تقبل أن هذه الصفحة تحتاج إلى تحسن 20% أو أكثر لتكون قابلة للاختبار في أسبوعين.

خطوة دفع عند 3%، تبحث عن +20%

معدل الأساس 3%، أصغر أثر قابل للرصد 20% (الهدف 3.6%). النتيجة: نحو 13,900 زائر لكل نسخة.

معدلات الأساس الأدنى تحتاج إلى زوار أكثر للتحسن النسبي نفسه، لأن التحويلات التي تُعد أقل. تحسن نسبي 20% هنا هو 0.6 نقطة مئوية فقط، وعلى الاختبار أن يميز 3.0% من 3.6%.

ثلاث نسخ مقابل ضابطة

معدل الأساس 5%، التحسن 10%، أربع نسخ بما فيها الضابطة. تصبح α لكل مقارنة 0.05 / 3، وتنمو عينة كل نسخة بنحو الثلث؛ والمجموع أربعة أضعاف رقم النسخة الواحدة.

إضافة النسخ أسرع طريقة لتحويل اختبار أسبوعين إلى اختبار شهرين. اختبر فكرة واحدة قوية مقابل الضابطة؛ وشغّل الفكرة التالية بعدها.

أخطاء حجم العينة

  • تحديد حجم الاختبار بعد رؤية النتائج المبكرة. التحسن الذي صادف أن رصدته في اليوم الثالث ليس أصغر أثر قابل للرصد؛ هو ضجيج له رأي.
  • استخدام تحسن مطلق حيث قُصد النسبي. «تحسن 10%» على معدل أساس 2% إما 2.2% أو 12%، وأحجام العينة تختلف بمئات الأضعاف.
  • التوقف عند حجم العينة عندما تكون النتيجة غير دالة وتسميتها خسارة. بلوغ حجم العينة يعني أن الاختبار يستطيع رصد الأثر الذي سميته. ولا يقول شيئًا عن الآثار الأصغر.
  • عدّ مشاهدات الصفحة كزوار. الصيغة تفترض أن كل وحدة زائر مستقل واحد بنتيجة واحدة؛ والمشاهدات المتكررة تضخم العدد والثقة.
  • الانتهاء في أسبوع جزئي. إذا بلغت حجم العينة يوم الخميس، فشغّل حتى الأحد التالي؛ فمزيج أيام الأسبوع يغير معدلات التحويل أكثر مما تفعله معظم التغييرات المختبرة.

أسئلة شائعة عن حجم العينة

كم مدة تشغيل اختبار A/B؟
حتى تبلغ كل نسخة حجم العينة للتحسن الذي تريد رصده، ولأسبوع كامل على الأقل، والأفضل أسبوعين. أدخل زوارك اليوميين في الأعلى وستحوّل الحاسبة حجم العينة إلى أيام وأسابيع كاملة. التشغيل أطول من اللازم هدر صغير؛ أما التوقف المبكر لأن النتيجة تبدو جيدة فهو الطريقة التي يُعلن بها معظم الفائزين الزائفين.
ما أصغر أثر قابل للرصد؟
أصغر تحسن صُمم الاختبار لالتقاطه بشكل موثوق، ويُختار قبل الاختبار. يُعبَّر عنه عادة كتغير نسبي، فـ MDE بنسبة 10% على معدل أساس 4% يعني أن الاختبار يستطيع تمييز 4.0% من 4.4%. والقيم الأصغر تحتاج إلى زوار أكثر بكثير: تنصيف MDE يضاعف العينة نحو أربع مرات.
ماذا تعني قوة 80%؟
أنه إذا كان التحسن الحقيقي بالحجم الذي سميته تمامًا، فسيخرج اختبار بهذا الحجم دالًا 80% من المرات. وفي الـ 20% الأخرى يفوته فائز حقيقي. القوة صورة معكوسة للثقة: الثقة تحد من الإنذارات الكاذبة، والقوة تحد من الفائزين الفائتين.
لماذا يحتاج معدل التحويل الأدنى إلى زوار أكثر؟
لأن الاختبار يعدّ التحويلات لا الزوار. عند معدل 1%، يعطيك 10,000 زائر 100 حدث للمقارنة؛ وعند 10%، يعطونك 1,000. والتحسن النسبي نفسه أسهل رؤية بكثير في الحالة الثانية. ولهذا يكون الاختبار على مقياس أعلى في القمع، يصل إليه زوار أكثر، كثيرًا الطريقة الوحيدة التي يستطيع بها موقع صغير الاختبار أصلًا.
هل يمكنني تشغيل أكثر من نسخة؟
نعم، والحاسبة تحدد حجمه بشكل صحيح، لكن كل نسخة إضافية مقارنة أخرى مع الضابطة ويجب تقاسم الثقة بينها. أربع نسخ عند 95% بلا تصحيح تعني احتمال 14% لفائز زائف واحد على الأقل. الحاسبة تقسم α على المقارنات، ولهذا ينمو رقم كل نسخة.
هل يعمل هذا للإيراد أو متوسط قيمة الطلب؟
لا، هذه الصفحة تحدد حجم اختبار على معدل تحويل. المقاييس المتصلة مثل الإيراد لكل زائر تحتاج إلى تباين المقياس، وهو عادة أكبر بكثير من تباين النسبة، وأحجام العينة أكبر تبعًا لذلك. تحتاج إلى تباينك التاريخي وحساب قائم على اختبار t لتلك الحالات.

أدوات مطورين أخرى

رسم توضيحي للغات البرمجة في Coddy

تعلّم البرمجة مع Coddy

ابدأ الآن