Menu
flag Ar iconالعربيةdown icon

حاسبة اختبار A/B

اكتب عدد الزوار والتحويلات لكل نسخة. تحصل على الحكم في جملة واحدة، والقيمة الاحتمالية p مع خطوات حسابها، والفترة، والاحتمال البايزي أن B أفضل، وفحصًا يتأكد أن تقسيم الزيارات غير معطوب، وأصغر تحسن كان يمكن لهذا الاختبار أن يراه أصلًا.

بقلم Nethanel Bar, Co-founder & CEO

آخر تحديث

هل أنت مستعد لتعلّم البرمجة فعلاً؟

يعلّمك Coddy عبر كتابة كود حقيقي في متصفحك: دروس تفاعلية، وملاحظات فورية، ومساعدة بالذكاء الاصطناعي عندما تتعثر.

ما تخبرك به هذه الحاسبة ولا تخبرك به الأخريات

كل حاسبة اختبار A/B تطبع قيمة احتمالية p. ومعظمها يتوقف عند ذلك، وهكذا ينتهي المؤسسون محدقين في ثقة 87% متسائلين عما تعنيه. هذه الحاسبة تجيب عن الأسئلة التي تحدد فعلًا ما ستفعله بعد ذلك. هل الفرق أكبر مما تنتجه الصدفة؟ ما الحجم الممكن للتحسن الحقيقي، في أسوأ الأحوال وأحسنها؟ إذا خرج الاختبار «غير دال»، هل كان بوسعه أصلًا أن يجد شيئًا بحجم العينة هذا؟ وهل تقسيم الزيارات نفسه سليم، أم أنك تقارن مجموعتين لم تكونا متكافئتين قط؟

تُجري الحاسبة اختبار z القياسي للنسبتين، وهو الاختبار نفسه الذي يستخدمه محرك Optimizely الكلاسيكي والوضع التكراري في VWO وكل كتاب إحصاء مدرسي، وتعرض كل سطر من الحساب: المعدل المدمج، والخطأ المعياري، والدرجة المعيارية z، ومساحة الطرف. وبجانبه يقف الجواب البايزي، أي احتمال أن يكون المعدل الحقيقي لـ B أعلى من معدل A، لأن «هناك احتمال 91% أن B أفضل» هي الجملة التي كان معظم الناس يأملون أن تعطيهم إياها القيمة الاحتمالية، وهي رقم مختلف.

بنيناها بعد أن نظرنا إلى لوحتنا نحن. أجرت Coddy نحو عشرين تجربة مسماة، عشر منها اختبارات تسعير لكل بلد على شرائح صغيرة من الزيارات، وكانت أداتنا الداخلية تعرض شريط ثقة وتحته عبارة «واصل التشغيل» تحت 95%. ذلك توقف اختياري بوجه ودود. التبويبات الثلاثة بجانب هذا التبويب، حجم العينة، واختبار الواقع، ومحاكي الاستراق، موجودة لأن حاسبة لا تبلّغ إلا عن الدلالة هي حاسبة تساعدك على خداع نفسك بسرعة أكبر.

ما يجب أن تعرفه قبل أن تثق بالرقم

  • «غير دال» لا تعني «لا فرق». تعني أن البيانات لا تستطيع الحكم. البطاقة التي تذكر أصغر تحسن يمكن لهذا الاختبار رؤيته هي القراءة الأمينة: إذا كان التحسن الذي رصدته أقل منه، فالاختبار لم يكن ليجيب أبدًا.
  • القيمة الاحتمالية p ليست احتمال أن تكون مخطئًا. هي احتمال رؤية فجوة بهذا الحجم لو كانت النسختان متطابقتين. أما مدى ترجيح أن يكون الفائز حقيقيًا فيعتمد أيضًا على كم مرة تنجح أفكارك، وهو ما يحوّله تبويب اختبار الواقع إلى رقم.
  • التوقف في أول يوم يتحول فيه الشريط إلى الأخضر هو أغلى عادة في اختبارات A/B. الفحص اليومي والتوقف المبكر يحوّلان معدل إيجابيات كاذبة 5% إلى 20% أو أكثر. محاكي الاستراق يريك ذلك يحدث على زياراتك أنت.
  • التقسيم المعطوب يسمم كل شيء. إذا خططت لـ 50/50 وحصلت على 46/54، فهناك شيء يوجّه المستخدمين قبل وصولهم إلى الاختبار: طبقة تخزين مؤقت، أو مرشح روبوتات، أو إعادة توجيه. الحاسبة تجري هذا الفحص أولًا وترفض إعطاء حكم ما دام يفشل.
  • تحت نحو 25 تحويلًا لكل ذراع يكون التقريب الطبيعي الذي يقوم عليه اختبار z مجرد تخطيط لا قياس. الحاسبة تقول ذلك بدل أن تطبع ثلاث منازل عشرية من دقة زائفة.

كيف تستخدم حاسبة اختبار A/B

  1. أدخل الزوار والتحويلات لـ A وB

    الزوار هم الأشخاص الذين وُضعوا في تلك النسخة، لا مشاهدات الصفحة. والتحويلات هم من فعلوا الشيء الذي تقيسه: سجلوا، دفعوا، نقروا. يجب أن يُحسب الاثنان بالطريقة نفسها في الذراعين.

  2. اختر مستوى الثقة والفرضية

    95% بطرفين هو الافتراضي والخيار الأمين عندما يمكن أن تكون B أفضل أو أسوأ. الطرف الواحد فقط لحالة تجاهل B الأسوأ بالطريقة نفسها تمامًا كعدم التغيير، وهي أندر مما يظن الناس.

  3. اقرأ الحكم، ثم الفترة

    الشريط يقول ما تدعمه الأرقام. وبطاقة التحسن النسبي تعرض الفترة: الأثر الحقيقي يقع على الأرجح في أي مكان داخلها، والطرف الأدنى هو الرقم الذي تخطط به، لا التقدير النقطي.

  4. افحص التحذيرين

    إذا أُشير إلى التقسيم، فأصلح الاختبار قبل قراءة أي شيء آخر. وإذا كان أصغر تحسن قابل للرصد أكبر من التحسن الذي رصدته، فالاختبار كان ضعيف القوة: اذهب إلى تبويب حجم العينة وانظر كم زائرًا سيحتاج.

  5. انسخ النتيجة أو الرابط

    نسخ النتيجة يعطيك الملخص لرسالة أو مستند. ونسخ الرابط يضع الأرقام الأربعة في العنوان، فمن يفتحه يرى الحساب نفسه.

قراءة المخرجات

ما تعنيه كل بطاقة، في سطر واحد.

البطاقةما هيكيف تقرؤها
التحسن النسبي(معدل B ناقص معدل A) مقسومًا على معدل Aالعنوان الرئيسي. والفترة بجانبه هي المدى الذي يقع فيه التحسن الحقيقي على الأرجح.
القيمة الاحتمالية pاحتمال فجوة بهذا الحجم لو كانت A وB متطابقتينأقل من 0.05 عند ثقة 95% تعني دالًا. ليست احتمال أن تكون النتيجة خاطئة.
الثقة1 ناقص p، كنسبة مئويةالرقم الذي تطبعه معظم الأدوات. 87% ليست قريبة من 95%؛ هي عملة سقطت على الوجه الخطأ من الخط.
احتمال أن B أفضلالاحتمال البايزي أن يكون المعدل الحقيقي لـ B أعلى من معدل Aالجملة التي يريدها الناس. 91% تعني أن B أفضل على الأرجح، لا أنها أفضل بنسبة 91%.
أصغر تحسن يمكن لهذا الاختبار رؤيتهالتحسن النسبي القابل للرصد بقوة 80% بأحجام الذراعين هذهإذا كان التحسن الذي رصدته أقل منه، فـ «غير دال» تعني «لم يستطع الحكم».
تقسيم الزياراتالحصة المشاهدة من الزوار في كل ذراع مقابل الخطةيُشار إليه عندما ينحرف التقسيم أكثر مما تسمح به الصدفة. أصلح الاختبار قبل قراءة النتائج.

ثلاثة اختبارات، ثلاثة دروس مختلفة

الحالة الكلاسيكية: على وشك

A: 10,000 زائر، 500 تحويل (5.00%). B: 10,000 زائر، 560 تحويلًا (5.60%). التحسن النسبي +12%، p = 0.058.

غير دال عند 95%، والفترة تمتد من نحو سالب 0.4% إلى زائد 24%. القراءة الأمينة هي «على الأرجح تحسن صغير، وقد يكون لا شيء». أصغر تحسن يمكن لهذا الاختبار رصده نحو 17%، فأثر بحجم 12% كان سيقع في المنطقة الرمادية دائمًا. يحتاج إلى نحو ضعف الزيارات، لا إلى أسبوع آخر من الأمل.

التقسيم المعطوب

A: 5,000 زائر، 100 تحويل. B: 4,300 زائر، 120 تحويلًا. التقسيم المخطط 50/50.

تبدو B فائزة واضحة بـ +40%. الحاسبة ترفض أن تقول ذلك: تقسيم 5,000 مقابل 4,300 احتمال حدوثه بالصدفة عند 50/50 أقل من واحد في المليون. هناك شيء يزيل المستخدمين من B قبل أن يُحسبوا، وكثيرًا ما يكون إعادة توجيه تفشل في متصفح واحد، أو مرشح روبوتات يعامل النسخة بشكل مختلف. أيًا كان، المجموعتان غير قابلتين للمقارنة والتحسن بلا معنى.

الموقع الصغير

A: 400 زائر، 12 تحويلًا (3.0%). B: 400 زائر، 19 تحويلًا (4.75%). التحسن النسبي +58%، p = 0.20.

تحسن 58% يبدو هائلًا، والقيمة الاحتمالية نحو 0.19. مع 12 و19 تحويلًا تنبه الحاسبة إلى قلة البيانات: الأرقام تتأرجح بهذا الحجم لدرجة أن تسجيلًا إضافيًا واحدًا يحرك المعدل ربع نقطة. عند هذه الزيارات، أصغر تحسن يمكن للاختبار تأكيده في شهر يتجاوز 100%. هذا ليس سببًا لتشغيله مدة أطول؛ بل سبب لقراءة تبويب اختبار الواقع.

أخطاء بُنيت هذه الحاسبة لالتقاطها

  • قراءة ثقة 90% على أنها «لا بأس على الأرجح». عند 95% الخط هو 95%. والرقم الذي تحته يعني أن البيانات لم تتجاوز العتبة التي وضعتها، وتحريك العتبة بعد النظر هو الخطأ، لا الرقم.
  • تسمية اختبار غير دال تعادلًا. التعادل فترة ضيقة جدًا حول الصفر. أما الاختبار غير الدال ذو الفترة العريضة فسؤال بلا جواب، وتبويب حجم العينة يقول كم سيكلف الجواب.
  • إعلان فائز في أول صباح يتحول فيه الشريط إلى الأخضر. محاكي الاستراق يجري ألفي اختبار لم يتغير فيها شيء ويبين كم منها كان المسترق اليومي سيطلقه.
  • اختبار خمس نسخ والإبلاغ عن الأفضل عند 95%. خمس مقارنات بـ 5% لكل منها تعني احتمال 23% لفائز زائف. تبويب حجم العينة يقسم α لك عندما تضيف نسخًا.
  • مقارنة مشاهدات الصفحة بالمستخدمين الفريدين، أو عدّ التحويلات على نافذة زمنية مختلفة عن الزوار. يفترض اختبار z أن كل زائر محاولة مستقلة واحدة؛ وأي شيء غير ذلك يضخم الثقة.
  • تجاهل التقسيم. تقسيم 48/52 على 100,000 زائر ليس صدفة؛ هو خلل، وكل نتيجة بعده غير جديرة بالثقة.

أسئلة شائعة عن حاسبة اختبار A/B

كيف أعرف أن اختبار A/B الخاص بي دال إحصائيًا؟
أدخل الزوار والتحويلات لكل نسخة، واختر مستوى ثقة (95% هو المعيار)، واقرأ الحكم. يكون الاختبار دالًا عندما تكون القيمة الاحتمالية p أقل من 1 ناقص ثقتك، أي أقل من 0.05 عند 95%. هذه الصفحة تخبرك أيضًا بفترة التحسن الحقيقي وهل كان بوسع الاختبار رصد الأثر الذي تنظر إليه، وهو ما لا تستطيعه قيمة p مجردة.
ماذا تعني قيمة p تساوي 0.08 لاختباري؟
أنه لو كانت A وB تحوّلان فعلًا بالمعدل نفسه، لظهرت فجوة بهذا الحجم على الأقل نحو 8% من المرات بالصدفة. ليست احتمال أن تكون النتيجة خاطئة، وليست «ثقة 92% أن B أفضل». عند ثقة 95% تعني أن الاختبار لم يتجاوز العتبة؛ انظر إلى بطاقة أصغر تحسن قابل للرصد لترى هل كان بوسعه ذلك أصلًا.
هل ثقة 90% كافية؟
قد تكون، إذا قررت 90% قبل بدء الاختبار وقبلت معدل إيجابيات كاذبة بنسبة واحد من عشرة. أما ما ليس كافيًا أبدًا فهو أن تشتغل عند 95%، وترى 91%، وتقرر أن 90% كانت العتبة الحقيقية طوال الوقت. مستوى الثقة وعد بشأن كم مرة تقبل أن تُخدع؛ وتغييره بعد النظر ينقض الوعد.
كم تحويلًا أحتاج لكل نسخة؟
لا يوجد رقم سحري، لكن تحت نحو 25 تحويلًا لكل ذراع يكون اختبار z تخطيطًا تقريبيًا، ومعظم الاختبارات الحقيقية تحتاج إلى المئات. الرقم المهم هو التحسن الذي تريد رصده: عند معدل أساس 5%، رؤية تحسن نسبي 10% بثقة 95% وقوة 80% تحتاج إلى نحو 31,000 زائر لكل نسخة، أي نحو 1,550 تحويلًا لكل منها. تبويب حجم العينة يحسبه لمعدلاتك أنت.
ما الفرق بين القيمة الاحتمالية التكرارية والاحتمال البايزي أن B أفضل؟
القيمة الاحتمالية تسأل «ما مدى إثارة هذه الفجوة للدهشة لو لم يتغير شيء؟» وتعطي نعم أو لا عند عتبة. والرقم البايزي يسأل «بالنظر إلى ما رأيته، ما احتمال أن يكون المعدل الحقيقي لـ B أعلى من معدل A؟» ويعطي احتمالًا. على البيانات نفسها يتفقان عادة في الاتجاه: p تساوي 0.05 تقع قرب احتمال 97% أن B أفضل في اختبار بطرفين. هذه الصفحة تعرض الاثنين لأن الجملة البايزية هي ما يقصده الناس عندما يقولون «ثقة»، والقيمة الاحتمالية هي ما تطبعه أداتهم.
لماذا ترفض الحاسبة إعطاء حكم عندما يكون التقسيم منحرفًا؟
لأن عدم تطابق نسبة العينة يعني أن المجموعتين لم تُوزَّعا عشوائيًا، والعشوائية هي السبب الكامل الذي يجعل اختبار A/B يعمل. إذا خططت لـ 50/50 وكان احتمال ظهور التقسيم المشاهد بالحظ أقل من واحد في الألف، فهناك آلية ما تقرر من يقع في أي ذراع، وقد تكون مرتبطة بالتحويل. والتحسن الذي تراه قد يكون تلك الآلية، لا تغييرك.
هل يمكنني استخدام هذه الحاسبة للإيراد لكل زائر أو متوسط قيمة الطلب؟
لا. هذه الصفحة تختبر نسبة: كل زائر إما حوّل أو لم يحوّل. الإيراد لكل زائر مقياس متصل شديد الالتواء ويحتاج إلى اختبار t أو بوتستراب على مبالغ كل مستخدم، وهذا يحتاج إلى البيانات الخام لا إلى أربعة مجاميع. حاسبة اختبار t في حاسبات الرياضيات على Coddy تتولى مقارنة المتوسطات متى توفرت لديك قيم كل مستخدم.
من أين يأتي أصغر تحسن قابل للرصد؟
من الصيغة نفسها التي تستخدمها حاسبة حجم العينة، مُشغَّلة بالعكس. بالنظر إلى أحجام ذراعيك ومعدل A، تجد التحسن النسبي الذي كان 80% من الاختبارات بهذا الحجم ستلتقطه عند مستوى ثقتك. إذا كان التحسن الذي رصدته أقل منه، فاختبارك كان ضعيف القوة لذلك الأثر، و«غير دال» لا تحمل تقريبًا أي معلومة عن نجاح التغيير من عدمه.

أدوات مطورين أخرى

رسم توضيحي للغات البرمجة في Coddy

تعلّم البرمجة مع Coddy

ابدأ الآن