Menu
flag Ar iconالعربيةdown icon

محاكي الاستراق في اختبار A/B

ألفا اختبار تكون فيها A وB الصفحة نفسها، تعمل على زياراتك. شاهد كم منها كان مسترق يومي سيسميه فائزًا، وكم من الاختبارات نفسها يخدع من ينتظر تاريخ الانتهاء.

بقلم Nethanel Bar, Co-founder & CEO

آخر تحديث

هل أنت مستعد لتعلّم البرمجة فعلاً؟

يعلّمك Coddy عبر كتابة كود حقيقي في متصفحك: دروس تفاعلية، وملاحظات فورية، ومساعدة بالذكاء الاصطناعي عندما تتعثر.

أغلى عادة في اختبارات A/B، محاكاة على أرقامك

إليك العادة. تبدأ اختبارًا، وكل صباح تفتح اللوحة. الشريط يزحف صعودًا، وينخفض، ويزحف صعودًا مجددًا، وذات ثلاثاء يتجاوز 95%. تعلنه، وتطلق الفائز، وتمضي. المشكلة أن القيمة الاحتمالية تتجول. في اختبار تكون فيه النسختان متطابقتين، تعبر القيمة الاحتمالية 0.05 في بعض الأيام بالصدفة؛ لكنها تعود لاحقًا. والتوقف عند أول عبور يعني أنك تلتقطها في طريقها، ومستوى الثقة الذي ظننت أنك تملكه قد ذهب.

حجم الأثر يفاجئ الناس. عند ثقة 95%، اختبار يُقرأ مرة واحدة في النهاية يخدعك نحو مرة في كل عشرين، وهذه هي الصفقة التي وقعتها. اقرأ الاختبار نفسه كل يوم لأربعة أسابيع وتوقف عند أول يوم أخضر، وسيُظهر المحاكي عادة فائزًا زائفًا في ربع الاختبارات أو أكثر بينما لم يتغير شيء. المقال الأصلي لإيفان ميلر وضعها فوق 20% للمسترق اليومي؛ وأعادت Optimizely بناء محرك الإحصاء لديها في 2015 لأن معدل الإيجابيات الكاذبة لدى عملائها تجاوز ذلك. والفحص أسبوعيًا بدل يوميًا يُنصّف الضرر تقريبًا لكنه لا يزيله.

المحاكاة هنا صادقة بشأن ما هي: كل اختبار يسحب التحويلات بالمعدل الحقيقي للذراعين، ويجري اختبار z العادي للنسبتين عند كل نظرة على كل ما جُمع حتى الآن، ويسجل أين كان المسترق سيتوقف. كل مسار في الرسم اختبار واحد؛ وكل نقطة صباح كان أحدهم سيعلن فيه نتيجة. اضبط التحسن الحقيقي على +10% لترى النصف الآخر من القصة، حيث يلتقط المسترق أثرًا حقيقيًا مبكرًا لكن بتحسن مبالغ فيه، وكان «سيفوز» بالحماسة نفسها لو كان الأثر صفرًا.

ما تبينه المحاكاة

  • القيمة الاحتمالية p سير عشوائي. في ظل فرضية العدم تكون موزعة بانتظام عند أي نظرة واحدة، ما يعني أن في أي صباح واحد احتمال 5% أن تقع تحت 0.05. وعلى مدى ثمانية وعشرين صباحًا تتراكم تلك الاحتمالات.
  • معدل الإيجابيات الكاذبة يعتمد على عدد مرات النظر، لا على مدة الاختبار. اختبار أربعة أسابيع يُقرأ أسبوعيًا يُخدع أقل من اختبار أسبوعين يُقرأ يوميًا.
  • التوقف المبكر يبالغ في التحسن. عندما يتوقف المسترق في يوم حظ، يكون التحسن المرصود ذلك اليوم كبيرًا على نحو غير معتاد بحكم التعريف. والفائزون المطلقون الذين «تلاشوا» بعد الإطلاق كثيرًا ما كانوا هذا.
  • العلاج إما الانضباط أو اختبار مختلف. الانضباط: ثبّت حجم العينة وتاريخ الانتهاء مسبقًا واقرأ مرة واحدة. الاختبار المختلف: الطرق التتابعية، مثل القيم الاحتمالية الصالحة دائمًا التي تستخدمها Optimizely وStatsig وEppo، مبنية لتُقرأ باستمرار بثمن في حجم العينة.
  • اللوحات البايزية ليست محصنة. احتمال «أن يكون الأفضل» يُفحص يوميًا ويُتصرف بناءً عليه عند عتبة له المشكلة نفسها في زي مختلف.

كيف تستخدم المحاكي

  1. أدخل معدل تحويلك وزوارك اليوميين

    المحاكاة تسحب التحويلات بمعدلك الحقيقي، فيطابق تجوال القيمة الاحتمالية الضجيج الذي ستراه فعلًا.

  2. حدد المدة المخططة وكم مرة تنظر

    يوميًا، أو كل ثلاثة أيام، أو أسبوعيًا. والفجوة بين معدل المسترق والمعدل الأمين هي ثمن تلك العادة.

  3. أبقِ التحسن الحقيقي على لا شيء

    هذا يجعل كل اختبار اختبار A/A: أي فائز إنذار كاذب بحكم البناء. انتقل إلى +10% أو +30% بعدها لترى المسترق على أثر حقيقي.

  4. اقرأ الرقمين الكبيرين

    معدل المسترق هو كم مرة أعلن الفاحص اليومي فائزًا. ومعدل تاريخ الانتهاء ينبغي أن يكون قريبًا من α التي اخترتها؛ فإن كان كذلك، فالاختبار الأمين يفعل ما وعد به.

  5. شغّله مجددًا

    كل جولة تسحب اختبارات عشوائية جديدة. المعدلات تتحرك قليلًا؛ والفجوة لا تتحرك.

معدلات الإيجابيات الكاذبة النموذجية في اختبارات A/A

عند ثقة 95%، قراءة أمينة واحدة في النهاية تُخدع نحو 5% من المرات. أرقام تقريبية من المحاكاة والأدبيات لمسترق يتوقف عند أول نظرة دالة.

كم مرة تنظرالنظرات في 4 أسابيعالفائزون الزائفون
مرة واحدة، في النهاية1نحو 5%
أسبوعيًا4نحو 10 إلى 13%
كل 3 أيام9 إلى 10نحو 15 إلى 20%
يوميًا28نحو 25 إلى 30%
يوميًا لمدة 12 أسبوعًا84أكثر من 35%

ثلاث عادات، محاكاة

الفاحص اليومي

تحويل 5%، 1,000 زائر في اليوم، 28 يومًا، فحص كل صباح. في جولتنا: أعلن المسترق فائزًا في نحو 28% من 2,000 اختبار A/A؛ وبالقراءة مرة واحدة في النهاية، 4.5%.

ستة أضعاف معدل الإنذارات الكاذبة، لاختبار بدا حريصًا لأن أحدهم كان يراقبه كل يوم. نصف هؤلاء «الفائزين» توّج B ونصفهم توّج A، لأنه لم يكن هناك شيء ليُوجد.

الفاحص الأسبوعي

الزيارات نفسها، والمدة نفسها، فحص مرة في الأسبوع. في جولتنا: نحو 12% للمسترق مقابل 5% في النهاية.

النظر أربع مرات بدل ثمانٍ وعشرين يساعد كثيرًا ومع ذلك يزيد المعدل الموعود على الضعف. لا يوجد عدد من النظرات يحفظ الوعد إلا واحدة.

تحسن حقيقي +10%

اضبط التحسن الحقيقي لـ B على +10% على الزيارات نفسها. الاختبار الأمين عند 28 يومًا قوته محدودة لتحسن بهذا الصغر عند هذه الزيارات؛ والمسترق يتوقف مبكرًا أكثر، في أيام الحظ.

هذه هي الحالة المغرية: يبدو المسترق كأنه يجد الأشياء أسرع. لكن الأيام التي يتوقف فيها هي الأيام التي بدا فيها التحسن أكبر، فالتقدير المطلق مضخم، والعادة نفسها كانت ستجد «فائزًا» مع ضبط التحسن على صفر.

أخطاء الاستراق

  • التوقف عند أول صباح دال. هذه هي الصفحة كلها. مستوى الثقة لا يعني ما يقوله إلا إذا قرأت النتيجة مرة واحدة.
  • تمديد اختبار «على وشك». قرار التشغيل مدة أطول لأن النتيجة تكاد تكون دالة استراق بالعكس، ويضخم معدل الإيجابيات الكاذبة بالطريقة نفسها.
  • الفحص اليومي «للتأكد فقط أن لا شيء معطوب». مراقبة الأخطاء مقبولة؛ ومراقبة القيمة الاحتمالية ليست كذلك. انظر إلى تقسيم الزيارات ومعدلات الأخطاء، لا التحسن، حتى تاريخ الانتهاء.
  • الاعتقاد بأن لوحة بايزية تجعل الاستراق آمنًا. التصرف بناءً على عتبة احتمال تفحصها يوميًا له التضخم نفسه.
  • الإبلاغ عن التحسن من اليوم الذي توقفت فيه. إذا كان لا بد من التوقف مبكرًا، فأبلغ عن الفترة، وتوقع أن يكون التحسن الحقيقي أصغر من التقدير النقطي.

أسئلة شائعة عن الاستراق

ما مشكلة الاستراق في اختبارات A/B؟
قراءة اختبار ذي أفق ثابت بشكل متكرر والتوقف في أول مرة يبدو فيها دالًا. ولأن القيمة الاحتمالية تتذبذب بينما تصل البيانات، فكل نظرة فرصة أخرى لعبور العتبة بالحظ. اختبار يُقرأ يوميًا لشهر عند ثقة 95% ينتج فائزًا زائفًا نحو ربع المرات بينما لم يتغير شيء، بدل الـ 5% التي يعد بها مستوى الثقة.
هل من الخطأ أن أنظر إلى اختباري قبل انتهائه؟
النظر مقبول؛ التصرف هو المشكلة. تحقق من أن الزيارات تنقسم بالتساوي، وأن النسختين تُحمَّلان، وأن التحويلات تُسجَّل. لا تقرأ التحسن أو الثقة، ولا تدع ما رأيته يغير تاريخ الانتهاء في أي من الاتجاهين.
كيف أجري اختبار A/B إذا أردت الفحص باستمرار؟
استخدم طريقة تتابعية. القيم الاحتمالية الصالحة دائمًا والتصاميم التتابعية الجماعية وما شابهها مبنية لتُقرأ في أي وقت؛ وتدفع ثمن ذلك بحجم عينة أكبر للقوة نفسها. معظم المنصات الحديثة تقدم واحدة منها. هذا المحاكي ينمذج الاختبار الكلاسيكي ذا الأفق الثابت لأنه ما تكونه معظم حسابات الجداول واللوحات، بما فيها التبويبات الأخرى في هذا الموقع.
هل يهم الاستراق إذا فحصت أسبوعيًا؟
أقل، لكن نعم. أربع نظرات على مدى أربعة أسابيع عند 95% تضاعف معدل الإيجابيات الكاذبة عادة. وعدد النظرات الوحيد الذي يحفظ المعدل الموعود هو واحدة.
لماذا يستخدم المحاكي اختبارات A/A؟
لأنه مع ذراعين متطابقتين، كل فائز إنذار كاذب بحكم البناء، فالمعدل الذي يبلّغ عنه المحاكي هو بالضبط معدل الإيجابيات الكاذبة للعادة المحاكاة. وتفعيل تحسن حقيقي يبين الجانب الآخر، حيث يتوقف المسترق مبكرًا في أيام الحظ ويبلّغ عن أثر مضخم.
هل يحل الاختبار البايزي مشكلة الاستراق؟
ليس بمفرده. احتمال بايزي يُقرأ باستمرار ويُتصرف بناءً عليه عند عتبة ثابتة يضخم القرارات الخاطئة بالطريقة نفسها، كما بيّن جورجي جورجييف وآخرون. الطرق البايزية بقاعدة قرار سليمة وتوزيع سابق يمكن أن تتصرف جيدًا تحت المراقبة المستمرة، لكن «بايزي» وحدها ليست الحل.

أدوات مطورين أخرى

رسم توضيحي للغات البرمجة في Coddy

تعلّم البرمجة مع Coddy

ابدأ الآن