السؤال الذي تطرحه قبل الاختبار الأول، لا بعد العاشر. أدخل زوارك الشهريين، ومعدل تحويلك، والتحسن الذي ستتصرف بناءً عليه فعلًا، واحصل على جواب مباشر: انطلق، أو بجهد، أو توقف وافعل شيئًا آخر.
معظم المواقع الصغيرة لا تستطيع إجراء اختبار A/B، ولا أحد يخبرها
كل دليل لاختبارات A/B كتبته شركة لديها ملايين الزوار. فريق التجريب في Microsoft، وGoogle، وBooking.com، وAirbnb تجري آلاف الاختبارات سنويًا، ونصيحتها صحيحة لها: اختبر كل شيء، ثق بالبيانات، أطلق ما يفوز. شركة ناشئة لديها 8,000 زائر في الشهر تقرأ النصيحة نفسها، وتبني اللوحة نفسها، ثم لا تفهم لماذا ينتهي كل اختبار عند ثقة 87% بتحسن ينكمش كل أسبوع. هي لا تفعل ذلك بشكل خاطئ. هي تفعل شيئًا لا يعمل بذلك الحجم.
هذه الصفحة تجري الحساب الذي تتخطاه الأدلة. عند 8,000 زائر في الشهر يحوّلون بمعدل 3%، تأكيد تحسن 10% يحتاج إلى نحو 106,000 زائر: ثلاثة عشر شهرًا من كل زائر لديك، مع تجميد الصفحة طوال الوقت. وفي أربعة أسابيع، أصغر تحسن يمكنك تأكيده نحو 40%. هذه ليست مشكلات ضبط. روني كوهافي، الذي أدار التجريب في Microsoft وAirbnb، يضع الحد الأدنى العملي لرصد تحسنات من خانة واحدة عند بضع مئات الآلاف من المستخدمين؛ وتحت ذلك يقترح أن اختبار A/B قد يكون سابقًا لأوانه وأن بحث المستخدمين إنفاق أفضل.
نكتب هذا من التجربة. لوحة Coddy نفسها أجرت نحو عشرين تجربة مسماة، عشر منها اختبارات تسعير على بلدان مفردة، كل منها على شريحة صغيرة من الزيارات، وكانت تعرض «واصل التشغيل» كلما كانت الثقة تحت 95%. وعدة منها عُدّت ناجحة وأُطلقت. وبالنظر إلى الوراء بهذه الحاسبة، بعض تلك الاختبارات لم يكن بوسعها رصد التحسنات التي نُسبت إليها. النسخة الأمينة من تلك اللوحة هي هذه الصفحة: ما الذي تستطيع هذه الزيارات الإجابة عنه، وكم سيستغرق، وكم مرة سيكون الفائز إنذارًا كاذبًا؟
ما الذي يحدد هل يمكنك الاختبار
التحويلات في الشهر، لا الزوار، هي الرقم الذي يقيدك. صفحة بـ 8,000 زائر عند 3% لديها 240 تحويلًا في الشهر لتقسيمها بين ذراعين. واختبار z يحتاج إلى المئات لكل ذراع قبل أن يقول أي شيء.
التحسن الذي ستتصرف بناءً عليه يحدد الفاتورة. كن صادقًا بشأنه: إذا كنت ستطلق تغييرًا مقابل تحسن 3%، فأنت تحتاج إلى اختبار يستطيع رؤية 3%، ولا يكاد موقع صغير يستطيع ذلك.
الوقت تكلفة لا علاج. الاختبار الذي يستغرق ربع سنة يجمّد الصفحة ربع سنة، ويمتد عبر مواسم وحملات، وينتهي في عمل مختلف عن الذي بدأ فيه.
كم مرة تنجح أفكارك يغير معنى الفائز. إذا كانت فكرة واحدة من كل عشر تحرك المقياس فعلًا، فعند ثقة 95% وقوة 80% يكون أكثر من ثلث فائزيك «الدالين» إنذارات كاذبة. معدل الأساس ليس تفصيلًا تقنيًا؛ هو معظم الجواب.
تحت الخط توجد طرق أفضل. تحدث إلى خمسة مستخدمين، وشاهد تسجيلات الجلسات، وأطلق التغيير وقارن قبل وبعد بهوامش خطأ عريضة، أو اختبر على مقياس يصل إليه زوار أكثر، كنقرة بدل عملية شراء.
كيف تجري اختبار الواقع
1
أدخل الزوار الشهريين الذين سيرون الاختبار
لا الموقع كله. إذا كان الاختبار على صفحة التسعير، فهم زوار صفحة التسعير. وإذا كان خطوة دفع، فهم من يصلون إلى تلك الخطوة.
2
أدخل معدل التحويل الحالي لتلك الخطوة
الحاسبة تعرض التحويلات الشهرية التي يعنيها هذا، وهي القيد الحقيقي.
3
سمِّ التحسن الذي ستتصرف بناءً عليه
التحسن النسبي الذي سيجعلك تطلق التغيير. معظم الناس يقولون 10% ويعنونها؛ كن صادقًا إن كان تحسنك أصغر.
4
اقرأ الحكم والسلّم
انطلق تعني أقل من شهر. وبجهد تعني أقل من ربع سنة، مع تجميد الصفحة طوال الوقت. وتوقف تعني أن الاختبار لا يستطيع الإجابة عن السؤال بزياراتك. والسلّم يبين كم ستكلف التحسنات الأكبر بدلًا من ذلك.
5
اختر معدل أساس واقرأ خطر الإيجابيات الكاذبة
اختر كم مرة تنجح أفكارك فعلًا. البطاقة تبين أي حصة من النتائج الدالة ستكون إنذارات كاذبة عند ذلك المعدل، وهو الرقم الذي تتذكره في المرة القادمة التي يخرج فيها اختبار أخضر.
أشهر تأكيد تحسن 10% عند ثقة 95% وقوة 80%
ذراعان، وكل زائر يدخل الاختبار. اقرأ صفك وعمودك.
الزوار الشهريون
أساس 1%
أساس 3%
أساس 5%
أساس 10%
3,000
أكثر من 100 شهر
35 شهرًا
21 شهرًا
9.8 أشهر
8,000
41 شهرًا
13 شهرًا
7.8 أشهر
3.7 أشهر
25,000
13 شهرًا
4.3 أشهر
2.5 شهر
5 أسابيع
100,000
3.3 أشهر
5 أسابيع
19 يومًا
9 أيام
500,000
20 يومًا
6 أيام
4 أيام
يومان
ثلاثة مواقع، ثلاثة أحكام
شركة SaaS في مرحلة مبكرة
8,000 زائر في الشهر، معدل تسجيل 3%، تريد رؤية تحسن 10%. الحكم: توقف. نحو 13 شهرًا و106,000 زائر. في أربعة أسابيع أصغر تحسن قابل للتأكيد نحو 40%.
مئتان وأربعون تسجيلًا في الشهر لا تستطيع حسم فرق 0.3 نقطة. وقت الفريق يُنفق بشكل أفضل على مقابلة خمسة مستخدمين وعلى تغييرات كبيرة بما يكفي لتظهر بلا اختبار: عنوان جديد ليس منها؛ ونموذج تسعير جديد قد يكون.
موقع المحتوى
50,000 زائر في الشهر، معدل اشتراك في النشرة 2%، يريد تحسن 10%. الحكم: بجهد. نحو 3.2 أشهر. في أربعة أسابيع أصغر تحسن قابل للتأكيد نحو 19%.
قابل للاختبار، لكن للتغييرات الجريئة فقط. اختبار موضع النموذج مقبول إذا كان قد يحرك الاشتراكات بالخُمس؛ أما اختبار نص الزر فلا. أو اختبر بدلًا من ذلك على النقرة إلى النموذج، التي يقوم بها زوار أكثر بكثير.
السوق الإلكترونية
400,000 زائر في الشهر، تحويل 4%، تريد تحسن 10%. الحكم: انطلق. الزوار يصلون في أقل من أسبوع؛ شغّل أسبوعين كاملين على أي حال.
هذا هو الحجم الذي كُتبت له أدلة اختبارات A/B. الخطر المتبقي هو معدل الأساس: إذا كانت فكرة واحدة من كل خمس تنجح فعلًا، فنحو فائز دال واحد من كل ستة ما زال إنذارًا كاذبًا، وتبويب محاكي الاستراق يبين كم يسوء ذلك بسرعة مع الفحوصات اليومية.
أخطاء الاختبار بزيارات قليلة
تشغيل الاختبار على أي حال وقراءته عند 85%. مستوى الثقة الذي حددته وعد بشأن كم مرة تقبل أن تُخدع. وقراءته تحت ذلك بعد الواقع تساوي ألا تكون قد حددت مستوى قط.
اختبار تغييرات ضئيلة. ألوان الأزرار وتبديل الكلمات تنتج تحسنات ببضع نقاط مئوية في أحسن الأحوال، ولا تستطيع المواقع الصغيرة رصدها. إذا كان لا بد أن تختبر، فاختبر شيئًا يمكن أن يحرك الرقم بالثلث على نحو معقول.
الاختبار في أسفل القمع. المشتريات نادرة؛ والنقرات شائعة. واختبار على النقرة التي تقود إلى الشراء لديه عشرة أضعاف الأحداث ويستطيع أن ينتهي.
ترك اختبار يعمل ستة أشهر. المواسم والحملات وتغييرات المنتج كلها تتسرب إليه، وتنتهي الذراعان بقياس حقبتين مختلفتين.
الثقة بفائز لأنه كان دالًا. مع قلة الفائزين الحقيقيين بين أفكارك، تكون النتيجة الدالة إنذارًا كاذبًا أكثر مما توحي به القيمة الاحتمالية. بطاقة خطر الإيجابيات الكاذبة تضع رقمًا على ذلك.
معاملة «غير دال» على أنها «الفكرة فشلت». عند الزيارات القليلة لا يكاد شيء يكون دالًا. قد تكون الفكرة جيدة؛ والاختبار لم يستطع رؤيتها.
أسئلة شائعة عن اختبار الواقع
كم زيارة أحتاج لإجراء اختبار A/B؟
يعتمد على معدل تحويلك والتحسن الذي تريد رؤيته، ولهذا تطلب هذه الصفحة الاثنين. كقاعدة عامة، تأكيد تحسن نسبي 10% على معدل تحويل 3% يحتاج إلى نحو 100,000 زائر؛ وتأكيد تحسن 30% يحتاج إلى نحو 12,000. والمواقع التي تقل عن 10,000 زائر في الشهر لا تستطيع عادة رصد إلا الآثار الكبيرة جدًا.
ماذا يفعل الموقع الصغير بدل اختبار A/B؟
تحدث إلى المستخدمين، شخصيًا أو في مكالمة: خمس محادثات تجد معظم مشكلات الصفحة. شاهد تسجيلات الجلسات. أجرِ تغييرات جريئة، وأطلقها، وقارن بضعة أسابيع قبل وبعد، مع العلم أن المقارنة تقريبية. اختبر على مقاييس يصل إليها زوار أكثر. وعندما تصل الزيارات، عد إلى هنا واختبر كما ينبغي.
ما خطر الإيجابيات الكاذبة ولماذا يختلف عن القيمة الاحتمالية؟
القيمة الاحتمالية تخبرك بمدى إثارة النتيجة للدهشة لو لم يتغير شيء. وخطر الإيجابيات الكاذبة يخبرك، من بين الاختبارات التي خرجت دالة، كم منها لم يكن وراءه شيء. وهو يعتمد على كم مرة تنجح أفكارك فعلًا: عند معدل أساس 10% وثقة 95% وقوة 80%، يكون نحو 36% من الفائزين الدالين إنذارات كاذبة. برامج التجريب الكبيرة تفيد بأن 10 إلى 33% فقط من الأفكار تحرك مقياسها، ولهذا يهم معدل الأساس إلى هذا الحد.
هل اختبار مدته 3.5 أشهر مستحيل فعلًا؟
ليس مستحيلًا، والحاسبة تقول «بجهد» لا «توقف» حتى ربع سنة. لكن صفحة مجمدة ربع سنة صفحة لا أحد يحسّنها، واختبار يمتد عبر موسم أو حملة يقارن فترتين مختلفتين. وإذا كان التغيير كبيرًا بما يكفي لتبرير ربع سنة من الانتظار، فهو على الأرجح كبير بما يكفي لإطلاقه وقياسه قبل وبعد.
هل يمكنني خفض الثقة إلى 90% لتسريع الاختبار؟
يمكنك، إذا قررت ذلك قبل الاختبار وقبلت معدل إنذارات كاذبة بنسبة واحد من عشرة فوق أثر معدل الأساس. هذا يقصّر الاختبار بنحو الثلث، لا بعشرة أضعاف التي يحتاجها موقع صغير. أما رفع التحسن الذي تختبر من أجله فيساعد أكثر بكثير.
لماذا تقول الحاسبة توقف بينما تعطي حاسبة حجم العينة رقمًا؟
كلتاهما تستخدم الصيغة نفسها. صفحة حجم العينة تخبرك بالعدد؛ وهذه الصفحة تقسمه على زياراتك وتحكم على النتيجة. عدد 106,000 زائر رقم؛ وثلاثة عشر شهرًا حكم.