Combien de visiteurs chaque variante doit recevoir avant que le test puisse dire quoi que ce soit, et combien de jours cela représente à votre trafic. Fixez le plus petit gain qui vaut la peine d'être détecté, la confiance et la puissance, et lisez le compte avec la formule en dessous.
Décidez la taille d'échantillon avant de regarder un seul résultat
Une taille d'échantillon est une promesse que vous vous faites avant le début du test : « je regarderai le résultat quand autant de personnes l'auront vu, et pas avant. » Sans elle, chaque test A/B dérive vers la même histoire. La première semaine paraît prometteuse, la deuxième le gain rétrécit, quelqu'un demande si c'est déjà significatif, et le test s'arrête le jour où la barre passe au vert. Cette page vous donne le nombre à écrire dans le plan, pour que la date de fin soit un fait et non une humeur.
Le calcul est la taille d'échantillon classique à deux proportions, celle qui se cache derrière le calculateur d'Evan Miller et celui d'Optimizely, et il dépend de quatre choses : le taux de base, le gain que vous voulez pouvoir détecter, le niveau de confiance et la puissance. La puissance est celle que les gens sautent. À 80 % de puissance, un vrai gain de la taille indiquée est attrapé huit fois sur dix ; un test avec la moitié de l'échantillon a bien moins que la moitié de la puissance, ce qui explique qu'un test sous-dimensionné n'est pas « une réponse plus grossière » mais le plus souvent aucune réponse du tout.
La courbe sous le résultat est la partie à retenir. Les visiteurs nécessaires croissent avec le carré de l'inverse du gain : divisez par deux le gain que vous voulez voir et il vous faut environ quatre fois plus de trafic. Un site capable de confirmer un gain de 30 % en deux semaines a besoin d'environ neuf fois plus de temps pour en confirmer un de 10 %. Si le nombre de jours ressort en mois, le calculateur vous dit de tester quelque chose de plus grand, ou de remonter l'entonnoir vers une métrique que plus de gens atteignent, avant de vous dire d'attendre.
De quoi dépend la taille d'échantillon
L'effet minimal détectable est une décision, pas une mesure. C'est le plus petit gain pour lequel vous mettriez vraiment en production. Le fixer bas pour rendre le test « plus sensible » rend le test plus long, pas meilleur.
Gain relatif et gain absolu sont deux animaux différents. Un gain relatif de 10 % sur une base de 5 % fait un demi-point de pourcentage. Cette page travaille en relatif parce que c'est ainsi que les résultats sont rapportés, et affiche le taux cible à côté pour que vous voyiez les deux.
Les variantes supplémentaires coûtent plus que leur part. Tester A contre B, C et D fait trois comparaisons, et la confiance doit être répartie entre elles. Le calculateur applique la correction de Bonferroni et montre l'alpha que chaque comparaison reçoit réellement.
Les jours sont un plafond, pas un plancher. Même quand les nombres disent quatre jours, faites au moins une semaine complète, idéalement deux, parce que les visiteurs de semaine et de week-end convertissent différemment et qu'un test du mardi seul mesure les mardis.
80 % de puissance signifie qu'un vrai gagnant sur cinq est manqué. Si manquer un gagnant vous coûte cher, prenez 90 % et acceptez l'échantillon plus grand.
Comment dimensionner un test A/B
1
Saisissez le taux de conversion actuel
Utilisez le taux de la page ou de l'étape que le test va modifier, mesuré sur le même type de visiteurs que le test verra. N'utilisez pas une moyenne de tout le site quand vous testez une étape de l'entonnoir.
2
Choisissez le plus petit gain qui vaut la peine d'être détecté
Demandez-vous quel gain vous ferait mettre le changement en production. C'est votre effet minimal détectable. 10 % relatif est un choix courant pour une page mature ; une refonte peut justifier 20 % ou plus.
3
Réglez la confiance et la puissance
95 % de confiance et 80 % de puissance sont les conventions. Montez la confiance quand un faux gagnant coûte cher à annuler ; montez la puissance quand un gagnant manqué coûte cher à laisser de côté.
4
Ajoutez vos visiteurs quotidiens
Toutes variantes confondues, en ne comptant que les visiteurs qui atteindront le test. Le résultat se transforme en jours et en semaines entières.
5
Notez la date de fin
Le calculateur vous donne la taille d'échantillon par variante. Inscrivez-la dans le plan de test avec la date qu'elle implique, et ne lisez pas les résultats avant. L'onglet simulateur de peeking montre pourquoi.
La taille d'échantillon en un coup d'œil
Visiteurs par variante à 95 % de confiance et 80 % de puissance, bilatéral. Multipliez par deux pour un test à deux groupes.
Taux de base
gain +5 %
gain +10 %
gain +20 %
gain +50 %
1 %
environ 637 000
environ 163 000
environ 42 700
environ 7 800
3 %
environ 208 000
environ 53 200
environ 13 900
environ 2 500
5 %
environ 122 000
environ 31 200
environ 8 200
environ 1 500
10 %
environ 57 800
environ 14 800
environ 3 800
environ 690
20 %
environ 25 600
environ 6 500
environ 1 700
environ 290
Exemples détaillés
Une page d'inscription à 5 %, en quête de +10 %
Taux de base 5 %, effet minimal détectable 10 % (cible 5,5 %), 95 % de confiance, 80 % de puissance, bilatéral. Résultat : environ 31 000 visiteurs par variante, 62 000 au total.
À 1 000 visiteurs par jour, cela fait 62 jours, donc neuf semaines entières. Beaucoup d'équipes trouveraient cela trop long et testeraient soit un changement plus audacieux, soit accepteraient que cette page a besoin d'un gain de 20 % ou plus pour être testable en quinze jours.
Une étape de paiement à 3 %, en quête de +20 %
Taux de base 3 %, effet minimal détectable 20 % (cible 3,6 %). Résultat : environ 13 900 visiteurs par variante.
Les taux de base plus bas demandent plus de visiteurs pour le même gain relatif, parce qu'il y a moins de conversions à compter. Un gain relatif de 20 % ne fait ici que 0,6 point de pourcentage, et le test doit distinguer 3,0 % de 3,6 %.
Trois variantes contre un contrôle
Taux de base 5 %, gain 10 %, quatre variantes contrôle inclus. L'alpha par comparaison devient 0,05 / 3, et l'échantillon par variante grandit d'environ un tiers ; le total vaut quatre fois le chiffre par variante.
Ajouter des variantes est le moyen le plus rapide de transformer un test de deux semaines en un test de deux mois. Testez une idée forte contre le contrôle ; lancez l'idée suivante après.
Les erreurs de taille d'échantillon
Dimensionner le test après avoir vu les premiers résultats. Le gain que vous observez par hasard au troisième jour n'est pas l'effet minimal détectable ; c'est du bruit avec une opinion.
Utiliser un gain absolu là où un gain relatif était voulu. Un « gain de 10 % » sur une base de 2 % vaut soit 2,2 % soit 12 %, et les tailles d'échantillon diffèrent d'un facteur de plusieurs centaines.
S'arrêter à la taille d'échantillon quand le résultat n'est pas significatif et l'appeler une défaite. Atteindre la taille d'échantillon signifie que le test peut détecter l'effet que vous avez indiqué. Cela ne dit rien des effets plus petits.
Compter les pages vues comme des visiteurs. La formule suppose que chaque unité est un visiteur indépendant avec un résultat ; les vues répétées gonflent le compte et la confiance.
Finir sur une semaine partielle. Si la taille d'échantillon est atteinte un jeudi, continuez jusqu'au dimanche suivant ; le mélange des jours de semaine change les taux de conversion plus que la plupart des changements testés.
FAQ sur la taille d'échantillon
Combien de temps dois-je faire tourner un test A/B ?
Jusqu'à ce que chaque variante ait atteint la taille d'échantillon pour le gain que vous voulez détecter, et pendant au moins une semaine complète, de préférence deux. Saisissez vos visiteurs quotidiens ci-dessus et le calculateur transforme la taille d'échantillon en jours et en semaines entières. Tourner plus longtemps que nécessaire est un petit gaspillage ; s'arrêter tôt parce que le résultat a l'air bon est la façon dont la plupart des faux gagnants sont déclarés.
Qu'est-ce qu'un effet minimal détectable ?
Le plus petit gain que le test est conçu pour attraper de façon fiable, choisi avant le test. Il s'exprime généralement en variation relative, donc un MDE de 10 % sur une base de 4 % signifie que le test peut distinguer 4,0 % de 4,4 %. Des MDE plus petits demandent énormément plus de visiteurs : diviser le MDE par deux quadruple à peu près l'échantillon.
Que signifie 80 % de puissance ?
Que si le vrai gain a exactement la taille que vous avez indiquée, un test de cette taille ressortira significatif 80 % du temps. Les 20 % restants, il manque un vrai gagnant. La puissance est le miroir de la confiance : la confiance limite les fausses alertes, la puissance limite les gagnants manqués.
Pourquoi un taux de conversion plus bas demande-t-il plus de visiteurs ?
Parce que le test compte des conversions, pas des visiteurs. À 1 %, 10 000 visiteurs vous donnent 100 événements à comparer ; à 10 %, ils vous en donnent 1 000. Le même gain relatif est bien plus facile à voir dans le second cas. C'est pourquoi tester sur une métrique plus haute dans l'entonnoir, que plus de visiteurs atteignent, est souvent la seule façon pour un petit site de tester.
Puis-je tester plus d'une variante ?
Oui, et le calculateur dimensionne correctement, mais chaque variante supplémentaire est une comparaison de plus contre le contrôle et la confiance doit être partagée entre elles. Quatre variantes à 95 % sans correction, c'est 14 % de chances d'au moins un faux gagnant. Le calculateur répartit l'alpha entre les comparaisons, ce qui explique que le nombre par variante grandit.
Est-ce que cela fonctionne pour le revenu ou le panier moyen ?
Non, cette page dimensionne un test sur un taux de conversion. Les métriques continues comme le revenu par visiteur demandent la variance de la métrique, généralement bien plus grande que celle d'une proportion, et les tailles d'échantillon sont d'autant plus grandes. Il vous faut votre propre variance historique et un calcul fondé sur le test t pour celles-là.