Comment savoir si mon test A/B est statistiquement significatif ?
Saisissez les visiteurs et les conversions de chaque variante, choisissez un niveau de confiance (95 % est la norme) et lisez le verdict. Le test est significatif quand la valeur p est inférieure à 1 moins votre confiance, donc sous 0,05 à 95 %. Cette page vous donne aussi l'intervalle du vrai gain et vous dit si le test aurait pu détecter l'effet que vous regardez, ce qu'une valeur p seule ne peut pas faire.
Que signifie une valeur p de 0,08 pour mon test ?
Que si A et B convertissaient vraiment au même taux, un écart au moins aussi grand apparaîtrait environ 8 % du temps par hasard. Ce n'est pas la probabilité que le résultat soit faux, et ce n'est pas « 92 % de confiance que B est meilleur ». À 95 % de confiance, cela signifie que le test n'a pas franchi la barre ; regardez la tuile du plus petit gain détectable pour voir s'il aurait seulement pu le faire.
90 % de confiance, est-ce suffisant ?
Cela peut l'être, si vous avez décidé de 90 % avant le début du test et que vous acceptez un faux positif sur dix. Ce qui n'est jamais suffisant, c'est de tourner à 95 %, de voir 91 % et de décider que 90 % était le vrai seuil depuis le début. Le niveau de confiance est une promesse sur la fréquence à laquelle vous acceptez d'être trompé ; le changer après avoir regardé rompt la promesse.
De combien de conversions ai-je besoin par variante ?
Il n'y a pas de nombre magique, mais sous environ 25 conversions par groupe le test z est une esquisse grossière, et la plupart des vrais tests en demandent des centaines. Le nombre qui compte est le gain que vous voulez détecter : à 5 % de base, voir un gain relatif de 10 % à 95 % de confiance et 80 % de puissance demande environ 31 000 visiteurs par variante, soit à peu près 1 550 conversions chacune. L'onglet taille d'échantillon le calcule pour vos propres taux.
Quelle est la différence entre la valeur p fréquentiste et la probabilité bayésienne que B soit meilleur ?
La valeur p demande « à quel point cet écart est-il surprenant si rien n'a changé ? » et donne un oui ou un non à un seuil. Le nombre bayésien demande « vu ce que j'ai observé, quelle est la probabilité que le vrai taux de B dépasse celui de A ? » et donne une probabilité. Sur les mêmes données, ils vont généralement dans le même sens : un p de 0,05 correspond à peu près à 97 % de chances que B soit meilleur sur un test bilatéral. Cette page montre les deux parce que la phrase bayésienne est celle que les gens veulent dire quand ils parlent de « confiance », et la valeur p est celle que leur outil affiche.
Pourquoi le calculateur refuse-t-il de rendre un verdict quand la répartition est déséquilibrée ?
Parce qu'un déséquilibre de répartition (sample ratio mismatch) signifie que les deux groupes n'ont pas été assignés au hasard, et la randomisation est toute la raison pour laquelle un test A/B fonctionne. Si vous aviez prévu 50/50 et que la répartition observée a moins d'une chance sur mille d'arriver par hasard, un mécanisme décide qui atterrit dans quel groupe, et il pourrait être corrélé à la conversion. Le gain que vous voyez pourrait être ce mécanisme, pas votre changement.
Puis-je utiliser ce calculateur pour le revenu par visiteur ou le panier moyen ?
Non. Cette page teste une proportion : chaque visiteur a converti ou non. Le revenu par visiteur est une métrique continue et très asymétrique, qui demande un test t ou un bootstrap sur les montants par utilisateur, donc les données brutes plutôt que quatre totaux. La calculatrice de test t des calculatrices de maths Coddy gère la comparaison de moyennes une fois que vous avez les valeurs par utilisateur.
D'où vient le plus petit gain détectable ?
De la même formule que le calculateur de taille d'échantillon, exécutée à l'envers. À partir de vos tailles de groupes et du taux de A, il trouve le gain relatif que 80 % des tests de cette taille attraperaient à votre niveau de confiance. Si le gain observé est en dessous, votre test manquait de puissance pour cet effet, et « non significatif » ne dit presque rien sur le fait que le changement ait fonctionné ou non.