Menu

Calculateur de test A/B

Saisissez les visiteurs et les conversions de chaque variante. Vous obtenez le verdict en une phrase, la valeur p avec son calcul, l'intervalle, la probabilité bayésienne que B soit meilleur, un contrôle de la répartition du trafic et le plus petit gain que ce test aurait pu détecter.

Par Nethanel Bar, Co-founder & CEO

Dernière mise à jour

Prêt à vraiment apprendre à coder ?

Coddy vous apprend en écrivant du vrai code dans votre navigateur : leçons interactives, retour immédiat et aide de l'IA quand vous bloquez.

Ce que ce calculateur vous dit et que les autres taisent

Tous les calculateurs de test A/B affichent une valeur p. La plupart s'arrêtent là, et c'est ainsi que des fondateurs finissent devant un 87 % de confiance en se demandant ce que cela veut dire. Celui-ci répond aux questions qui décident vraiment de la suite. La différence dépasse-t-elle ce que le hasard produirait ? Quelle taille le vrai gain peut-il avoir, au pire et au mieux ? Si le test ressort « non significatif », aurait-il seulement pu trouver quelque chose avec cet échantillon ? Et la répartition du trafic est-elle saine, ou comparez-vous deux groupes qui n'ont jamais été équivalents ?

Il exécute le test z classique à deux proportions, celui du moteur historique d'Optimizely, du mode fréquentiste de VWO et de tous les manuels de statistique, et montre chaque ligne de l'arithmétique : le taux combiné, l'erreur standard, le score z et l'aire de la queue. À côté se trouve la réponse bayésienne, la probabilité que le vrai taux de B dépasse celui de A, parce que « il y a 91 % de chances que B soit meilleur » est la phrase que la plupart des gens espéraient obtenir de la valeur p, et que c'est un autre nombre.

Nous l'avons construit après avoir regardé notre propre tableau de bord. Coddy a mené une vingtaine d'expériences nommées, dont dix tests de prix par pays sur de petites tranches de trafic, et notre outil interne affichait une barre de confiance avec les mots « Continuer » sous 95 %. C'est de l'arrêt optionnel avec un visage aimable. Les trois onglets à côté de celui-ci, la taille d'échantillon, le test de réalité et le simulateur de peeking, existent parce qu'un calculateur qui ne rapporte que la significativité est un calculateur qui vous aide à vous tromper plus vite.

À savoir avant de faire confiance au nombre

  • « Non significatif » ne veut pas dire « aucune différence ». Cela veut dire que les données ne peuvent pas trancher. La tuile qui indique le plus petit gain détectable par ce test est la lecture honnête : si votre gain observé est en dessous, le test n'allait jamais répondre.
  • La valeur p n'est pas la probabilité que vous ayez tort. C'est la probabilité de voir un écart aussi grand si les deux variantes étaient identiques. La probabilité que le gagnant soit réel dépend aussi de la fréquence à laquelle vos idées fonctionnent, ce que l'onglet test de réalité transforme en nombre.
  • S'arrêter le premier jour où la barre passe au vert est l'habitude la plus coûteuse de l'A/B testing. Vérifier chaque jour et s'arrêter tôt transforme un taux de faux positifs de 5 % en 20 % ou plus. Le simulateur de peeking le montre sur votre propre trafic.
  • Une répartition cassée empoisonne tout. Si vous aviez prévu 50/50 et obtenez 46/54, quelque chose oriente les utilisateurs avant qu'ils n'atteignent le test : une couche de cache, un filtre anti-bots, une redirection. Le calculateur fait ce contrôle en premier et refuse de rendre un verdict tant qu'il échoue.
  • Sous environ 25 conversions par groupe, l'approximation normale derrière le test z est une esquisse, pas une mesure. Le calculateur le dit au lieu d'afficher trois décimales de fausse précision.

Comment utiliser le calculateur de test A/B

  1. Saisissez les visiteurs et les conversions de A et de B

    Les visiteurs sont les personnes affectées à cette variante, pas les pages vues. Les conversions sont celles qui ont fait l'action mesurée : inscription, paiement, clic. Les deux doivent être comptés de la même façon pour les deux groupes.

  2. Choisissez le niveau de confiance et l'hypothèse

    95 % bilatéral est le réglage par défaut et le choix honnête quand B peut être meilleur ou pire. L'unilatéral ne sert que lorsqu'un B moins bon serait ignoré exactement comme une absence de changement, ce qui est plus rare qu'on ne le pense.

  3. Lisez le verdict, puis l'intervalle

    Le bandeau dit ce que les nombres soutiennent. La tuile du gain relatif montre l'intervalle : le vrai effet se situe probablement n'importe où à l'intérieur, et c'est la borne basse qu'il faut utiliser pour planifier, pas l'estimation ponctuelle.

  4. Vérifiez les deux avertissements

    Si la répartition est signalée, corrigez le test avant de lire quoi que ce soit d'autre. Si le plus petit gain détectable dépasse votre gain observé, le test manquait de puissance : allez dans l'onglet taille d'échantillon pour voir combien de visiteurs il faudrait.

  5. Copiez le résultat ou le lien

    Copier le résultat vous donne le résumé pour un message ou un document. Copier le lien place les quatre nombres dans l'URL, pour que la personne qui l'ouvre voie le même calcul.

Lire les résultats

Ce que signifie chaque tuile, en une ligne.

TuileCe que c'estComment la lire
Gain relatif(taux B moins taux A) divisé par le taux ALe chiffre principal. L'intervalle à côté est la plage dans laquelle le vrai gain se situe probablement.
Valeur pProbabilité d'un écart aussi grand si A et B étaient identiquesSous 0,05 à 95 % de confiance, c'est significatif. Ce n'est pas la probabilité que le résultat soit faux.
Confiance1 moins p, en pourcentageLe nombre que la plupart des outils affichent. 87 % n'est pas presque 95 % ; c'est une pièce tombée du mauvais côté de la ligne.
Probabilité que B soit meilleurProbabilité bayésienne que le vrai taux de B dépasse celui de ALa phrase que les gens veulent. 91 % veut dire que B est probablement meilleur, pas qu'il est meilleur de 91 %.
Plus petit gain détectable par ce testLe gain relatif détectable à 80 % de puissance avec ces tailles de groupesSi votre gain observé est en dessous, « non significatif » veut dire « impossible à trancher ».
Répartition du traficPart observée des visiteurs dans chaque groupe par rapport au planSignalée quand l'écart dépasse ce que le hasard permet. Corrigez le test avant de lire les résultats.

Trois tests, trois leçons différentes

Le classique « presque »

A : 10 000 visiteurs, 500 conversions (5,00 %). B : 10 000 visiteurs, 560 conversions (5,60 %). Gain relatif +12 %, p = 0,058.

Non significatif à 95 %, et l'intervalle va d'environ moins 0,4 % à plus 24 %. La lecture honnête est « probablement un petit effet positif, peut-être rien ». Le plus petit gain que ce test peut détecter est d'environ 17 %, donc un effet de 12 % allait toujours tomber dans la zone grise. Il faut à peu près deux fois plus de trafic, pas une semaine d'espoir en plus.

La répartition cassée

A : 5 000 visiteurs, 100 conversions. B : 4 300 visiteurs, 120 conversions. Répartition prévue 50/50.

B ressemble à un gagnant net à +40 %. Le calculateur refuse de le dire : une répartition 5 000 contre 4 300 a moins d'une chance sur un million de se produire par accident à 50/50. Quelque chose retire des utilisateurs de B avant qu'ils ne soient comptés, souvent une redirection qui échoue sur un navigateur, ou un filtre anti-bots qui traite la variante différemment. Quoi qu'il en soit, les deux groupes ne sont pas comparables et le gain n'a aucun sens.

Le petit site

A : 400 visiteurs, 12 conversions (3,0 %). B : 400 visiteurs, 19 conversions (4,75 %). Gain relatif +58 %, p = 0,20.

Un gain de 58 % paraît énorme, et la valeur p est d'environ 0,19. Avec 12 et 19 conversions, le calculateur signale un manque de données : à cette taille les nombres bougent tellement qu'une seule inscription de plus déplace le taux d'un quart de point. À ce trafic, le plus petit gain que le test pourrait confirmer en un mois dépasse 100 %. Ce n'est pas une raison de le faire tourner plus longtemps ; c'est une raison de lire l'onglet test de réalité.

Les erreurs que ce calculateur est conçu pour attraper

  • Lire 90 % de confiance comme « probablement bon ». À 95 %, la ligne est à 95 %. Le nombre en dessous signifie que les données n'ont pas franchi la barre que vous avez fixée, et déplacer la barre après avoir regardé est l'erreur, pas le nombre.
  • Appeler égalité un test non significatif. Une égalité, c'est un intervalle minuscule autour de zéro. Un test non significatif avec un intervalle large est une question sans réponse, et l'onglet taille d'échantillon dit ce qu'y répondre coûterait.
  • Déclarer un gagnant le premier matin où la barre passe au vert. Le simulateur de peeking lance deux mille tests où rien n'a changé et montre combien un vérificateur quotidien aurait mis en production.
  • Tester cinq variantes et rapporter la meilleure à 95 %. Cinq comparaisons à 5 % chacune, c'est 23 % de chances d'un faux gagnant. L'onglet taille d'échantillon répartit l'alpha pour vous quand vous ajoutez des variantes.
  • Comparer des pages vues à des utilisateurs uniques, ou compter les conversions sur une autre fenêtre que les visiteurs. Le test z suppose que chaque visiteur est un essai indépendant ; tout le reste gonfle la confiance.
  • Ignorer la répartition. Un 48/52 sur 100 000 visiteurs n'est pas le hasard ; c'est un bug, et tout résultat en aval n'est pas fiable.

FAQ du calculateur de test A/B

Comment savoir si mon test A/B est statistiquement significatif ?
Saisissez les visiteurs et les conversions de chaque variante, choisissez un niveau de confiance (95 % est la norme) et lisez le verdict. Le test est significatif quand la valeur p est inférieure à 1 moins votre confiance, donc sous 0,05 à 95 %. Cette page vous donne aussi l'intervalle du vrai gain et vous dit si le test aurait pu détecter l'effet que vous regardez, ce qu'une valeur p seule ne peut pas faire.
Que signifie une valeur p de 0,08 pour mon test ?
Que si A et B convertissaient vraiment au même taux, un écart au moins aussi grand apparaîtrait environ 8 % du temps par hasard. Ce n'est pas la probabilité que le résultat soit faux, et ce n'est pas « 92 % de confiance que B est meilleur ». À 95 % de confiance, cela signifie que le test n'a pas franchi la barre ; regardez la tuile du plus petit gain détectable pour voir s'il aurait seulement pu le faire.
90 % de confiance, est-ce suffisant ?
Cela peut l'être, si vous avez décidé de 90 % avant le début du test et que vous acceptez un faux positif sur dix. Ce qui n'est jamais suffisant, c'est de tourner à 95 %, de voir 91 % et de décider que 90 % était le vrai seuil depuis le début. Le niveau de confiance est une promesse sur la fréquence à laquelle vous acceptez d'être trompé ; le changer après avoir regardé rompt la promesse.
De combien de conversions ai-je besoin par variante ?
Il n'y a pas de nombre magique, mais sous environ 25 conversions par groupe le test z est une esquisse grossière, et la plupart des vrais tests en demandent des centaines. Le nombre qui compte est le gain que vous voulez détecter : à 5 % de base, voir un gain relatif de 10 % à 95 % de confiance et 80 % de puissance demande environ 31 000 visiteurs par variante, soit à peu près 1 550 conversions chacune. L'onglet taille d'échantillon le calcule pour vos propres taux.
Quelle est la différence entre la valeur p fréquentiste et la probabilité bayésienne que B soit meilleur ?
La valeur p demande « à quel point cet écart est-il surprenant si rien n'a changé ? » et donne un oui ou un non à un seuil. Le nombre bayésien demande « vu ce que j'ai observé, quelle est la probabilité que le vrai taux de B dépasse celui de A ? » et donne une probabilité. Sur les mêmes données, ils vont généralement dans le même sens : un p de 0,05 correspond à peu près à 97 % de chances que B soit meilleur sur un test bilatéral. Cette page montre les deux parce que la phrase bayésienne est celle que les gens veulent dire quand ils parlent de « confiance », et la valeur p est celle que leur outil affiche.
Pourquoi le calculateur refuse-t-il de rendre un verdict quand la répartition est déséquilibrée ?
Parce qu'un déséquilibre de répartition (sample ratio mismatch) signifie que les deux groupes n'ont pas été assignés au hasard, et la randomisation est toute la raison pour laquelle un test A/B fonctionne. Si vous aviez prévu 50/50 et que la répartition observée a moins d'une chance sur mille d'arriver par hasard, un mécanisme décide qui atterrit dans quel groupe, et il pourrait être corrélé à la conversion. Le gain que vous voyez pourrait être ce mécanisme, pas votre changement.
Puis-je utiliser ce calculateur pour le revenu par visiteur ou le panier moyen ?
Non. Cette page teste une proportion : chaque visiteur a converti ou non. Le revenu par visiteur est une métrique continue et très asymétrique, qui demande un test t ou un bootstrap sur les montants par utilisateur, donc les données brutes plutôt que quatre totaux. La calculatrice de test t des calculatrices de maths Coddy gère la comparaison de moyennes une fois que vous avez les valeurs par utilisateur.
D'où vient le plus petit gain détectable ?
De la même formule que le calculateur de taille d'échantillon, exécutée à l'envers. À partir de vos tailles de groupes et du taux de A, il trouve le gain relatif que 80 % des tests de cette taille attraperaient à votre niveau de confiance. Si le gain observé est en dessous, votre test manquait de puissance pour cet effet, et « non significatif » ne dit presque rien sur le fait que le changement ait fonctionné ou non.

Autres outils pour développeurs

Illustration des langages de programmation de Coddy

Apprendre à coder avec Coddy

COMMENCER