Menu

Puis-je faire un test A/B ? Le test de réalité du trafic

La question à se poser avant le premier test, pas après le dixième. Saisissez vos visiteurs mensuels, votre taux de conversion et le gain sur lequel vous agiriez vraiment, et obtenez une réponse franche : go, limite, ou stop et faites autre chose.

Par Nethanel Bar, Co-founder & CEO

Dernière mise à jour

Prêt à vraiment apprendre à coder ?

Coddy vous apprend en écrivant du vrai code dans votre navigateur : leçons interactives, retour immédiat et aide de l'IA quand vous bloquez.

La plupart des petits sites ne peuvent pas faire de tests A/B, et personne ne le leur dit

Tous les guides d'A/B testing sont écrits par des entreprises à millions de visiteurs. L'équipe d'expérimentation de Microsoft, Google, Booking.com et Airbnb mènent des milliers de tests par an, et leurs conseils sont bons pour eux : testez tout, faites confiance aux données, mettez en production ce qui gagne. Une startup à 8 000 visiteurs par mois lit les mêmes conseils, construit le même tableau de bord, puis ne comprend pas pourquoi chaque test finit à 87 % de confiance avec un gain qui rétrécit chaque semaine. Elle ne s'y prend pas mal. Elle fait quelque chose qui ne fonctionne pas à cette taille.

Cette page fait l'arithmétique que les guides sautent. À 8 000 visiteurs par mois convertissant à 3 %, confirmer un gain de 10 % demande environ 106 000 visiteurs : treize mois de tous les visiteurs que vous avez, avec la page gelée pendant tout ce temps. En quatre semaines, le plus petit gain que vous pourriez confirmer est d'environ 40 %. Ce ne sont pas des problèmes de réglage. Ronny Kohavi, qui a dirigé l'expérimentation chez Microsoft et Airbnb, place le plancher pratique pour détecter des gains à un chiffre à quelques centaines de milliers d'utilisateurs ; en dessous, il suggère que l'A/B testing est peut-être prématuré et que la recherche utilisateur est un meilleur investissement.

Nous écrivons ceci par expérience. Le tableau de bord de Coddy a mené une vingtaine d'expériences nommées, dont dix tests de prix sur un seul pays, chacune sur une petite tranche de trafic, et affichait « Continuer » dès que la confiance était sous 95 %. Plusieurs ont été marquées réussies et mises en production. Avec le recul et ce calculateur, certains de ces tests n'auraient pas pu détecter les gains qu'on leur a attribués. La version honnête de ce tableau de bord, c'est cette page : à quoi ce trafic peut-il répondre, combien de temps cela prendrait-il, et à quelle fréquence un gagnant serait-il une fausse alerte ?

Ce qui décide si vous pouvez tester

  • Ce sont les conversions par mois, pas les visiteurs, qui vous limitent. Une page à 8 000 visiteurs et 3 % a 240 conversions par mois à répartir entre deux groupes. Le test z a besoin de centaines par groupe avant de dire quoi que ce soit.
  • Le gain sur lequel vous agiriez fixe la facture. Soyez honnête : si vous mettriez un changement en production pour un gain de 3 %, il vous faut un test capable de voir 3 %, et presque aucun petit site ne le peut.
  • Le temps est un coût, pas une solution. Un test qui prend un trimestre gèle la page pendant un trimestre, traverse des saisons et des campagnes, et se termine dans une autre entreprise que celle où il a commencé.
  • La fréquence à laquelle vos idées fonctionnent change ce qu'un gagnant signifie. Si une idée sur dix fait vraiment bouger la métrique, alors à 95 % de confiance et 80 % de puissance, plus d'un tiers de vos gagnants « significatifs » sont des fausses alertes. Le taux de base n'est pas un détail technique ; c'est l'essentiel de la réponse.
  • Sous la ligne, il existe de meilleures méthodes. Parlez à cinq utilisateurs, regardez des enregistrements de sessions, mettez le changement en production et comparez avant et après avec de larges marges d'erreur, ou testez sur une métrique que plus de visiteurs atteignent, comme un clic plutôt qu'un achat.

Comment faire le test de réalité

  1. Saisissez les visiteurs mensuels qui verraient le test

    Pas tout le site. Si le test porte sur la page de tarifs, ce sont les visiteurs de la page de tarifs. Si c'est une étape de paiement, ce sont les personnes qui atteignent cette étape.

  2. Saisissez le taux de conversion actuel de cette étape

    Le calculateur affiche les conversions par mois que cela implique, ce qui est la vraie contrainte.

  3. Nommez le gain sur lequel vous agiriez

    Le gain relatif qui vous ferait mettre le changement en production. La plupart des gens disent 10 % et le pensent ; soyez honnête si le vôtre est plus petit.

  4. Lisez le verdict et l'échelle

    Go veut dire moins d'un mois. Limite veut dire moins d'un trimestre, avec la page gelée tout du long. Stop veut dire que le test ne peut pas répondre à la question à votre trafic. L'échelle montre ce que des gains plus grands coûteraient à la place.

  5. Choisissez un taux de base et lisez le risque de faux positif

    Choisissez la fréquence à laquelle vos idées fonctionnent vraiment. La tuile montre quelle part des résultats significatifs seraient des fausses alertes à ce taux, le nombre à retenir la prochaine fois qu'un test ressort vert.

Mois pour confirmer un gain de 10 % à 95 % de confiance, 80 % de puissance

Deux groupes, chaque visiteur entrant dans le test. Lisez votre ligne et votre colonne.

Visiteurs mensuelsbase 1 %base 3 %base 5 %base 10 %
3 000plus de 100 mois35 mois21 mois9,8 mois
8 00041 mois13 mois7,8 mois3,7 mois
25 00013 mois4,3 mois2,5 mois5 semaines
100 0003,3 mois5 semaines19 jours9 jours
500 00020 jours6 jours4 jours2 jours

Trois sites, trois verdicts

Le SaaS en phase de démarrage

8 000 visiteurs par mois, 3 % d'inscription, veut voir un gain de 10 %. Verdict : stop. Environ 13 mois et 106 000 visiteurs. En quatre semaines, le plus petit gain confirmable est d'environ 40 %.

Deux cent quarante inscriptions par mois ne peuvent pas résoudre une différence de 0,3 point. Le temps de l'équipe est mieux dépensé en entretiens avec cinq utilisateurs et en changements assez grands pour se voir sans test : un nouveau titre n'en fait pas partie ; un nouveau modèle de tarifs, peut-être.

Le site de contenu

50 000 visiteurs par mois, 2 % d'inscription à la newsletter, veut un gain de 10 %. Verdict : limite. Environ 3,2 mois. En quatre semaines, le plus petit gain confirmable est d'environ 19 %.

Testable, mais seulement pour des changements audacieux. Tester l'emplacement du formulaire va bien s'il peut faire bouger les inscriptions d'un cinquième ; tester le texte du bouton, non. Sinon, testez sur le clic vers le formulaire, que bien plus de visiteurs font.

La place de marché

400 000 visiteurs par mois, 4 % de conversion, veut un gain de 10 %. Verdict : go. Les visiteurs arrivent en moins d'une semaine ; faites quand même deux semaines entières.

C'est la taille pour laquelle les guides d'A/B testing sont écrits. Le risque restant est le taux de base : si une idée sur cinq fonctionne vraiment, à peu près un gagnant significatif sur six est encore une fausse alerte, et l'onglet simulateur de peeking montre à quelle vitesse cela empire avec des vérifications quotidiennes.

Les erreurs de test à faible trafic

  • Lancer le test quand même et le lire à 85 %. Le niveau de confiance que vous fixez est une promesse sur la fréquence à laquelle vous acceptez d'être trompé. Lire en dessous après coup revient à n'en avoir jamais fixé.
  • Tester des changements minuscules. Les couleurs de bouton et les échanges de mots produisent au mieux des gains de quelques pour cent, que les petits sites ne peuvent pas détecter. Si vous devez tester, testez quelque chose qui pourrait plausiblement faire bouger le nombre d'un tiers.
  • Tester en bas de l'entonnoir. Les achats sont rares ; les clics sont fréquents. Un test sur le clic qui mène à l'achat a dix fois plus d'événements et peut se terminer.
  • Laisser un test tourner six mois. Les saisons, les campagnes et les changements de produit s'y infiltrent tous, et les deux groupes finissent par mesurer des époques différentes.
  • Faire confiance à un gagnant parce qu'il était significatif. Avec peu de vrais gagnants parmi vos idées, un résultat significatif est plus souvent une fausse alerte que la valeur p ne le suggère. La tuile du risque de faux positif met un nombre dessus.
  • Traiter « non significatif » comme « l'idée a échoué ». À faible trafic, presque rien n'est significatif. L'idée est peut-être bonne ; le test ne pouvait pas la voir.

FAQ du test de réalité

De combien de trafic ai-je besoin pour faire un test A/B ?
Cela dépend de votre taux de conversion et du gain que vous voulez voir, c'est pourquoi cette page demande les deux. En règle générale, confirmer un gain relatif de 10 % sur un taux de conversion de 3 % prend environ 100 000 visiteurs ; confirmer un gain de 30 % en prend environ 12 000. Les sites sous 10 000 visiteurs par mois ne peuvent généralement détecter que de très grands effets.
Que doit faire un petit site à la place des tests A/B ?
Parler aux utilisateurs, en personne ou par téléphone : cinq conversations trouvent la plupart des problèmes d'une page. Regarder des enregistrements de sessions. Faire des changements audacieux, les mettre en production et comparer quelques semaines avant et après, en sachant que la comparaison est approximative. Tester sur des métriques que plus de visiteurs atteignent. Et quand le trafic arrive, revenir ici et tester correctement.
Qu'est-ce que le risque de faux positif et en quoi diffère-t-il de la valeur p ?
La valeur p vous dit à quel point le résultat serait surprenant si rien n'avait changé. Le risque de faux positif vous dit, parmi les tests ressortis significatifs, combien n'avaient rien derrière. Il dépend de la fréquence à laquelle vos idées fonctionnent vraiment : à un taux de base de 10 %, 95 % de confiance et 80 % de puissance, environ 36 % des gagnants significatifs sont des fausses alertes. Les grands programmes d'expérimentation rapportent que seules 10 à 33 % des idées font bouger leur métrique, ce qui explique pourquoi le taux de base compte autant.
Un test de 3,5 mois est-il vraiment impossible ?
Pas impossible, et le calculateur dit « limite » plutôt que « stop » jusqu'à un trimestre. Mais une page gelée pendant un trimestre est une page que personne n'améliore, et un test qui traverse une saison ou une campagne compare deux périodes différentes. Si le changement est assez grand pour justifier un trimestre d'attente, il est probablement assez grand pour être mis en production et mesuré avant et après.
Puis-je baisser la confiance à 90 % pour accélérer le test ?
Vous le pouvez, si vous le décidez avant le test et acceptez un taux de fausse alerte d'un sur dix en plus de l'effet du taux de base. Cela raccourcit le test d'environ un tiers, pas du facteur dix dont un petit site aurait besoin. Augmenter le gain que vous cherchez aide bien davantage.
Pourquoi le calculateur dit-il stop alors que le calculateur de taille d'échantillon donne un nombre ?
Les deux utilisent la même formule. La page de taille d'échantillon vous donne le compte ; cette page le divise par votre trafic et juge le résultat. Un compte de 106 000 visiteurs est un nombre ; treize mois est un verdict.

Autres outils pour développeurs

Illustration des langages de programmation de Coddy

Apprendre à coder avec Coddy

COMMENCER