Menu

Simulateur de peeking pour tests A/B

Deux mille tests où A et B sont la même page, lancés sur votre trafic. Regardez combien un vérificateur quotidien aurait déclarés gagnants, et combien de ces mêmes tests trompent quelqu'un qui attend la date de fin.

Par Nethanel Bar, Co-founder & CEO

Dernière mise à jour

Prêt à vraiment apprendre à coder ?

Coddy vous apprend en écrivant du vrai code dans votre navigateur : leçons interactives, retour immédiat et aide de l'IA quand vous bloquez.

L'habitude la plus coûteuse de l'A/B testing, simulée sur vos nombres

Voici l'habitude. Vous lancez un test, et chaque matin vous ouvrez le tableau de bord. La barre monte doucement, redescend, remonte, et un mardi elle franchit 95 %. Vous tranchez, vous mettez le gagnant en production et vous passez à autre chose. Le problème est qu'une valeur p vagabonde. Sur un test où les deux variantes sont identiques, la valeur p passe quand même sous 0,05 certains jours par hasard ; elle repasse simplement au-dessus plus tard. S'arrêter au premier franchissement signifie l'attraper au passage, et le niveau de confiance que vous pensiez avoir a disparu.

La taille de l'effet surprend. À 95 % de confiance, un test lu une fois à la fin vous trompe environ une fois sur vingt, ce qui est le marché que vous avez signé. Lisez le même test chaque jour pendant quatre semaines et arrêtez-vous au premier jour vert, et le simulateur montre typiquement un faux gagnant dans un quart des tests ou plus alors que rien n'a changé. L'article original d'Evan Miller le situait à plus de 20 % pour un vérificateur quotidien ; Optimizely a reconstruit son moteur statistique en 2015 parce que le taux de faux positifs de ses clients avait dépassé ce niveau. Vérifier chaque semaine au lieu de chaque jour réduit à peu près les dégâts de moitié, mais ne les supprime pas.

La simulation ici est honnête sur ce qu'elle est : chaque test tire les conversions au vrai taux pour les deux groupes, exécute le test z ordinaire à deux proportions à chaque regard sur tout ce qui a été collecté jusque-là, et note où un vérificateur s'arrêterait. Chaque trajectoire du graphique est un test ; chaque point est un matin où quelqu'un aurait annoncé un résultat. Réglez le vrai gain à +10 % pour voir l'autre moitié de l'histoire, où le vérificateur attrape un vrai effet tôt mais avec un gain exagéré, et aurait « gagné » tout aussi volontiers si l'effet avait été nul.

Ce que la simulation montre

  • La valeur p est une marche aléatoire. Sous l'hypothèse nulle, elle est uniformément distribuée à chaque regard pris isolément, ce qui signifie que n'importe quel matin il y a 5 % de chances qu'elle soit sous 0,05. Sur vingt-huit matins, ces chances s'additionnent.
  • Le taux de faux positifs dépend du nombre de fois où vous regardez, pas de la durée du test. Un test de quatre semaines lu chaque semaine se fait tromper moins souvent qu'un test de deux semaines lu chaque jour.
  • Les arrêts précoces surestiment le gain. Quand un vérificateur s'arrête un jour de chance, le gain observé ce jour-là est par définition inhabituellement grand. Les gagnants mis en production dont l'effet s'est « estompé » après le lancement étaient souvent cela.
  • La solution est soit la discipline, soit un autre test. La discipline : fixer la taille d'échantillon et la date de fin à l'avance et lire une seule fois. Un autre test : les méthodes séquentielles, comme les valeurs p toujours valides qu'utilisent Optimizely, Statsig et Eppo, sont conçues pour être lues en continu, au prix d'un échantillon plus grand.
  • Les tableaux de bord bayésiens ne sont pas immunisés. Une probabilité d'être le meilleur vérifiée chaque jour et exploitée à un seuil a le même problème sous un autre costume.

Comment utiliser le simulateur

  1. Saisissez votre taux de conversion et vos visiteurs quotidiens

    La simulation tire les conversions à votre vrai taux, pour que le vagabondage de la valeur p corresponde au bruit que vous verriez réellement.

  2. Réglez la durée prévue et la fréquence des regards

    Chaque jour, tous les trois jours ou chaque semaine. L'écart entre le taux du vérificateur et le taux honnête est le prix de cette habitude.

  3. Laissez le vrai gain à aucun

    Cela fait de chaque test un test A/A : tout gagnant est une fausse alerte par construction. Passez ensuite à +10 % ou +30 % pour voir le vérificateur face à un vrai effet.

  4. Lisez les deux grands nombres

    Le taux du vérificateur est la fréquence à laquelle celui qui regarde chaque jour a déclaré un gagnant. Le taux à la date de fin devrait être proche de l'alpha choisi ; si c'est le cas, le test honnête fait ce qu'il a promis.

  5. Relancez

    Chaque lancement tire de nouveaux tests aléatoires. Les taux bougent un peu ; l'écart, non.

Taux de faux positifs typiques sur des tests A/A

À 95 % de confiance, une lecture honnête à la fin se fait tromper environ 5 % du temps. Chiffres approximatifs issus de la simulation et de la littérature pour un vérificateur qui s'arrête au premier regard significatif.

Fréquence des regardsRegards en 4 semainesFaux gagnants
Une fois, à la fin1environ 5 %
Chaque semaine4environ 10 à 13 %
Tous les 3 jours9 à 10environ 15 à 20 %
Chaque jour28environ 25 à 30 %
Chaque jour pendant 12 semaines84plus de 35 %

Trois habitudes, simulées

Le vérificateur quotidien

5 % de conversion, 1 000 visiteurs par jour, 28 jours, vérifié chaque matin. Dans notre série : le vérificateur a déclaré un gagnant dans environ 28 % des 2 000 tests A/A ; en lisant une fois à la fin, 4,5 %.

Six fois le taux de fausse alerte, pour un test qui semblait soigné parce que quelqu'un le surveillait chaque jour. La moitié de ces « gagnants » ont couronné B et l'autre moitié A, parce qu'il n'y avait rien à trouver.

Le vérificateur hebdomadaire

Même trafic, même durée, vérifié une fois par semaine. Dans notre série : environ 12 % pour le vérificateur contre 5 % à la fin.

Regarder quatre fois au lieu de vingt-huit aide beaucoup et fait quand même plus que doubler le taux promis. Il n'y a aucun nombre de regards, à part un, qui tienne la promesse.

Un vrai gain de +10 %

Réglez le vrai gain de B à +10 % sur le même trafic. Le test honnête à 28 jours a une puissance limitée pour un gain aussi petit à ce trafic ; le vérificateur s'arrête tôt plus souvent, les jours de chance.

C'est le cas séduisant : le vérificateur semble trouver les choses plus vite. Mais les jours où il s'arrête sont ceux où le gain paraissait le plus grand, donc l'estimation mise en production est gonflée, et la même habitude aurait trouvé un « gagnant » avec le gain réglé à zéro.

Les erreurs de peeking

  • S'arrêter au premier matin significatif. C'est toute la page. Le niveau de confiance ne veut dire ce qu'il dit que si vous lisez le résultat une seule fois.
  • Prolonger un test « presque arrivé ». Décider de continuer parce que le résultat est presque significatif, c'est du peeking à l'envers, et cela gonfle le taux de faux positifs de la même façon.
  • Vérifier chaque jour « juste pour s'assurer que rien n'est cassé ». Surveiller les bugs, c'est bien ; surveiller la valeur p, non. Regardez la répartition du trafic et les taux d'erreur, pas le gain, jusqu'à la date de fin.
  • Croire qu'un tableau de bord bayésien rend le peeking sûr. Agir sur un seuil de probabilité que vous vérifiez chaque jour produit la même inflation.
  • Rapporter le gain du jour où vous vous êtes arrêté. Si vous devez vous arrêter tôt, rapportez l'intervalle, et attendez-vous à ce que le vrai gain soit plus petit que l'estimation ponctuelle.

FAQ sur le peeking

Qu'est-ce que le problème du peeking en A/B testing ?
Lire un test à horizon fixe de façon répétée et s'arrêter la première fois qu'il paraît significatif. Parce que la valeur p fluctue pendant que les données arrivent, chaque regard est une nouvelle chance de franchir le seuil par hasard. Un test lu chaque jour pendant un mois à 95 % de confiance produit un faux gagnant à peu près un quart du temps alors que rien n'a changé, au lieu des 5 % que le niveau de confiance promet.
Est-ce mal de regarder mon test avant qu'il se termine ?
Regarder n'est pas le problème ; agir l'est. Vérifiez que le trafic se répartit également, que les deux variantes se chargent et que les conversions sont bien enregistrées. Ne lisez ni le gain ni la confiance, et ne laissez pas ce que vous avez vu changer la date de fin dans un sens ou dans l'autre.
Comment faire un test A/B si je veux vérifier en continu ?
Utilisez une méthode séquentielle. Les valeurs p toujours valides, les plans séquentiels par groupes et leurs cousins sont conçus pour être lus à tout moment ; ils le paient avec une taille d'échantillon plus grande pour la même puissance. La plupart des plateformes modernes en proposent une. Ce simulateur modélise le test classique à horizon fixe parce que c'est ce que sont la plupart des calculs de tableurs et de tableaux de bord, y compris les autres onglets de ce site.
Le peeking compte-t-il si je vérifie chaque semaine ?
Moins, mais oui. Quatre regards sur quatre semaines à 95 % doublent typiquement le taux de faux positifs. Le seul nombre de regards qui tient le taux promis est un.
Pourquoi le simulateur utilise-t-il des tests A/A ?
Parce qu'avec des groupes identiques, chaque gagnant est une fausse alerte par construction, donc le taux que le simulateur rapporte est exactement le taux de faux positifs de l'habitude simulée. Activer un vrai gain montre l'autre face, où le vérificateur s'arrête tôt les jours de chance et rapporte un effet gonflé.
Un test bayésien résout-il le problème du peeking ?
Pas à lui seul. Une probabilité bayésienne lue en continu et exploitée à un seuil fixe gonfle les fausses décisions de la même façon, comme Georgi Georgiev et d'autres l'ont montré. Les méthodes bayésiennes avec une vraie règle de décision et un a priori peuvent bien se comporter sous surveillance continue, mais « bayésien » seul n'est pas la solution.

Autres outils pour développeurs

Illustration des langages de programmation de Coddy

Apprendre à coder avec Coddy

COMMENCER