Menu

Simulador de Espiadas em Teste A/B

Dois mil testes em que A e B são a mesma página, rodados no seu tráfego. Veja quantos alguém que espia todo dia teria chamado de vencedor, e quantos dos mesmos testes enganam quem espera a data final.

Por Nethanel Bar, Co-founder & CEO

Última atualização

Pronto para aprender a programar de verdade?

A Coddy ensina você escrevendo código de verdade no navegador: lições interativas, feedback instantâneo e ajuda de IA quando você trava.

O hábito mais caro dos testes A/B, simulado com os seus números

O hábito é este. Você começa um teste e, toda manhã, abre o painel. A barra sobe, cai, sobe de novo, e numa terça-feira cruza os 95%. Você declara o resultado, coloca o vencedor no ar e segue em frente. O problema é que um valor-p vagueia. Em um teste em que as duas variantes são idênticas, o valor-p ainda cruza 0,05 em alguns dias por acaso; ele só volta a cruzar depois. Parar no primeiro cruzamento significa pegá-lo de passagem, e o nível de confiança que você achava que tinha se foi.

O tamanho do efeito surpreende. A 95% de confiança, um teste lido uma vez no fim engana você cerca de uma vez em vinte, que é o acordo que você assinou. Leia o mesmo teste todo dia por quatro semanas e pare no primeiro dia verde, e o simulador costuma mostrar um vencedor falso em um quarto ou mais dos testes em que nada mudou. O texto original do Evan Miller colocou isso em mais de 20% para quem espia diariamente; o Optimizely reconstruiu o seu motor de estatística em 2015 porque a taxa de falsos positivos dos clientes tinha passado disso. Conferir toda semana em vez de todo dia reduz o estrago mais ou menos pela metade, mas não o elimina.

A simulação aqui é honesta sobre o que é: cada teste sorteia conversões na taxa verdadeira para os dois braços, roda o teste z comum para duas proporções a cada olhada sobre tudo o que foi coletado até ali, e registra onde quem espia pararia. Cada trajetória no gráfico é um teste; cada ponto é uma manhã em que alguém teria anunciado um resultado. Coloque o aumento real em +10% para ver a outra metade da história, em que quem espia pega um efeito real cedo mas com um aumento exagerado, e teria "vencido" com o mesmo entusiasmo se o efeito fosse zero.

O que a simulação mostra

  • O valor-p é um passeio aleatório. Sob a hipótese nula ele tem distribuição uniforme em qualquer olhada isolada, o que significa que em qualquer manhã há 5% de chance de ele estar abaixo de 0,05. Ao longo de vinte e oito manhãs, essas chances se acumulam.
  • A taxa de falsos positivos depende de quantas vezes você olha, não de quanto tempo o teste roda. Um teste de quatro semanas lido semanalmente engana menos do que um teste de duas semanas lido diariamente.
  • Paradas precoces exageram o aumento. Quando quem espia para em um dia de sorte, o aumento observado naquele dia é, por definição, incomumente grande. Vencedores colocados no ar que "murcharam" depois do lançamento muitas vezes eram isso.
  • A solução é disciplina ou um teste diferente. Disciplina: fixe o tamanho da amostra e a data final com antecedência e leia uma vez. Um teste diferente: métodos sequenciais, como os valores-p sempre válidos que Optimizely, Statsig e Eppo usam, são feitos para serem lidos continuamente, ao custo de uma amostra maior.
  • Painéis bayesianos não são imunes. Uma probabilidade de ser o melhor conferida todo dia e acionada em um limiar tem o mesmo problema com outra fantasia.

Como usar o simulador

  1. Informe a sua taxa de conversão e os visitantes por dia

    A simulação sorteia conversões na sua taxa real, então o vaivém do valor-p bate com o ruído que você veria de verdade.

  2. Defina a duração planejada e a frequência com que você olha

    Todo dia, a cada três dias ou toda semana. A distância entre a taxa de quem espia e a taxa honesta é o preço desse hábito.

  3. Mantenha o aumento real em nenhum

    Isso faz de cada teste um teste A/A: qualquer vencedor é alarme falso por construção. Mude para +10% ou +30% depois para ver quem espia diante de um efeito real.

  4. Leia os dois números grandes

    A taxa de quem espia é com que frequência quem confere todo dia declarou um vencedor. A taxa da data final deveria ficar perto do alfa que você escolheu; se ficar, o teste honesto está fazendo o que prometeu.

  5. Rode de novo

    Cada rodada sorteia testes aleatórios novos. As taxas se movem um pouco; a distância entre elas, não.

Taxas típicas de falso positivo em testes A/A

A 95% de confiança, uma leitura honesta no fim engana cerca de 5% das vezes. Números aproximados da simulação e da literatura para quem espia e para na primeira olhada significativa.

Com que frequência você olhaOlhadas em 4 semanasVencedores falsos
Uma vez, no fim1cerca de 5%
Toda semana4cerca de 10 a 13%
A cada 3 dias9 a 10cerca de 15 a 20%
Todo dia28cerca de 25 a 30%
Todo dia por 12 semanas84mais de 35%

Três hábitos, simulados

Quem confere todo dia

5% de conversão, 1.000 visitantes por dia, 28 dias, conferido toda manhã. Na nossa rodada: quem espia declarou um vencedor em cerca de 28% de 2.000 testes A/A; lendo uma vez no fim, 4,5%.

Seis vezes a taxa de alarme falso, em um teste que parecia cuidadoso porque alguém estava olhando todo dia. Metade desses "vencedores" coroou B e metade coroou A, porque não havia nada para encontrar.

Quem confere toda semana

Mesmo tráfego, mesma duração, conferido uma vez por semana. Na nossa rodada: cerca de 12% para quem espia contra 5% no fim.

Olhar quatro vezes em vez de vinte e oito ajuda bastante e ainda assim mais que dobra a taxa prometida. Não existe número de olhadas além de uma que mantenha a promessa.

Um aumento real de +10%

Coloque o aumento real de B em +10% no mesmo tráfego. O teste honesto aos 28 dias tem poder limitado para um aumento tão pequeno neste tráfego; quem espia para cedo com mais frequência, nos dias de sorte.

Este é o caso sedutor: quem espia parece encontrar as coisas mais rápido. Mas os dias em que ele para são os dias em que o aumento parecia maior, então a estimativa colocada no ar está inflada, e o mesmo hábito teria encontrado um "vencedor" com o aumento em zero.

Erros de quem espia

  • Parar na primeira manhã significativa. Esta página inteira é sobre isso. O nível de confiança só significa o que diz se você lê o resultado uma vez.
  • Estender um teste que está "quase lá". Decidir rodar mais tempo porque o resultado está quase significativo é espiar ao contrário, e infla a taxa de falsos positivos do mesmo jeito.
  • Conferir todo dia "só para garantir que nada quebrou". Vigiar bugs é ótimo; vigiar o valor-p, não. Olhe a divisão de tráfego e as taxas de erro, não o aumento, até a data final.
  • Acreditar que um painel bayesiano torna o espiar seguro. Agir sobre um limiar de probabilidade que você confere todo dia tem a mesma inflação.
  • Reportar o aumento do dia em que você parou. Se precisar parar cedo, reporte o intervalo, e espere que o aumento verdadeiro seja menor que a estimativa pontual.

Perguntas frequentes sobre espiar

O que é o problema do peeking em testes A/B?
Ler um teste de horizonte fixo repetidamente e parar na primeira vez em que ele parece significativo. Como o valor-p flutua enquanto os dados chegam, cada olhada é mais uma chance de cruzar o limiar por sorte. Um teste lido todo dia por um mês a 95% de confiança produz um vencedor falso em mais ou menos um quarto das vezes quando nada mudou, em vez dos 5% que o nível de confiança promete.
É errado olhar o meu teste antes de ele terminar?
Olhar tudo bem; agir é o problema. Confira se o tráfego está dividindo por igual, se as duas variantes carregam e se as conversões estão sendo registradas. Não leia o aumento nem a confiança, e não deixe o que você viu mudar a data final em nenhuma direção.
Como faço teste A/B se quero conferir continuamente?
Use um método sequencial. Valores-p sempre válidos, desenhos sequenciais em grupo e afins são feitos para serem lidos a qualquer momento; pagam por isso com uma amostra maior para o mesmo poder. A maioria das plataformas modernas oferece um. Este simulador modela o teste clássico de horizonte fixo porque é o que a maioria dos cálculos em planilha e painel, incluindo as outras abas deste site, é.
Espiar importa se eu conferir toda semana?
Menos, mas sim. Quatro olhadas ao longo de quatro semanas a 95% costumam dobrar a taxa de falsos positivos. O único número de olhadas que mantém a taxa prometida é uma.
Por que o simulador usa testes A/A?
Porque com braços idênticos, todo vencedor é alarme falso por construção, então a taxa que o simulador reporta é exatamente a taxa de falsos positivos do hábito simulado. Ligar um aumento real mostra o outro lado, em que quem espia para cedo em dias de sorte e reporta um efeito inflado.
Um teste bayesiano resolve o problema do peeking?
Não por si só. Uma probabilidade bayesiana lida continuamente e acionada em um limiar fixo infla as decisões falsas do mesmo jeito, como Georgi Georgiev e outros mostraram. Métodos bayesianos com uma regra de decisão apropriada e uma priori podem se comportar bem sob monitoramento contínuo, mas "bayesiano" sozinho não é a solução.

Outras ferramentas para desenvolvedores

Ilustração das linguagens de programação do Coddy

Aprenda a programar com o Coddy

COMEÇAR