Menu

Calculadora de Teste A/B

Digite os visitantes e as conversões de cada variante. Você recebe o veredito em uma frase, o valor-p com o cálculo aberto, o intervalo, a chance bayesiana de B ser melhor, uma checagem de que a divisão de tráfego não está quebrada e o menor aumento que este teste conseguiria enxergar.

Por Nethanel Bar, Co-founder & CEO

Última atualização

Pronto para aprender a programar de verdade?

A Coddy ensina você escrevendo código de verdade no navegador: lições interativas, feedback instantâneo e ajuda de IA quando você trava.

O que esta calculadora diz e as outras não

Toda calculadora de teste A/B imprime um valor-p. A maioria para por aí, e é assim que fundadores acabam encarando 87% de confiança sem saber o que isso significa. Esta responde às perguntas que de fato decidem o que você faz depois. A diferença é maior do que o acaso produziria? Qual poderia ser o aumento verdadeiro, no pior e no melhor caso? Se o teste deu "não significativo", ele tinha alguma chance de encontrar algo com esse tamanho de amostra? E a própria divisão de tráfego está saudável, ou você está comparando dois grupos que nunca foram iguais?

Ela roda o teste z padrão para duas proporções, o mesmo usado pelo motor clássico do Optimizely, pelo modo frequentista do VWO e por todo livro de estatística, e mostra cada linha da aritmética: a taxa combinada, o erro padrão, o escore z e a área da cauda. Ao lado fica a resposta bayesiana, a probabilidade de a taxa verdadeira de B estar acima da de A, porque "há 91% de chance de B ser melhor" é a frase que a maioria esperava que o valor-p entregasse, e é um número diferente.

Construímos esta página depois de olhar para o nosso próprio painel. A Coddy rodou cerca de vinte experimentos nomeados, dez deles testes de preço por país em fatias pequenas de tráfego, e a nossa ferramenta interna mostrava uma barra de confiança com as palavras "Continue rodando" abaixo de 95%. Isso é parada opcional com cara simpática. As três abas ao lado desta, tamanho da amostra, checagem de realidade e simulador de espiadas, existem porque uma calculadora que só reporta significância é uma calculadora que ajuda você a se enganar mais rápido.

O que saber antes de confiar no número

  • "Não significativo" não quer dizer "sem diferença". Quer dizer que os dados não conseguem responder. O bloco que mostra o menor aumento que este teste enxergaria é a leitura honesta: se o aumento observado está abaixo dele, o teste nunca ia responder.
  • O valor-p não é a chance de você estar errado. É a chance de ver uma diferença deste tamanho se as duas variantes fossem idênticas. A probabilidade de o vencedor ser real também depende de quantas vezes as suas ideias funcionam, o que a aba de checagem de realidade transforma em número.
  • Parar no primeiro dia em que a barra fica verde é o hábito mais caro dos testes A/B. Checar todo dia e parar cedo transforma uma taxa de falsos positivos de 5% em 20% ou mais. O simulador de espiadas mostra isso acontecendo no seu próprio tráfego.
  • Uma divisão quebrada envenena tudo. Se você planejou 50/50 e obteve 46/54, algo está desviando usuários antes de chegarem ao teste: uma camada de cache, um filtro de bots, um redirecionamento. A calculadora roda essa checagem primeiro e se recusa a dar veredito enquanto ela falha.
  • Abaixo de cerca de 25 conversões por braço, a aproximação normal por trás do teste z é um rascunho, não uma medida. A calculadora diz isso em vez de imprimir três casas decimais de precisão falsa.

Como usar a calculadora de teste A/B

  1. Informe visitantes e conversões de A e B

    Visitantes são as pessoas alocadas naquela variante, não visualizações de página. Conversões são as que fizeram o que você está medindo: cadastro, pagamento, clique. Os dois braços precisam ser contados do mesmo jeito.

  2. Escolha a confiança e a hipótese

    95% bilateral é o padrão e a escolha honesta quando B pode ser melhor ou pior. Unilateral é só para quando um B pior seria ignorado exatamente como uma ausência de mudança, o que é mais raro do que se pensa.

  3. Leia o veredito e depois o intervalo

    O banner diz o que os números sustentam. O bloco do aumento relativo mostra o intervalo: o efeito verdadeiro provavelmente está em algum ponto dentro dele, e o limite inferior é o número para planejar, não a estimativa pontual.

  4. Verifique os dois avisos

    Se a divisão for sinalizada, conserte o teste antes de ler qualquer outra coisa. Se o menor aumento detectável for maior que o aumento observado, o teste estava subdimensionado: vá para a aba de tamanho da amostra e veja quantos visitantes seriam necessários.

  5. Copie o resultado ou o link

    Copiar resultado dá o resumo para uma mensagem ou um documento. Copiar link coloca os quatro números na URL, então quem abrir vê o mesmo cálculo.

Lendo os resultados

O que cada bloco significa, em uma linha.

BlocoO que éComo ler
Aumento relativo(taxa B menos taxa A) dividido pela taxa AA manchete. O intervalo ao lado é a faixa em que o aumento verdadeiro provavelmente está.
Valor-pChance de uma diferença deste tamanho se A e B fossem idênticosAbaixo de 0,05 com 95% de confiança significa significativo. Não é a chance de o resultado estar errado.
Confiança1 menos p, em porcentagemO número que a maioria das ferramentas imprime. 87% não é quase 95%; é uma moeda do lado errado da linha.
Chance de B ser melhorProbabilidade bayesiana de a taxa verdadeira de B estar acima da de AA frase que as pessoas querem. 91% significa que B provavelmente é melhor, não que é 91% melhor.
Menor aumento que este teste enxergariaO aumento relativo detectável com 80% de poder nestes tamanhos de braçoSe o aumento observado está abaixo dele, "não significativo" quer dizer "não deu para saber".
Divisão de tráfegoParcela observada de visitantes em cada braço contra o planejadoSinalizada quando a divisão foge mais do que o acaso permite. Conserte o teste antes de ler resultados.

Três testes, três lições diferentes

O clássico quase-lá

A: 10.000 visitantes, 500 conversões (5,00%). B: 10.000 visitantes, 560 conversões (5,60%). Aumento relativo +12%, p = 0,058.

Não significativo a 95%, e o intervalo vai de cerca de menos 0,4% a mais 24%. A leitura honesta é "provavelmente um pequeno positivo, pode ser nada". O menor aumento que este teste detectaria é de cerca de 17%, então um efeito de 12% sempre ia cair na zona cinzenta. Ele precisa de mais ou menos o dobro do tráfego, não de mais uma semana de esperança.

A divisão quebrada

A: 5.000 visitantes, 100 conversões. B: 4.300 visitantes, 120 conversões. Divisão planejada 50/50.

B parece um vencedor claro com +40%. A calculadora se recusa a dizer isso: uma divisão de 5.000 para 4.300 tem menos de uma chance em um milhão de acontecer por acaso em 50/50. Algo está removendo usuários de B antes de serem contados, muitas vezes um redirecionamento que falha em um navegador, ou um filtro de bots que trata a variante de forma diferente. Seja o que for, os dois grupos não são comparáveis e o aumento não significa nada.

O site pequeno

A: 400 visitantes, 12 conversões (3,0%). B: 400 visitantes, 19 conversões (4,75%). Aumento relativo +58%, p = 0,20.

Um aumento de 58% parece enorme, e o valor-p fica em torno de 0,19. Com 12 e 19 conversões a calculadora sinaliza poucos dados: os números oscilam tanto neste tamanho que um único cadastro a mais move a taxa em um quarto de ponto. Com este tráfego, o menor aumento que o teste confirmaria em um mês passa de 100%. Isso não é motivo para rodar mais tempo; é motivo para ler a aba de checagem de realidade.

Erros que esta calculadora foi feita para pegar

  • Ler 90% de confiança como "provavelmente está bom". A 95%, a linha é 95%. O número abaixo dela significa que os dados não passaram da barra que você definiu, e mover a barra depois de olhar é o erro, não o número.
  • Chamar um teste não significativo de empate. Empate é um intervalo minúsculo em volta de zero. Um teste não significativo com um intervalo largo é uma pergunta sem resposta, e a aba de tamanho da amostra diz quanto custaria responder.
  • Declarar um vencedor na primeira manhã em que a barra fica verde. O simulador de espiadas roda dois mil testes em que nada mudou e mostra quantos alguém que espia todo dia teria colocado no ar.
  • Testar cinco variantes e reportar a melhor a 95%. Cinco comparações a 5% cada dão 23% de chance de um vencedor espúrio. A aba de tamanho da amostra divide o alfa para você quando adiciona variantes.
  • Comparar visualizações de página com usuários únicos, ou contar conversões em uma janela diferente da dos visitantes. O teste z assume que cada visitante é uma tentativa independente; qualquer outra coisa infla a confiança.
  • Ignorar a divisão. Uma divisão 48/52 em 100.000 visitantes não é acaso; é um bug, e todo resultado que vem depois dela não merece confiança.

Perguntas frequentes sobre a calculadora de teste A/B

Como sei se o meu teste A/B é estatisticamente significativo?
Informe os visitantes e as conversões de cada variante, escolha um nível de confiança (95% é o padrão) e leia o veredito. O teste é significativo quando o valor-p fica abaixo de 1 menos a sua confiança, ou seja, abaixo de 0,05 a 95%. Esta página também mostra o intervalo do aumento verdadeiro e se o teste tinha condições de detectar o efeito que você está olhando, o que um valor-p sozinho não consegue.
O que um valor-p de 0,08 significa para o meu teste?
Que, se A e B convertessem de fato na mesma taxa, uma diferença pelo menos deste tamanho apareceria por acaso cerca de 8% das vezes. Não é a probabilidade de o resultado estar errado, e não é "92% de confiança de que B é melhor". A 95% de confiança, significa que o teste não passou da barra; olhe o bloco do menor aumento detectável para ver se ele um dia conseguiria.
90% de confiança é suficiente?
Pode ser, se você decidiu 90% antes de o teste começar e aceita uma taxa de falsos positivos de um em dez. O que nunca é suficiente é rodar a 95%, ver 91% e decidir que 90% era o limite verdadeiro o tempo todo. O nível de confiança é uma promessa sobre quantas vezes você aceita ser enganado; mudá-lo depois de olhar quebra a promessa.
De quantas conversões por variante eu preciso?
Não existe número mágico, mas abaixo de cerca de 25 conversões por braço o teste z é um rascunho grosseiro, e a maioria dos testes reais precisa de centenas. O que importa é o aumento que você quer detectar: com uma base de 5%, enxergar um aumento relativo de 10% a 95% de confiança e 80% de poder exige cerca de 31.000 visitantes por variante, mais ou menos 1.550 conversões cada. A aba de tamanho da amostra calcula isso com as suas taxas.
Qual é a diferença entre o valor-p frequentista e a chance bayesiana de B ser melhor?
O valor-p pergunta "quão surpreendente é esta diferença se nada mudou?" e responde sim ou não em um limiar. O número bayesiano pergunta "dado o que eu vi, qual é a probabilidade de a taxa verdadeira de B estar acima da de A?" e responde com uma probabilidade. Nos mesmos dados eles costumam concordar na direção: um p de 0,05 fica perto de 97% de chance de B ser melhor em um teste bilateral. Esta página mostra os dois porque a frase bayesiana é o que as pessoas querem dizer com "confiança", e o valor-p é o que a ferramenta delas imprime.
Por que a calculadora se recusa a dar veredito quando a divisão está errada?
Porque um descompasso na proporção da amostra significa que os dois grupos não foram atribuídos ao acaso, e a aleatorização é a razão inteira de um teste A/B funcionar. Se você planejou 50/50 e a divisão observada tem menos de uma chance em mil de surgir por sorte, algum mecanismo está decidindo quem cai em cada braço, e ele pode estar correlacionado com a conversão. O aumento que você vê pode ser esse mecanismo, não a sua mudança.
Posso usar esta calculadora para receita por visitante ou ticket médio?
Não. Esta página testa uma proporção: cada visitante converteu ou não. Receita por visitante é uma métrica contínua e muito assimétrica, e precisa de um teste t ou de um bootstrap sobre os valores por usuário, o que exige os dados brutos e não quatro totais. A calculadora de teste t nas calculadoras de matemática da Coddy faz a comparação de médias quando você tem os valores por usuário.
De onde vem o menor aumento detectável?
Da mesma fórmula da calculadora de tamanho da amostra, rodada ao contrário. Dados os tamanhos dos braços e a taxa de A, ela encontra o aumento relativo que 80% dos testes deste tamanho pegariam no seu nível de confiança. Se o aumento observado está abaixo dele, o seu teste estava subdimensionado para esse efeito, e "não significativo" quase não carrega informação sobre a mudança ter funcionado ou não.

Outras ferramentas para desenvolvedores

Ilustração das linguagens de programação do Coddy

Aprenda a programar com o Coddy

COMEÇAR