Como sei se o meu teste A/B é estatisticamente significativo?
Informe os visitantes e as conversões de cada variante, escolha um nível de confiança (95% é o padrão) e leia o veredito. O teste é significativo quando o valor-p fica abaixo de 1 menos a sua confiança, ou seja, abaixo de 0,05 a 95%. Esta página também mostra o intervalo do aumento verdadeiro e se o teste tinha condições de detectar o efeito que você está olhando, o que um valor-p sozinho não consegue.
O que um valor-p de 0,08 significa para o meu teste?
Que, se A e B convertessem de fato na mesma taxa, uma diferença pelo menos deste tamanho apareceria por acaso cerca de 8% das vezes. Não é a probabilidade de o resultado estar errado, e não é "92% de confiança de que B é melhor". A 95% de confiança, significa que o teste não passou da barra; olhe o bloco do menor aumento detectável para ver se ele um dia conseguiria.
90% de confiança é suficiente?
Pode ser, se você decidiu 90% antes de o teste começar e aceita uma taxa de falsos positivos de um em dez. O que nunca é suficiente é rodar a 95%, ver 91% e decidir que 90% era o limite verdadeiro o tempo todo. O nível de confiança é uma promessa sobre quantas vezes você aceita ser enganado; mudá-lo depois de olhar quebra a promessa.
De quantas conversões por variante eu preciso?
Não existe número mágico, mas abaixo de cerca de 25 conversões por braço o teste z é um rascunho grosseiro, e a maioria dos testes reais precisa de centenas. O que importa é o aumento que você quer detectar: com uma base de 5%, enxergar um aumento relativo de 10% a 95% de confiança e 80% de poder exige cerca de 31.000 visitantes por variante, mais ou menos 1.550 conversões cada. A aba de tamanho da amostra calcula isso com as suas taxas.
Qual é a diferença entre o valor-p frequentista e a chance bayesiana de B ser melhor?
O valor-p pergunta "quão surpreendente é esta diferença se nada mudou?" e responde sim ou não em um limiar. O número bayesiano pergunta "dado o que eu vi, qual é a probabilidade de a taxa verdadeira de B estar acima da de A?" e responde com uma probabilidade. Nos mesmos dados eles costumam concordar na direção: um p de 0,05 fica perto de 97% de chance de B ser melhor em um teste bilateral. Esta página mostra os dois porque a frase bayesiana é o que as pessoas querem dizer com "confiança", e o valor-p é o que a ferramenta delas imprime.
Por que a calculadora se recusa a dar veredito quando a divisão está errada?
Porque um descompasso na proporção da amostra significa que os dois grupos não foram atribuídos ao acaso, e a aleatorização é a razão inteira de um teste A/B funcionar. Se você planejou 50/50 e a divisão observada tem menos de uma chance em mil de surgir por sorte, algum mecanismo está decidindo quem cai em cada braço, e ele pode estar correlacionado com a conversão. O aumento que você vê pode ser esse mecanismo, não a sua mudança.
Posso usar esta calculadora para receita por visitante ou ticket médio?
Não. Esta página testa uma proporção: cada visitante converteu ou não. Receita por visitante é uma métrica contínua e muito assimétrica, e precisa de um teste t ou de um bootstrap sobre os valores por usuário, o que exige os dados brutos e não quatro totais. A calculadora de teste t nas calculadoras de matemática da Coddy faz a comparação de médias quando você tem os valores por usuário.
De onde vem o menor aumento detectável?
Da mesma fórmula da calculadora de tamanho da amostra, rodada ao contrário. Dados os tamanhos dos braços e a taxa de A, ela encontra o aumento relativo que 80% dos testes deste tamanho pegariam no seu nível de confiança. Se o aumento observado está abaixo dele, o seu teste estava subdimensionado para esse efeito, e "não significativo" quase não carrega informação sobre a mudança ter funcionado ou não.