Quantos visitantes cada variante precisa antes de o teste conseguir dizer alguma coisa, e quantos dias isso dá no seu tráfego. Defina o menor aumento que vale detectar, a confiança e o poder, e leia a contagem com a fórmula logo abaixo.
Decida o tamanho da amostra antes de olhar um único resultado
Um tamanho de amostra é uma promessa que você faz a si mesmo antes de o teste começar: "vou olhar o resultado quando este número de pessoas tiver visto, e não antes." Sem ela, todo teste A/B deriva para a mesma história. A primeira semana parece promissora, na segunda o aumento encolhe, alguém pergunta se já está significativo, e o teste termina no dia em que a barra fica verde. Esta página dá o número para escrever no plano, para que a data final seja um fato e não um humor.
O cálculo é o tamanho de amostra padrão para duas proporções, o mesmo por trás da calculadora do Evan Miller e da do Optimizely, e depende de quatro coisas: a taxa base, o aumento que você quer ser capaz de detectar, o nível de confiança e o poder. Poder é o que as pessoas pulam. Com 80% de poder, um aumento real do tamanho que você nomeou é pego oito vezes em dez; um teste com metade da amostra tem bem menos que metade do poder, e é por isso que um teste subdimensionado não é "uma resposta mais grosseira", mas em geral nenhuma resposta.
A curva abaixo do resultado é a parte que vale lembrar. Os visitantes necessários crescem com o quadrado de um sobre o aumento: divida pela metade o aumento que você quer enxergar e você precisa de cerca de quatro vezes mais tráfego. Um site que confirma um aumento de 30% em duas semanas precisa de cerca de nove vezes mais tempo para confirmar um de 10%. Se o número de dias sai em meses, é a calculadora dizendo para testar algo maior, ou subir no funil para uma métrica que mais gente alcança, antes de dizer para esperar.
Do que depende o tamanho da amostra
O efeito mínimo detectável é uma decisão, não uma medida. É o menor aumento pelo qual você de fato colocaria a mudança no ar. Definir um valor baixo para deixar o teste "mais sensível" deixa o teste mais longo, não melhor.
Aumento relativo e absoluto são bichos diferentes. Um aumento relativo de 10% sobre uma base de 5% é meio ponto percentual. Esta página trabalha em termos relativos porque é assim que os resultados são reportados, e mostra a taxa alvo ao lado para você ver os dois.
Variantes extras custam mais do que a parte delas. Testar A contra B, C e D são três comparações, e a confiança tem que ser dividida entre elas. A calculadora aplica a divisão de Bonferroni e mostra o alfa que cada comparação realmente recebe.
Dias são um teto, não um piso. Mesmo quando os números dizem quatro dias, rode pelo menos uma semana inteira, de preferência duas, porque visitantes de dia útil e de fim de semana convertem diferente, e um teste só de terça-feira mede terças-feiras.
Poder de 80% significa que um vencedor real em cinco é perdido. Se perder um vencedor sai caro para você, use 90% e aceite a amostra maior.
Como dimensionar um teste A/B
1
Informe a taxa de conversão atual
Use a taxa da página ou da etapa que o teste vai mudar, medida sobre o mesmo tipo de visitante que o teste vai ver. Não use uma média do site inteiro quando está testando uma etapa do funil.
2
Escolha o menor aumento que vale detectar
Pergunte que aumento faria você colocar a mudança no ar. Esse é o seu efeito mínimo detectável. 10% relativo é uma escolha comum para uma página madura; um redesign pode justificar 20% ou mais.
3
Defina confiança e poder
95% de confiança e 80% de poder são as convenções. Aumente a confiança quando um vencedor falso sai caro para reverter; aumente o poder quando um vencedor perdido sai caro para deixar na mesa.
4
Adicione os seus visitantes por dia
Todas as variantes juntas, contando só os visitantes que vão chegar ao teste. O resultado vira dias e semanas inteiras.
5
Anote a data final
A calculadora dá o tamanho da amostra por variante. Coloque no plano do teste com a data que ele implica, e não leia resultados antes dela. A aba do simulador de espiadas mostra por quê.
Tamanho da amostra de relance
Visitantes por variante a 95% de confiança e 80% de poder, bilateral. Multiplique por dois para um teste de dois braços.
Taxa base
Aumento de +5%
Aumento de +10%
Aumento de +20%
Aumento de +50%
1%
cerca de 637.000
cerca de 163.000
cerca de 42.700
cerca de 7.800
3%
cerca de 208.000
cerca de 53.200
cerca de 13.900
cerca de 2.500
5%
cerca de 122.000
cerca de 31.200
cerca de 8.200
cerca de 1.500
10%
cerca de 57.800
cerca de 14.800
cerca de 3.800
cerca de 690
20%
cerca de 25.600
cerca de 6.500
cerca de 1.700
cerca de 290
Exemplos resolvidos
Uma página de cadastro a 5%, buscando +10%
Base 5%, efeito mínimo detectável 10% (alvo 5,5%), 95% de confiança, 80% de poder, bilateral. Resultado: cerca de 31.000 visitantes por variante, 62.000 no total.
Com 1.000 visitantes por dia são 62 dias, ou seja, nove semanas inteiras. Muitos times chamariam isso de longo demais e ou testariam uma mudança mais ousada ou aceitariam que esta página precisa de um aumento de 20% ou mais para ser testável em duas semanas.
Uma etapa de checkout a 3%, buscando +20%
Base 3%, efeito mínimo detectável 20% (alvo 3,6%). Resultado: cerca de 13.900 visitantes por variante.
Bases mais baixas precisam de mais visitantes para o mesmo aumento relativo, porque há menos conversões para contar. Um aumento relativo de 20% aqui são só 0,6 ponto percentual, e o teste precisa distinguir 3,0% de 3,6%.
Três variantes contra um controle
Base 5%, aumento de 10%, quatro variantes incluindo o controle. O alfa por comparação vira 0,05 / 3, e a amostra por variante cresce cerca de um terço; o total é quatro vezes o número por variante.
Adicionar variantes é o jeito mais rápido de transformar um teste de duas semanas em um de dois meses. Teste uma ideia forte contra o controle; rode a próxima ideia depois.
Erros de tamanho de amostra
Dimensionar o teste depois de ver resultados iniciais. O aumento que por acaso você observa no terceiro dia não é o efeito mínimo detectável; é ruído com opinião.
Usar um aumento absoluto onde se queria um relativo. Um "aumento de 10%" sobre uma base de 2% é ou 2,2% ou 12%, e os tamanhos de amostra diferem por um fator de centenas.
Parar no tamanho da amostra quando o resultado não é significativo e chamar de derrota. Chegar ao tamanho da amostra significa que o teste consegue detectar o efeito que você nomeou. Não diz nada sobre efeitos menores.
Contar visualizações de página como visitantes. A fórmula assume que cada unidade é um visitante independente com um desfecho; visualizações repetidas inflam a contagem e a confiança.
Terminar em uma semana parcial. Se o tamanho da amostra é atingido numa quinta-feira, rode até o domingo seguinte; a mistura de dias da semana muda as taxas de conversão mais do que a maioria das mudanças testadas.
Perguntas frequentes sobre tamanho de amostra
Por quanto tempo devo rodar um teste A/B?
Até cada variante atingir o tamanho de amostra para o aumento que você quer detectar, e por pelo menos uma semana inteira, de preferência duas. Informe os seus visitantes por dia acima e a calculadora transforma o tamanho da amostra em dias e semanas inteiras. Rodar mais tempo do que o necessário é um desperdício pequeno; parar cedo porque o resultado parece bom é como a maioria dos vencedores falsos é declarada.
O que é o efeito mínimo detectável?
O menor aumento que o teste foi desenhado para pegar com confiabilidade, escolhido antes do teste. Em geral é expresso como uma mudança relativa, então um MDE de 10% sobre uma base de 4% significa que o teste consegue distinguir 4,0% de 4,4%. MDEs menores precisam de dramaticamente mais visitantes: dividir o MDE pela metade quadruplica a amostra, mais ou menos.
O que significa 80% de poder?
Que, se o aumento verdadeiro for exatamente do tamanho que você nomeou, um teste deste tamanho sai significativo 80% das vezes. Nos outros 20% ele perde um vencedor real. Poder é a imagem espelhada da confiança: a confiança limita alarmes falsos, o poder limita vencedores perdidos.
Por que uma taxa de conversão mais baixa precisa de mais visitantes?
Porque o teste conta conversões, não visitantes. Com uma taxa de 1%, 10.000 visitantes dão 100 eventos para comparar; com 10%, dão 1.000. O mesmo aumento relativo é muito mais fácil de enxergar no segundo caso. É por isso que testar uma métrica mais acima no funil, que mais visitantes alcançam, muitas vezes é o único jeito de um site pequeno conseguir testar.
Posso rodar mais de uma variante?
Sim, e a calculadora dimensiona corretamente, mas cada variante extra é mais uma comparação contra o controle, e a confiança precisa ser compartilhada entre elas. Quatro variantes a 95% sem correção dão 14% de chance de pelo menos um vencedor falso. A calculadora divide o alfa entre as comparações, e é por isso que o número por variante cresce.
Isso funciona para receita ou ticket médio?
Não, esta página dimensiona um teste sobre uma taxa de conversão. Métricas contínuas como receita por visitante precisam da variância da métrica, que costuma ser muito maior que a de uma proporção, e os tamanhos de amostra são proporcionalmente maiores. Para elas você precisa da sua própria variância histórica e de um cálculo baseado em teste t.