Cuántos visitantes necesita cada variante antes de que el test pueda decir algo, y cuántos días son eso con tu tráfico. Fija el menor lift que merece detectarse, la confianza y la potencia, y lee el recuento con la fórmula debajo.
Decide el tamaño de muestra antes de mirar un solo resultado
Un tamaño de muestra es una promesa que te haces a ti mismo antes de que empiece el test: "miraré el resultado cuando lo hayan visto estas personas, y no antes". Sin ella, todo test A/B deriva hacia la misma historia. La primera semana pinta bien, la segunda el lift se encoge, alguien pregunta si ya es significativo, y el test termina el día que la barra se pone verde. Esta página te da el número para escribirlo en el plan, de modo que la fecha de fin sea un hecho y no un estado de ánimo.
El cálculo es el tamaño de muestra estándar para dos proporciones, el que hay detrás de la calculadora de Evan Miller y de la de Optimizely, y depende de cuatro cosas: la tasa base, el lift que quieres poder detectar, el nivel de confianza y la potencia. La potencia es la que la gente se salta. Con un 80% de potencia, un lift real del tamaño que nombraste se caza ocho veces de cada diez; un test con la mitad de la muestra tiene mucho menos de la mitad de la potencia, y por eso un test infrapotenciado no es "una respuesta más tosca" sino, normalmente, ninguna respuesta.
La curva bajo el resultado es la parte que merece recordarse. Los visitantes necesarios crecen con el cuadrado del inverso del lift: reduce a la mitad el lift que quieres ver y necesitas unas cuatro veces más tráfico. Un sitio que puede confirmar un lift del 30% en dos semanas necesita unas nueve veces más tiempo para confirmar uno del 10%. Si el número de días sale en meses, la calculadora te está diciendo que pruebes algo más grande, o que subas en el embudo hacia una métrica a la que llegue más gente, antes que decirte que esperes.
De qué depende el tamaño de muestra
El efecto mínimo detectable es una decisión, no una medida. Es el menor lift por el que de verdad lanzarías. Ponerlo bajo para que el test sea "más sensible" hace el test más largo, no mejor.
Los lifts relativos y absolutos son animales distintos. Un lift relativo del 10% sobre una tasa base del 5% es medio punto porcentual. Esta página trabaja en términos relativos porque así se reportan los resultados, y muestra la tasa objetivo al lado para que veas ambos.
Las variantes extra cuestan más que su parte. Probar A contra B, C y D son tres comparaciones, y la confianza hay que repartirla entre ellas. La calculadora aplica el reparto de Bonferroni y muestra el alfa que recibe de verdad cada comparación.
Los días son un techo, no un suelo. Aunque los números digan cuatro días, corre al menos una semana completa, idealmente dos, porque los visitantes entre semana y en fin de semana convierten distinto y un test de solo martes mide martes.
Una potencia del 80% significa que uno de cada cinco ganadores reales se pierde. Si perder un ganador te sale caro, usa 90% y acepta la muestra mayor.
Cómo dimensionar un test A/B
1
Introduce la tasa de conversión actual
Usa la tasa de la página o el paso que el test va a cambiar, medida sobre el mismo tipo de visitantes que verá el test. No uses una media de todo el sitio cuando estás probando un paso del embudo.
2
Elige el menor lift que merece detectarse
Pregúntate qué lift te haría lanzar el cambio. Ese es tu efecto mínimo detectable. Un 10% relativo es una elección habitual para una página madura; un rediseño podría justificar un 20% o más.
3
Fija la confianza y la potencia
95% de confianza y 80% de potencia son las convenciones. Sube la confianza cuando un falso ganador sea caro de revertir; sube la potencia cuando un ganador perdido sea caro de dejar sobre la mesa.
4
Añade tus visitantes diarios
Todas las variantes juntas, contando solo los visitantes que llegarán al test. El resultado se convierte en días y semanas completas.
5
Apunta la fecha de fin
La calculadora te da el tamaño de muestra por variante. Ponlo en el plan del test con la fecha que implica, y no leas resultados antes. La pestaña del simulador de miradas explica por qué.
Tamaño de muestra de un vistazo
Visitantes por variante al 95% de confianza y 80% de potencia, a dos colas. Multiplica por dos para un test de dos brazos.
Tasa base
Lift +5%
Lift +10%
Lift +20%
Lift +50%
1%
unos 637,000
unos 163,000
unos 42,700
unos 7,800
3%
unos 208,000
unos 53,200
unos 13,900
unos 2,500
5%
unos 122,000
unos 31,200
unos 8,200
unos 1,500
10%
unos 57,800
unos 14,800
unos 3,800
unos 690
20%
unos 25,600
unos 6,500
unos 1,700
unos 290
Ejemplos resueltos
Una página de registro al 5%, buscando un +10%
Tasa base 5%, efecto mínimo detectable 10% (objetivo 5.5%), 95% de confianza, 80% de potencia, dos colas. Resultado: unos 31,000 visitantes por variante, 62,000 en total.
Con 1,000 visitantes al día son 62 días, es decir, nueve semanas completas. Muchos equipos lo considerarían demasiado y o bien probarían un cambio más atrevido o aceptarían que esta página necesita un lift del 20% o más para ser testeable en quince días.
Un paso del checkout al 3%, buscando un +20%
Tasa base 3%, efecto mínimo detectable 20% (objetivo 3.6%). Resultado: unos 13,900 visitantes por variante.
Las tasas base más bajas necesitan más visitantes para el mismo lift relativo, porque hay menos conversiones que contar. Un lift relativo del 20% aquí son solo 0.6 puntos porcentuales, y el test tiene que distinguir 3.0% de 3.6%.
Tres variantes contra un control
Tasa base 5%, lift 10%, cuatro variantes incluido el control. El alfa por comparación pasa a 0.05 / 3, y la muestra por variante crece alrededor de un tercio; el total es cuatro veces la cifra por variante.
Añadir variantes es la forma más rápida de convertir un test de dos semanas en uno de dos meses. Prueba una idea fuerte contra el control; corre la siguiente idea después.
Errores con el tamaño de muestra
Dimensionar el test después de ver los primeros resultados. El lift que casualmente observas el día tres no es el efecto mínimo detectable; es ruido con opinión.
Usar un lift absoluto donde se quería decir uno relativo. Un "lift del 10%" sobre una tasa base del 2% es o bien 2.2% o bien 12%, y los tamaños de muestra difieren en un factor de cientos.
Parar al alcanzar el tamaño de muestra cuando el resultado no es significativo y llamarlo derrota. Alcanzar el tamaño de muestra significa que el test puede detectar el efecto que nombraste. No dice nada sobre efectos más pequeños.
Contar páginas vistas como visitantes. La fórmula supone que cada unidad es un visitante independiente con un resultado; las visitas repetidas inflan el recuento y la confianza.
Terminar en una semana a medias. Si el tamaño de muestra se alcanza un jueves, corre hasta el domingo siguiente; la mezcla de días de la semana cambia las tasas de conversión más que la mayoría de los cambios que se prueban.
Preguntas frecuentes sobre el tamaño de muestra
¿Cuánto tiempo debo correr un test A/B?
Hasta que cada variante haya alcanzado el tamaño de muestra para el lift que quieres detectar, y durante al menos una semana completa, preferiblemente dos. Introduce tus visitantes diarios arriba y la calculadora convierte el tamaño de muestra en días y semanas completas. Correr más de lo necesario es un pequeño desperdicio; parar antes porque el resultado pinta bien es como se declaran la mayoría de los falsos ganadores.
¿Qué es el efecto mínimo detectable?
El menor lift que el test está diseñado para cazar con fiabilidad, elegido antes del test. Normalmente se expresa como cambio relativo, así que un MDE del 10% sobre una tasa base del 4% significa que el test puede distinguir 4.0% de 4.4%. Los MDE más pequeños necesitan muchísimos más visitantes: reducir el MDE a la mitad más o menos cuadruplica la muestra.
¿Qué significa un 80% de potencia?
Que si el lift verdadero es exactamente del tamaño que nombraste, un test de este tamaño saldrá significativo el 80% de las veces. El otro 20% se le escapa un ganador real. La potencia es la imagen especular de la confianza: la confianza limita las falsas alarmas, la potencia limita los ganadores perdidos.
¿Por qué una tasa de conversión más baja necesita más visitantes?
Porque el test cuenta conversiones, no visitantes. Con una tasa del 1%, 10,000 visitantes te dan 100 eventos que comparar; al 10%, te dan 1,000. El mismo lift relativo es mucho más fácil de ver en el segundo caso. Por eso probar sobre una métrica más arriba en el embudo, una a la que lleguen más visitantes, es a menudo la única forma en que un sitio pequeño puede hacer tests.
¿Puedo correr más de una variante?
Sí, y la calculadora lo dimensiona correctamente, pero cada variante extra es otra comparación contra el control y la confianza hay que compartirla entre ellas. Cuatro variantes al 95% sin corrección son un 14% de probabilidad de al menos un falso ganador. La calculadora reparte el alfa entre las comparaciones, y por eso crece el número por variante.
¿Sirve esto para ingresos o valor medio del pedido?
No, esta página dimensiona un test sobre una tasa de conversión. Las métricas continuas como los ingresos por visitante necesitan la varianza de la métrica, que normalmente es mucho mayor que la de una proporción, y los tamaños de muestra son proporcionalmente mayores. Para esas necesitas tu propia varianza histórica y un cálculo basado en la prueba t.