¿Cómo sé si mi test A/B es estadísticamente significativo?
Introduce los visitantes y las conversiones de cada variante, elige un nivel de confianza (el 95% es el estándar) y lee el veredicto. El test es significativo cuando el valor p está por debajo de 1 menos tu confianza, es decir, por debajo de 0.05 al 95%. Esta página también te da el intervalo del lift verdadero y si el test podía haber detectado el efecto que estás mirando, cosa que un valor p a secas no puede.
¿Qué significa un valor p de 0.08 para mi test?
Que si A y B convirtieran realmente a la misma tasa, una brecha al menos así de grande aparecería por azar alrededor del 8% de las veces. No es la probabilidad de que el resultado esté mal, y no es "un 92% de confianza en que B es mejor". Al 95% de confianza significa que el test no ha superado el listón; mira la casilla del menor lift detectable para ver si alguna vez podría haberlo hecho.
¿Basta con un 90% de confianza?
Puede bastar, si decidiste el 90% antes de empezar el test y aceptas una tasa de falsos positivos de uno de cada diez. Lo que nunca basta es correr al 95%, ver un 91% y decidir que el 90% era el umbral de verdad desde el principio. El nivel de confianza es una promesa sobre con qué frecuencia estás dispuesto a que te engañen; cambiarlo después de mirar rompe la promesa.
¿Cuántas conversiones necesito por variante?
No hay un número mágico, pero por debajo de unas 25 conversiones por brazo la prueba z es un boceto tosco, y la mayoría de los tests reales necesitan cientos. El número que importa es el lift que quieres detectar: con una tasa base del 5%, ver un lift relativo del 10% al 95% de confianza y 80% de potencia requiere unos 31,000 visitantes por variante, alrededor de 1,550 conversiones cada una. La pestaña de tamaño de muestra lo calcula para tus propias tasas.
¿Qué diferencia hay entre el valor p frecuentista y la probabilidad bayesiana de que B sea mejor?
El valor p pregunta "¿cuán sorprendente es esta brecha si nada cambió?" y da un sí o un no en un umbral. El número bayesiano pregunta "dado lo que vi, ¿cuán probable es que la tasa verdadera de B esté por encima de la de A?" y da una probabilidad. Con los mismos datos suelen coincidir en la dirección: un p de 0.05 queda cerca de un 97% de probabilidad de que B sea mejor en una prueba a dos colas. Esta página muestra ambos porque la frase bayesiana es la que la gente quiere decir cuando dice "confianza", y el valor p es el que imprime su herramienta.
¿Por qué la calculadora se niega a dar un veredicto cuando el reparto está desviado?
Porque un desajuste en la proporción de la muestra significa que los dos grupos no se asignaron al azar, y la aleatorización es la razón entera por la que un test A/B funciona. Si planeaste 50/50 y el reparto observado tiene menos de una probabilidad entre mil de surgir por suerte, algún mecanismo está decidiendo quién cae en cada brazo, y podría estar correlacionado con la conversión. El lift que ves podría ser ese mecanismo, no tu cambio.
¿Puedo usar esta calculadora para ingresos por visitante o valor medio del pedido?
No. Esta página contrasta una proporción: cada visitante convirtió o no. Los ingresos por visitante son una métrica continua y muy asimétrica y necesitan una prueba t o un bootstrap sobre los importes por usuario, lo que requiere los datos brutos en vez de cuatro totales. La calculadora de prueba t de las calculadoras de matemáticas de Coddy hace la comparación de medias una vez que tienes los valores por usuario.
¿De dónde sale el menor lift detectable?
De la misma fórmula que la calculadora de tamaño de muestra, corrida al revés. Dados tus tamaños de brazo y la tasa de A, encuentra el lift relativo que el 80% de los tests de este tamaño detectarían a tu nivel de confianza. Si el lift que observaste está por debajo, tu test estaba infrapotenciado para ese efecto, y "no significativo" no dice casi nada sobre si el cambio funcionó.