Dos mil tests en los que A y B son la misma página, corridos con tu tráfico. Mira cuántos habría llamado ganador alguien que revisa a diario, y con cuántos de esos mismos tests se engaña quien espera a la fecha de fin.
El hábito más caro del A/B testing, simulado con tus números
Este es el hábito. Arrancas un test, y cada mañana abres el panel. La barra sube poco a poco, baja, vuelve a subir, y un martes cruza el 95%. Lo das por bueno, lanzas el ganador y pasas a otra cosa. El problema es que un valor p deambula. En un test en el que las dos variantes son idénticas, el valor p sigue cruzando 0.05 algunos días por azar; simplemente vuelve a cruzar después. Parar en el primer cruce significa cazarlo de paso, y el nivel de confianza que creías tener ya no existe.
El tamaño del efecto sorprende a la gente. Al 95% de confianza, un test leído una vez al final te engaña más o menos una de cada veinte veces, que es el trato que firmaste. Lee el mismo test cada día durante cuatro semanas y para el primer día verde, y el simulador suele mostrar un falso ganador en un cuarto o más de los tests en los que nada cambió. El texto original de Evan Miller lo situaba por encima del 20% para quien mira a diario; Optimizely reconstruyó su motor estadístico en 2015 porque la tasa de falsos positivos de sus clientes había superado esa cifra. Revisar semanalmente en vez de a diario reduce el daño más o menos a la mitad, pero no lo elimina.
La simulación de aquí es honesta sobre lo que es: cada test extrae conversiones a la tasa verdadera para ambos brazos, ejecuta la prueba z ordinaria de dos proporciones en cada mirada sobre todo lo recogido hasta el momento, y registra dónde pararía quien mira. Cada trazo del gráfico es un test; cada punto es una mañana en la que alguien habría anunciado un resultado. Pon el lift real en +10% para ver la otra mitad de la historia, donde quien mira caza un efecto real pronto pero con un lift exagerado, y habría "ganado" con el mismo entusiasmo si el efecto hubiera sido cero.
Lo que muestra la simulación
El valor p es un paseo aleatorio. Bajo la nula se distribuye uniformemente en cualquier mirada aislada, lo que significa que cualquier mañana hay un 5% de probabilidad de que esté por debajo de 0.05. A lo largo de veintiocho mañanas esas probabilidades se acumulan.
La tasa de falsos positivos depende de cuántas veces miras, no de cuánto dura el test. Un test de cuatro semanas leído cada semana engaña menos que uno de dos semanas leído a diario.
Las paradas tempranas exageran el lift. Cuando quien mira para en un día de suerte, el lift observado ese día es por definición inusualmente grande. Los ganadores lanzados que "se desvanecieron" tras el lanzamiento eran a menudo esto.
La solución es o disciplina o un test distinto. Disciplina: fija el tamaño de muestra y la fecha de fin por adelantado y lee una vez. Un test distinto: los métodos secuenciales, como los valores p siempre válidos que usan Optimizely, Statsig y Eppo, están hechos para leerse continuamente a cambio de más tamaño de muestra.
Los paneles bayesianos no son inmunes. Una probabilidad de ser la mejor que se revisa a diario y sobre la que se actúa en un umbral tiene el mismo problema con otro disfraz.
Cómo usar el simulador
1
Introduce tu tasa de conversión y visitantes diarios
La simulación extrae conversiones a tu tasa real, así que el deambular del valor p coincide con el ruido que verías de verdad.
2
Fija la duración prevista y cada cuánto miras
A diario, cada tres días o cada semana. La brecha entre la tasa de quien mira y la tasa honesta es el precio de ese hábito.
3
Deja el lift real en ninguno
Eso convierte cada test en un test A/A: cualquier ganador es una falsa alarma por construcción. Cambia después a +10% o +30% para ver a quien mira con un efecto real.
4
Lee los dos números grandes
La tasa de quien mira es con qué frecuencia el que revisa a diario declaró un ganador. La tasa de fecha de fin debería estar cerca del alfa que elegiste; si lo está, el test honesto está cumpliendo lo prometido.
5
Córrelo otra vez
Cada tanda extrae tests aleatorios nuevos. Las tasas se mueven un poco; la brecha no.
Tasas típicas de falsos positivos en tests A/A
Al 95% de confianza, una lectura honesta al final se engaña alrededor del 5% de las veces. Cifras aproximadas de la simulación y de la literatura para quien mira y para en la primera mirada significativa.
Cada cuánto miras
Miradas en 4 semanas
Falsos ganadores
Una vez, al final
1
alrededor del 5%
Cada semana
4
alrededor del 10 al 13%
Cada 3 días
9 a 10
alrededor del 15 al 20%
A diario
28
alrededor del 25 al 30%
A diario durante 12 semanas
84
más del 35%
Tres hábitos, simulados
El que revisa a diario
5% de conversión, 1,000 visitantes al día, 28 días, revisado cada mañana. En nuestra tanda: quien mira declaró un ganador en alrededor del 28% de 2,000 tests A/A; leyendo una vez al final, 4.5%.
Seis veces la tasa de falsas alarmas, para un test que parecía cuidadoso porque alguien lo vigilaba cada día. La mitad de esos "ganadores" coronaron a B y la otra mitad a A, porque no había nada que encontrar.
El que revisa cada semana
Mismo tráfico, misma duración, revisado una vez a la semana. En nuestra tanda: alrededor del 12% para quien mira frente al 5% al final.
Mirar cuatro veces en vez de veintiocho ayuda mucho y aun así más que duplica la tasa prometida. No hay ningún número de miradas salvo una que mantenga la promesa.
Un lift real del +10%
Pon el lift real de B en +10% con el mismo tráfico. El test honesto a 28 días tiene poca potencia para un lift tan pequeño con este tráfico; quien mira para antes más a menudo, en los días de suerte.
Este es el caso seductor: quien mira parece encontrar cosas más rápido. Pero los días en que para son los días en que el lift parecía mayor, así que la estimación lanzada está inflada, y el mismo hábito habría encontrado un "ganador" con el lift puesto a cero.
Errores al mirar
Parar en la primera mañana significativa. Esta es toda la página. El nivel de confianza solo significa lo que dice si lees el resultado una vez.
Alargar un test que está "a punto". Decidir correr más tiempo porque el resultado es casi significativo es mirar al revés, e infla la tasa de falsos positivos de la misma manera.
Revisar a diario "solo para asegurarse de que nada está roto". Vigilar bugs está bien; vigilar el valor p, no. Mira el reparto de tráfico y las tasas de error, no el lift, hasta la fecha de fin.
Creer que un panel bayesiano hace seguro mirar. Actuar sobre un umbral de probabilidad que revisas a diario tiene la misma inflación.
Reportar el lift del día en que paraste. Si tienes que parar antes, reporta el intervalo, y espera que el lift verdadero sea menor que la estimación puntual.
Preguntas frecuentes sobre mirar los resultados
¿Qué es el problema de mirar (peeking) en A/B testing?
Leer un test de horizonte fijo repetidamente y parar la primera vez que parece significativo. Como el valor p fluctúa mientras entran datos, cada mirada es otra oportunidad de cruzar el umbral por suerte. Un test leído a diario durante un mes al 95% de confianza produce un falso ganador más o menos una de cada cuatro veces cuando nada cambió, en vez del 5% que promete el nivel de confianza.
¿Está mal mirar mi test antes de que termine?
Mirar está bien; actuar es el problema. Comprueba que el tráfico se reparte por igual, que ambas variantes cargan y que las conversiones se están registrando. No leas el lift ni la confianza, y no dejes que lo que viste cambie la fecha de fin en ninguna dirección.
¿Cómo hago test A/B si quiero revisar continuamente?
Usa un método secuencial. Los valores p siempre válidos, los diseños secuenciales por grupos y similares están hechos para leerse en cualquier momento; lo pagan con un tamaño de muestra mayor para la misma potencia. La mayoría de las plataformas modernas ofrecen alguno. Este simulador modela el test clásico de horizonte fijo porque eso es lo que son la mayoría de los cálculos en hojas de cálculo y paneles, incluidas las otras pestañas de este sitio.
¿Importa mirar si reviso cada semana?
Menos, pero sí. Cuatro miradas en cuatro semanas al 95% suelen duplicar la tasa de falsos positivos. El único número de miradas que mantiene la tasa prometida es uno.
¿Por qué el simulador usa tests A/A?
Porque con brazos idénticos, cada ganador es una falsa alarma por construcción, así que la tasa que reporta el simulador es exactamente la tasa de falsos positivos del hábito simulado. Activar un lift real muestra la otra cara, donde quien mira para antes en días de suerte y reporta un efecto inflado.
¿Un test bayesiano resuelve el problema de mirar?
Por sí solo no. Una probabilidad bayesiana leída continuamente y sobre la que se actúa en un umbral fijo infla las decisiones falsas de la misma manera, como han mostrado Georgi Georgiev y otros. Los métodos bayesianos con una regla de decisión adecuada y un prior pueden comportarse bien bajo monitorización continua, pero "bayesiano" a secas no es la solución.