Menu

Calculadora de Test A/B

Escribe los visitantes y las conversiones de cada variante. Recibes el veredicto en una frase, el valor p con su desarrollo, el intervalo, la probabilidad bayesiana de que B sea mejor, una comprobación de que el reparto de tráfico no está roto, y el menor lift que este test podría haber visto jamás.

Por Nethanel Bar, Co-founder & CEO

Última actualización

¿Listo para aprender a programar de verdad?

Coddy te enseña escribiendo código real en tu navegador: lecciones interactivas, feedback al instante y ayuda de IA cuando te atascas.

Lo que esta calculadora te dice y las demás no

Toda calculadora de test A/B imprime un valor p. La mayoría se queda ahí, y así es como los fundadores acaban mirando un 87% de confianza sin saber qué significa. Esta responde a las preguntas que de verdad deciden qué haces después. ¿Es la diferencia mayor de lo que produciría el azar? ¿Cuán grande podría ser el lift verdadero, en el peor y en el mejor caso? Si el test salió "no significativo", ¿podría haber encontrado algo con este tamaño de muestra? ¿Y el reparto de tráfico está sano, o estás comparando dos grupos que nunca fueron iguales?

Ejecuta la prueba z estándar de dos proporciones, la misma que usan el motor clásico de Optimizely, el modo frecuentista de VWO y cualquier libro de estadística, y muestra cada línea de la aritmética: la tasa combinada, el error estándar, la puntuación z y el área de la cola. Al lado está la respuesta bayesiana, la probabilidad de que la tasa verdadera de B esté por encima de la de A, porque "hay un 91% de probabilidad de que B sea mejor" es la frase que la mayoría esperaba que el valor p le diera, y es un número distinto.

La construimos después de mirar nuestro propio panel. Coddy ha corrido unos veinte experimentos con nombre, diez de ellos tests de precios por país sobre porciones pequeñas de tráfico, y nuestra herramienta interna mostraba una barra de confianza con las palabras "Sigue corriendo" por debajo del 95%. Eso es parada opcional con cara amable. Las tres pestañas junto a esta, tamaño de muestra, la prueba de realidad y el simulador de miradas, existen porque una calculadora que solo reporta significancia es una calculadora que te ayuda a engañarte más rápido.

Lo que hay que saber antes de fiarse del número

  • "No significativo" no significa "sin diferencia". Significa que los datos no lo pueden decir. La casilla del menor lift que este test podía ver es la lectura honesta: si tu lift observado está por debajo, el test nunca iba a responder.
  • El valor p no es la probabilidad de que te equivoques. Es la probabilidad de ver una brecha así de grande si las dos variantes fueran idénticas. Cuán probable es que el ganador sea real depende también de con qué frecuencia funcionan tus ideas, y la pestaña de prueba de realidad lo convierte en un número.
  • Parar el primer día que la barra se pone verde es el hábito más caro del A/B testing. Mirar a diario y parar pronto convierte una tasa de falsos positivos del 5% en un 20% o más. El simulador de miradas te lo enseña pasando con tu propio tráfico.
  • Un reparto roto lo envenena todo. Si planeaste 50/50 y te salió 46/54, algo está desviando usuarios antes de que lleguen al test: una capa de caché, un filtro de bots, una redirección. La calculadora ejecuta esa comprobación primero y se niega a dar un veredicto mientras falle.
  • Por debajo de unas 25 conversiones por brazo, la aproximación normal que hay detrás de la prueba z es un boceto, no una medida. La calculadora lo dice en vez de imprimir tres decimales de falsa precisión.

Cómo usar la calculadora de test A/B

  1. Introduce visitantes y conversiones de A y B

    Los visitantes son las personas asignadas a esa variante, no las páginas vistas. Las conversiones son las que hicieron lo que mides: registrarse, pagar, hacer clic. Ambas deben contarse de la misma manera en los dos brazos.

  2. Elige la confianza y la hipótesis

    95% a dos colas es la opción por defecto y la honesta cuando B podría ser mejor o peor. Una cola es solo para cuando una B peor se ignoraría exactamente igual que ningún cambio, lo que es más raro de lo que la gente cree.

  3. Lee el veredicto, luego el intervalo

    El banner dice lo que los números respaldan. La casilla del lift relativo muestra el intervalo: el efecto verdadero probablemente está en cualquier punto de su interior, y el extremo bajo es el número con el que planificar, no la estimación puntual.

  4. Revisa los dos avisos

    Si el reparto está marcado, arregla el test antes de leer nada más. Si el menor lift detectable es mayor que tu lift observado, el test estaba infrapotenciado: ve a la pestaña de tamaño de muestra y mira cuántos visitantes harían falta.

  5. Copia el resultado o el enlace

    Copiar resultado te da el resumen para un mensaje o un documento. Copiar enlace pone los cuatro números en la URL, para que quien lo abra vea el mismo cálculo.

Cómo leer las salidas

Qué significa cada casilla, en una línea.

CasillaQué esCómo leerla
Lift relativo(tasa B menos tasa A) dividido entre tasa AEl titular. El intervalo de al lado es el rango en el que probablemente está el lift verdadero.
Valor pProbabilidad de una brecha así de grande si A y B fueran idénticasPor debajo de 0.05 al 95% de confianza significa significativo. No es la probabilidad de que el resultado esté mal.
Confianza1 menos p, en porcentajeEl número que imprimen casi todas las herramientas. 87% no es casi 95%; es una moneda que cayó del lado equivocado de la línea.
Probabilidad de que B sea mejorProbabilidad bayesiana de que la tasa verdadera de B supere la de ALa frase que la gente quiere. 91% significa que B probablemente es mejor, no que sea un 91% mejor.
Menor lift que este test podía verEl lift relativo detectable con un 80% de potencia con estos tamaños de brazoSi tu lift observado está por debajo, "no significativo" significa "no se pudo saber".
Reparto de tráficoPorcentaje observado de visitantes en cada brazo frente al planSe marca cuando el reparto se desvía más de lo que el azar permite. Arregla el test antes de leer resultados.

Tres tests, tres lecciones distintas

El clásico "casi, casi"

A: 10,000 visitantes, 500 conversiones (5.00%). B: 10,000 visitantes, 560 conversiones (5.60%). Lift relativo +12%, p = 0.058.

No significativo al 95%, y el intervalo va de aproximadamente menos 0.4% a más 24%. La lectura honesta es "probablemente un pequeño positivo, podría ser nada". El menor lift que este test podía detectar es de alrededor del 17%, así que un efecto del 12% siempre iba a caer en la zona gris. Necesita más o menos el doble de tráfico, no otra semana de esperanza.

El reparto roto

A: 5,000 visitantes, 100 conversiones. B: 4,300 visitantes, 120 conversiones. Reparto planificado 50/50.

B parece un ganador claro con +40%. La calculadora se niega a decirlo: un reparto de 5,000 a 4,300 tiene menos de una probabilidad entre un millón de ocurrir por accidente con un 50/50. Algo está quitando usuarios de B antes de contarlos, a menudo una redirección que falla en un navegador, o un filtro de bots que trata la variante de otra manera. Sea lo que sea, los dos grupos no son comparables y el lift no significa nada.

El sitio pequeño

A: 400 visitantes, 12 conversiones (3.0%). B: 400 visitantes, 19 conversiones (4.75%). Lift relativo +58%, p = 0.20.

Un lift del 58% suena enorme, y el valor p es de alrededor de 0.19. Con 12 y 19 conversiones la calculadora avisa de pocos datos: los números oscilan tanto a este tamaño que un solo registro extra mueve la tasa un cuarto de punto. Con este tráfico el menor lift que el test podría confirmar en un mes supera el 100%. Eso no es motivo para correrlo más tiempo; es motivo para leer la pestaña de prueba de realidad.

Errores que esta calculadora está hecha para cazar

  • Leer un 90% de confianza como "probablemente bien". Al 95% la línea está en el 95%. El número por debajo significa que los datos no superaron el listón que pusiste, y mover el listón después de mirar es el error, no el número.
  • Llamar empate a un test no significativo. Un empate es un intervalo diminuto alrededor de cero. Un test no significativo con un intervalo ancho es una pregunta sin responder, y la pestaña de tamaño de muestra dice lo que costaría responderla.
  • Declarar un ganador la primera mañana que la barra se pone verde. El simulador de miradas ejecuta dos mil tests en los que nada cambió y muestra cuántos habría lanzado quien mira a diario.
  • Probar cinco variantes y reportar la mejor al 95%. Cinco comparaciones al 5% cada una son un 23% de probabilidad de un ganador espurio. La pestaña de tamaño de muestra reparte el alfa por ti cuando añades variantes.
  • Comparar páginas vistas con usuarios únicos, o contar conversiones en una ventana distinta que los visitantes. La prueba z supone que cada visitante es un ensayo independiente; cualquier otra cosa infla la confianza.
  • Ignorar el reparto. Un 48/52 sobre 100,000 visitantes no es azar; es un bug, y todo resultado que venga después no es de fiar.

Preguntas frecuentes sobre la calculadora de test A/B

¿Cómo sé si mi test A/B es estadísticamente significativo?
Introduce los visitantes y las conversiones de cada variante, elige un nivel de confianza (el 95% es el estándar) y lee el veredicto. El test es significativo cuando el valor p está por debajo de 1 menos tu confianza, es decir, por debajo de 0.05 al 95%. Esta página también te da el intervalo del lift verdadero y si el test podía haber detectado el efecto que estás mirando, cosa que un valor p a secas no puede.
¿Qué significa un valor p de 0.08 para mi test?
Que si A y B convirtieran realmente a la misma tasa, una brecha al menos así de grande aparecería por azar alrededor del 8% de las veces. No es la probabilidad de que el resultado esté mal, y no es "un 92% de confianza en que B es mejor". Al 95% de confianza significa que el test no ha superado el listón; mira la casilla del menor lift detectable para ver si alguna vez podría haberlo hecho.
¿Basta con un 90% de confianza?
Puede bastar, si decidiste el 90% antes de empezar el test y aceptas una tasa de falsos positivos de uno de cada diez. Lo que nunca basta es correr al 95%, ver un 91% y decidir que el 90% era el umbral de verdad desde el principio. El nivel de confianza es una promesa sobre con qué frecuencia estás dispuesto a que te engañen; cambiarlo después de mirar rompe la promesa.
¿Cuántas conversiones necesito por variante?
No hay un número mágico, pero por debajo de unas 25 conversiones por brazo la prueba z es un boceto tosco, y la mayoría de los tests reales necesitan cientos. El número que importa es el lift que quieres detectar: con una tasa base del 5%, ver un lift relativo del 10% al 95% de confianza y 80% de potencia requiere unos 31,000 visitantes por variante, alrededor de 1,550 conversiones cada una. La pestaña de tamaño de muestra lo calcula para tus propias tasas.
¿Qué diferencia hay entre el valor p frecuentista y la probabilidad bayesiana de que B sea mejor?
El valor p pregunta "¿cuán sorprendente es esta brecha si nada cambió?" y da un sí o un no en un umbral. El número bayesiano pregunta "dado lo que vi, ¿cuán probable es que la tasa verdadera de B esté por encima de la de A?" y da una probabilidad. Con los mismos datos suelen coincidir en la dirección: un p de 0.05 queda cerca de un 97% de probabilidad de que B sea mejor en una prueba a dos colas. Esta página muestra ambos porque la frase bayesiana es la que la gente quiere decir cuando dice "confianza", y el valor p es el que imprime su herramienta.
¿Por qué la calculadora se niega a dar un veredicto cuando el reparto está desviado?
Porque un desajuste en la proporción de la muestra significa que los dos grupos no se asignaron al azar, y la aleatorización es la razón entera por la que un test A/B funciona. Si planeaste 50/50 y el reparto observado tiene menos de una probabilidad entre mil de surgir por suerte, algún mecanismo está decidiendo quién cae en cada brazo, y podría estar correlacionado con la conversión. El lift que ves podría ser ese mecanismo, no tu cambio.
¿Puedo usar esta calculadora para ingresos por visitante o valor medio del pedido?
No. Esta página contrasta una proporción: cada visitante convirtió o no. Los ingresos por visitante son una métrica continua y muy asimétrica y necesitan una prueba t o un bootstrap sobre los importes por usuario, lo que requiere los datos brutos en vez de cuatro totales. La calculadora de prueba t de las calculadoras de matemáticas de Coddy hace la comparación de medias una vez que tienes los valores por usuario.
¿De dónde sale el menor lift detectable?
De la misma fórmula que la calculadora de tamaño de muestra, corrida al revés. Dados tus tamaños de brazo y la tasa de A, encuentra el lift relativo que el 80% de los tests de este tamaño detectarían a tu nivel de confianza. Si el lift que observaste está por debajo, tu test estaba infrapotenciado para ese efecto, y "no significativo" no dice casi nada sobre si el cambio funcionó.

Otras herramientas para desarrolladores

Ilustración de los lenguajes de programación de Coddy

Aprende a programar con Coddy

COMENZAR