Menu

Calculadora de prueba t

Pruebas t de una muestra, dos muestras y emparejadas sobre tus datos brutos, desarrolladas línea a línea.

Por Nethanel Bar, Cofundador y CEO

Última actualización

¿Quieres resolver esto sin la calculadora?

El curso de matemáticas de Coddy enseña el método en sí: trabajas cada paso en una pizarra interactiva y te dice exactamente dónde falló un movimiento.

Una prueba t pregunta si una diferencia es mayor que el ruido

Toda prueba t tiene la misma forma. Hay una diferencia que te importa: una media muestral frente a un valor afirmado, dos medias de grupo entre sí, o el cambio medio a lo largo de parejas. Hay un error estándar: cuánto oscilaría esa diferencia de una muestra a la siguiente, estimado a partir de la dispersión de los datos. El estadístico t es lo primero dividido entre lo segundo, así que t = 3 significa que la diferencia mide tres errores estándar, y la curva t con los grados de libertad correctos lo convierte en un valor p.

Las tres pruebas solo difieren en qué son la diferencia y el error estándar. Una muestra: la media menos el valor hipotético, entre s dividido por raíz de n. Emparejadas: lo mismo aplicado a la lista de diferencias, una por pareja, y por eso emparejar es tan potente cuando cada pareja comparte mucho ruido. Dos muestras: la distancia entre las medias sobre un error estándar construido con ambas dispersiones. Para dos muestras la página usa por defecto la versión de Welch, que no supone que los dos grupos tengan la misma varianza y es lo que trae por defecto cualquier paquete estadístico moderno; la versión combinada de Student está a un interruptor de distancia para cuando un curso la exija.

La página mantiene exacto lo que se puede mantener exacto. Una media de 26 se imprime como 26 y una varianza de 32/3 como 32/3, no como 10.67; el error estándar se muestra como radical, ya que es una raíz cuadrada; el estadístico t es el primer decimal, porque dividir entre una raíz no deja nada racional que conservar. Debajo se lista cada paso, para que la tabla resumen de las muestras se pueda cotejar con tu propio desarrollo.

Lo que hay que saber sobre las pruebas t

  • Los grados de libertad son n menos 1 para una muestra y para datos emparejados, y n1 más n2 menos 2 para una prueba de dos muestras con varianza combinada. Los gl de Welch son una fracción calculada a partir de las dos varianzas, y a menudo no son un número entero.
  • Emparejar elimina el ruido compartido. Las medidas de antes y después sobre las mismas personas deben ser una prueba emparejada, nunca de dos muestras; la prueba de dos muestras tira el emparejamiento y normalmente no encuentra nada.
  • Welch es la opción segura por defecto. Cuando las dos varianzas son realmente iguales las dos versiones coinciden; cuando no lo son, solo Welch mantiene la tasa de error prometida.
  • El intervalo de confianza dice lo que el valor p no puede: cuán grande es probablemente la diferencia. Una t significativa con un intervalo de 0.1 a 0.3 es un efecto pequeño; la misma t con un intervalo de 2 a 6 es uno grande.
  • La d de Cohen es la diferencia en unidades de desviación típica, así que se puede comparar entre estudios con escalas distintas. Alrededor de 0.2 es pequeño, 0.5 mediano, 0.8 grande.

Cómo hacer una prueba t

  1. Elige el tipo de prueba

    Una muestra frente a una media afirmada; dos muestras independientes entre sí; emparejadas cuando cada valor de una lista tiene su pareja en la otra.

  2. Pega los datos

    Valen comas, espacios o saltos de línea. Para una prueba emparejada las dos listas deben tener la misma longitud y el mismo orden.

  3. Fija la hipótesis y el nivel

    Dos colas para "distinto", una cola para una dirección fijada de antemano. Un alfa de 0.05 es la convención.

  4. Lee primero la tabla resumen

    Comprueba que las medias y varianzas coinciden con lo que esperabas. La mayoría de las pruebas t erróneas lo son porque un valor se escribió en la lista equivocada.

  5. Luego lee t, p y el intervalo

    El veredicto dice si la diferencia superó el listón; el intervalo dice cuán grande es probablemente. Presenta los dos.

Las tres pruebas t

Qué divide cada una entre qué.

PruebaDiferenciaError estándarGrados de libertad
Una muestrax̄ − μ₀s / √nn − 1
Emparejadasmedia de las diferencias d̄s_d / √nn − 1
Dos muestras, combinadax̄₁ − x̄₂√(s²_p (1/n₁ + 1/n₂))n₁ + n₂ − 2
Dos muestras, Welchx̄₁ − x̄₂√(s₁²/n₁ + s₂²/n₂)a partir de las dos varianzas, a menudo no entero

Ejemplos resueltos

Una muestra frente a una media afirmada de 24

plain
20, 22, 24, 25, 26, 27, 28, 29, 30, 29 against μ₀ = 24

Los diez valores tienen media 26 y varianza muestral 32/3. El error estándar es la raíz de 32/30, unos 1.033, así que t es aproximadamente 1.94 con 9 grados de libertad y un p a dos colas de unos 0.085. No significativo al 5%: una media de 26 entra dentro de lo que una muestra de diez de una población con media 24 produciría más o menos una vez de cada doce.

Dos muestras independientes

plain
84, 79, 91, 88, 76, 85, 90 against 78, 81, 74, 80, 77, 83, 79

El primer grupo promedia unos 84.7, el segundo unos 78.9. La prueba de Welch da una t de aproximadamente 2.46 con unos 9 grados de libertad y p alrededor de 0.036; la versión combinada da la misma t con 12 grados de libertad y p alrededor de 0.030. Significativo en ambos casos, y el intervalo para la diferencia va más o menos de 0.5 a 11.2.

Antes y después, emparejadas

plain
72, 68, 75, 80, 66, 71 before; 75, 70, 79, 84, 69, 74 after

Cada pareja subió entre 2 y 4 puntos. Las diferencias promedian 19/6, unos 3.17, con poca dispersión, así que la t emparejada es grande, alrededor de 10.3 con 5 grados de libertad, y p es de unos 0.0001. Una prueba de dos muestras sobre los mismos números habría encontrado mucho menos, porque la dispersión entre personas ahoga el cambio dentro de cada una.

Errores con la prueba t

  • Hacer una prueba de dos muestras sobre datos emparejados. El emparejamiento es la información; tirarlo es como un cambio real desaparece en el ruido.
  • Suponer varianzas iguales sin comprobarlo. La prueba combinada solo es correcta cuando las dispersiones coinciden; Welch no cuesta casi nada cuando coinciden y salva la prueba cuando no.
  • Usar la fórmula poblacional para la varianza. Una prueba t usa la varianza muestral, dividiendo entre n menos 1, y la página lo hace así.
  • Leer la significación como tamaño. Una diferencia diminuta es significativa con datos suficientes; el intervalo y la d de Cohen dicen si importa.
  • Elegir la cola después de ver el signo. Si la pregunta era "distinto", la prueba es a dos colas aunque el resultado haya salido a tu favor.
  • Contrastar una métrica muy asimétrica con un puñado de valores. Con n por debajo de 15 y una cola larga, la curva t es una guía tosca; una prueba de rangos o un bootstrap es la alternativa honesta.

Preguntas frecuentes sobre la prueba t

¿Cuándo debo usar una prueba t en vez de una prueba z?
Siempre que la desviación típica se estime con la misma muestra, que es casi siempre. Las colas más pesadas de la curva t dan cuenta de esa incertidumbre extra. Una prueba z es para el caso de libro en el que la desviación típica poblacional se conoce de antemano, o para muestras muy grandes en las que las dos curvas coinciden.
¿Qué diferencia hay entre una prueba t emparejada y una no emparejada?
Una prueba emparejada usa las diferencias dentro de parejas relacionadas, como la misma persona medida dos veces, así que el ruido compartido por cada pareja se cancela. Una prueba no emparejada (de dos muestras) compara dos grupos separados. Usa emparejadas siempre que cada valor de una lista tenga una pareja natural en la otra; si no, dos muestras.
¿Debo usar la prueba t de Welch o la de Student?
Welch, salvo que un curso o una revista indiquen otra cosa. La prueba combinada de Student supone que ambos grupos tienen la misma varianza y da tasas de error equivocadas cuando no es así; Welch prescinde de esa suposición y coincide con Student cuando se cumple. Esta página usa Welch por defecto y ofrece la combinada como interruptor.
¿Cómo leo los grados de libertad de la prueba de Welch?
Los grados de libertad de Welch salen de una fórmula sobre las dos varianzas y tamaños muestrales y normalmente no son un número entero, por ejemplo 9.87. Es normal; la curva t está definida para cualquier gl positivo. Cuando las dos varianzas y tamaños son iguales se reduce a n1 más n2 menos 2.
¿Qué significa el intervalo de confianza para la diferencia?
El rango de valores de la diferencia verdadera con los que los datos son compatibles al nivel elegido. Si excluye el cero, la prueba es significativa al alfa correspondiente; su anchura dice con cuánta precisión está acotada la diferencia. Preséntalo junto al valor p.
¿Qué es la d de Cohen?
La diferencia de medias dividida entre la desviación típica, es decir, un tamaño del efecto en unidades de desviación típica que se puede comparar entre estudios con escalas distintas. Por convención, 0.2 es pequeño, 0.5 mediano y 0.8 grande, aunque lo que cuenta como relevante depende del campo.
¿Puedo usar esto para un test A/B?
Para una tasa de conversión, no: eso es una comparación de proporciones y la calculadora de test A/B de las páginas de herramientas la hace con la prueba z para dos proporciones. Para una métrica continua como ingresos por usuario o tiempo en página, sí, si tienes los valores por usuario para pegarlos; la prueba de Welch de dos muestras es la elección correcta.

Más herramientas de matemáticas

Coddy programming languages illustration

Aprende matemáticas con Coddy

COMENZAR