Menu

Calculadora de teste t

Testes t de uma amostra, duas amostras e pareado sobre os seus dados brutos, resolvidos linha a linha.

Por Nethanel Bar, Cofundador e CEO

Última atualização

Quer resolver isso sem a calculadora?

O curso de matemática da Coddy ensina o método em si: você trabalha cada passo em um quadro interativo e descobre exatamente onde a jogada deu errado.

Um teste t pergunta se uma diferença é maior que o ruído

Todo teste t tem a mesma forma. Existe uma diferença que importa para você: uma média amostral contra um valor alegado, duas médias de grupos uma contra a outra, ou a mudança média entre pares. Existe um erro padrão: quanto essa diferença oscilaria de uma amostra para a próxima, estimado pela dispersão dos dados. A estatística t é a primeira dividida pelo segundo, então t = 3 significa que a diferença tem três erros padrão de largura, e a curva t com os graus de liberdade certos transforma isso em um valor-p.

Os três testes diferem só no que são a diferença e o erro padrão. Uma amostra: a média menos o valor hipotético, sobre s dividido pela raiz de n. Pareado: a mesma coisa aplicada à lista de diferenças, uma por par, e é por isso que parear é tão poderoso quando cada par compartilha muito ruído. Duas amostras: a distância entre as médias sobre um erro padrão construído das duas dispersões. Para duas amostras a página usa por padrão a versão de Welch, que não assume que os dois grupos têm a mesma variância e é o padrão de todo pacote estatístico moderno; a versão combinada de Student está a um clique para quando um curso exige.

A página mantém exato o que pode ser mantido. Uma média de 26 é impressa como 26 e uma variância de 32/3 como 32/3, não 10,67; o erro padrão aparece como radical, já que é uma raiz quadrada; a estatística t é o primeiro decimal, porque dividir por uma raiz não deixa nada racional para guardar. Abaixo, cada passo é listado para que a tabela de resumo das amostras possa ser conferida contra o seu próprio cálculo.

O que saber sobre testes t

  • Os graus de liberdade são n menos 1 para uma amostra e para dados pareados, e n1 mais n2 menos 2 para um teste de duas amostras combinado. Os gl de Welch são uma fração calculada a partir das duas variâncias, e muitas vezes não são um número inteiro.
  • Parear remove o ruído compartilhado. Medidas antes e depois nas mesmas pessoas devem ser um teste pareado, nunca de duas amostras; o teste de duas amostras joga fora o pareamento e em geral não encontra nada.
  • Welch é o padrão seguro. Quando as duas variâncias são iguais de fato, as duas versões concordam; quando não são, só Welch mantém a taxa de erro prometida.
  • O intervalo de confiança diz o que o valor-p não consegue: qual é o tamanho provável da diferença. Um t significativo com um intervalo de 0,1 a 0,3 é um efeito pequeno; o mesmo t com um intervalo de 2 a 6 é um efeito grande.
  • O d de Cohen é a diferença em unidades de desvio padrão, então pode ser comparado entre estudos com escalas diferentes. Cerca de 0,2 é pequeno, 0,5 médio, 0,8 grande.

Como rodar um teste t

  1. Escolha o tipo de teste

    Uma amostra contra uma média alegada; duas amostras independentes uma contra a outra; pareado quando cada valor de uma lista tem um parceiro na outra.

  2. Cole os dados

    Vírgulas, espaços ou quebras de linha funcionam. Para um teste pareado as duas listas precisam ter o mesmo tamanho e a mesma ordem.

  3. Defina a hipótese e o nível

    Bilateral para "diferente", unilateral para uma direção fixada antes. Alfa de 0,05 é a convenção.

  4. Leia a tabela de resumo primeiro

    Confira se as médias e as variâncias batem com o que você esperava. A maioria dos testes t errados está errada porque um valor foi digitado na lista errada.

  5. Depois leia t, p e o intervalo

    O veredito diz se a diferença passou da barra; o intervalo diz qual é o tamanho provável dela. Reporte os dois.

Os três testes t

O que cada um divide por o quê.

TesteDiferençaErro padrãoGraus de liberdade
Uma amostrax̄ − μ₀s / √nn − 1
Pareadomédia das diferenças d̄s_d / √nn − 1
Duas amostras, combinadox̄₁ − x̄₂√(s²_p (1/n₁ + 1/n₂))n₁ + n₂ − 2
Duas amostras, Welchx̄₁ − x̄₂√(s₁²/n₁ + s₂²/n₂)das duas variâncias, muitas vezes não inteiro

Exemplos resolvidos

Uma amostra contra uma média alegada de 24

plain
20, 22, 24, 25, 26, 27, 28, 29, 30, 29 against μ₀ = 24

Os dez valores têm média 26 e variância amostral 32/3. O erro padrão é a raiz de 32/30, cerca de 1,033, então t é cerca de 1,94 com 9 graus de liberdade e um p bilateral de cerca de 0,085. Não significativo a 5%: uma média de 26 está dentro do que uma amostra de dez de uma população com média 24 produziria cerca de uma vez em doze.

Duas amostras independentes

plain
84, 79, 91, 88, 76, 85, 90 against 78, 81, 74, 80, 77, 83, 79

O primeiro grupo tem média de cerca de 84,7, o segundo de cerca de 78,9. O teste de Welch dá t de cerca de 2,46 com cerca de 9 graus de liberdade e p em torno de 0,036; a versão combinada dá o mesmo t com 12 graus de liberdade e p em torno de 0,030. Significativo dos dois jeitos, e o intervalo para a diferença vai de mais ou menos 0,5 a 11,2.

Pareado, antes e depois

plain
72, 68, 75, 80, 66, 71 before; 75, 70, 79, 84, 69, 74 after

Todo par subiu de 2 a 4 pontos. As diferenças têm média 19/6, cerca de 3,17, com dispersão pequena, então o t pareado é grande, cerca de 10,3 com 5 graus de liberdade, e p é cerca de 0,0001. Um teste de duas amostras nos mesmos números teria encontrado muito menos, porque a dispersão entre pessoas afoga a mudança dentro de cada uma.

Erros com teste t

  • Rodar um teste de duas amostras em dados pareados. O pareamento é a informação; jogá-lo fora é como uma mudança real some no ruído.
  • Assumir variâncias iguais sem conferir. O teste combinado só está certo quando as dispersões batem; Welch custa quase nada quando batem e salva o teste quando não batem.
  • Usar a fórmula populacional para a variância. Um teste t usa a variância amostral, dividindo por n menos 1, e a página faz isso.
  • Ler significância como tamanho. Uma diferença minúscula é significativa com dados suficientes; o intervalo e o d de Cohen dizem se ela importa.
  • Escolher a cauda depois de ver o sinal. Se a pergunta era "diferente", o teste é bilateral mesmo quando o resultado foi na sua direção.
  • Testar uma métrica muito assimétrica com um punhado de valores. Com n abaixo de uns 15 e uma cauda longa, a curva t é um guia grosseiro; um teste de postos ou um bootstrap é a alternativa honesta.

Perguntas frequentes sobre teste t

Quando devo usar um teste t em vez de um teste z?
Sempre que o desvio padrão for estimado a partir da mesma amostra, o que é quase sempre. As caudas mais pesadas da curva t dão conta dessa incerteza extra. Um teste z é para o caso de livro em que o desvio padrão populacional é conhecido de antemão, ou para amostras muito grandes em que as duas curvas coincidem.
Qual é a diferença entre um teste t pareado e um não pareado?
Um teste pareado usa as diferenças dentro de pares casados, como a mesma pessoa medida duas vezes, então o ruído compartilhado por cada par se cancela. Um teste não pareado (duas amostras) compara dois grupos separados. Use pareado sempre que cada valor de uma lista tem um parceiro natural na outra; caso contrário, duas amostras.
Devo usar o teste t de Welch ou o de Student?
Welch, a menos que um curso ou um periódico especifique o contrário. O teste combinado de Student assume que os dois grupos têm a mesma variância e dá taxas de erro erradas quando não têm; Welch abandona a suposição e concorda com Student quando ela vale. Esta página usa Welch por padrão e oferece o combinado como opção.
Como leio os graus de liberdade do teste de Welch?
Os graus de liberdade de Welch vêm de uma fórmula sobre as duas variâncias e os dois tamanhos amostrais e em geral não são um número inteiro, como 9,87. Isso é normal; a curva t é definida para qualquer gl positivo. Quando as duas variâncias e os dois tamanhos são iguais, ele se reduz a n1 mais n2 menos 2.
O que significa o intervalo de confiança para a diferença?
A faixa de valores para a diferença verdadeira com a qual os dados são consistentes no nível escolhido. Se ele exclui zero, o teste é significativo no alfa correspondente; a largura diz com que precisão a diferença está determinada. Reporte-o ao lado do valor-p.
O que é o d de Cohen?
A diferença de médias dividida pelo desvio padrão, ou seja, um tamanho de efeito em unidades de desvio padrão que pode ser comparado entre estudos com escalas diferentes. Por convenção, 0,2 é pequeno, 0,5 médio e 0,8 grande, embora o que conta como relevante dependa da área.
Posso usar isto para um teste A/B?
Para uma taxa de conversão, não: isso é uma comparação de proporções, e a calculadora de teste A/B nas páginas de ferramentas faz isso com o teste z para duas proporções. Para uma métrica contínua como receita por usuário ou tempo na página, sim, se você tiver os valores por usuário para colar; o teste de Welch de duas amostras é a escolha certa.

Mais ferramentas de matemática

Coddy programming languages illustration

Aprenda matemática com a Coddy

COMEÇAR