Menu

Calcolatrice test t

Test t a un campione, a due campioni e per dati appaiati sui tuoi dati grezzi, svolti riga per riga.

Di Nethanel Bar, Cofondatore e CEO

Ultimo aggiornamento

Vuoi risolverli senza la calcolatrice?

Il corso di matematica di Coddy insegna il metodo vero e proprio: svolgi ogni passaggio su una lavagna interattiva e ti viene detto esattamente dove un passaggio è andato storto.

Un t test chiede se una differenza è più grande del rumore

Ogni t test ha la stessa struttura. C'è una differenza che ti interessa: la media di un campione contro un valore dichiarato, le medie di due gruppi a confronto, oppure la variazione media all'interno delle coppie. C'è un errore standard: quanto oscillerebbe quella differenza da un campione all'altro, stimato dalla dispersione dei dati. La statistica t è la prima divisa per il secondo, quindi t = 3 significa che la differenza è larga tre errori standard, e la curva t con i gradi di libertà giusti trasforma questo numero in un valore p.

I tre test differiscono solo in cosa sono la differenza e l'errore standard. A un campione: la media meno il valore ipotizzato, diviso s su radice di n. Appaiato: la stessa cosa applicata alla lista delle differenze, una per coppia, ed è per questo che l'appaiamento è così potente quando ogni coppia condivide molto rumore. A due campioni: la distanza tra le medie divisa per un errore standard costruito da entrambe le dispersioni. Per due campioni la pagina usa di default la versione di Welch, che non presuppone che i due gruppi abbiano la stessa varianza ed è quella predefinita in ogni pacchetto statistico moderno; la versione di Student con varianza combinata è a un interruttore di distanza, per quando un corso la richiede.

La pagina tiene esatto ciò che si può tenere esatto. Una media di 26 viene stampata come 26 e una varianza di 32/3 come 32/3, non 10.67; l'errore standard viene mostrato come radicale, dato che è una radice quadrata; la statistica t è il primo decimale, perché dividere per una radice non lascia niente di razionale da conservare. Sotto, ogni passaggio è elencato, così puoi confrontare la tabella riassuntiva dei campioni con il tuo procedimento.

Cosa sapere sui t test

  • I gradi di libertà sono n meno 1 per un campione e per i dati appaiati, e n1 più n2 meno 2 per un test a due campioni con varianza combinata. I gradi di libertà di Welch sono una frazione calcolata dalle due varianze, e spesso non sono un numero intero.
  • L'appaiamento elimina il rumore condiviso. Le misure prima e dopo sulle stesse persone richiedono un test appaiato, mai uno a due campioni; il test a due campioni butta via l'appaiamento e di solito non trova niente.
  • Welch è la scelta sicura. Quando le due varianze sono davvero uguali le due versioni concordano; quando non lo sono, solo Welch mantiene il tasso di errore promesso.
  • L'intervallo di confidenza dice quello che il valore p non può dire: quanto è probabilmente grande la differenza. Un t significativo con un intervallo da 0.1 a 0.3 è un effetto piccolo; lo stesso t con un intervallo da 2 a 6 è un effetto grande.
  • La d di Cohen è la differenza espressa in deviazioni standard, quindi si può confrontare tra studi con scale diverse. Circa 0.2 è piccola, 0.5 media, 0.8 grande.

Come fare un t test

  1. Scegli il tipo di test

    Un campione contro una media dichiarata; due campioni indipendenti a confronto; appaiato quando ogni valore di una lista ha un partner nell'altra.

  2. Incolla i dati

    Vanno bene virgole, spazi o a capo. Per un test appaiato le due liste devono avere la stessa lunghezza ed essere nello stesso ordine.

  3. Imposta l'ipotesi e il livello

    A due code per "diverso", a una coda per una direzione fissata in anticipo. Alfa 0.05 è la convenzione.

  4. Leggi prima la tabella riassuntiva

    Controlla che medie e varianze corrispondano a quello che ti aspettavi. La maggior parte dei t test sbagliati è sbagliata perché un valore è finito nella lista sbagliata.

  5. Poi leggi t, p e l'intervallo

    Il verdetto dice se la differenza ha superato la soglia; l'intervallo dice quanto è probabilmente grande. Riportali entrambi.

I tre t test

Cosa divide cosa in ciascuno.

TestDifferenzaErrore standardGradi di libertà
Un campionex̄ − μ₀s / √nn − 1
Appaiatomedia delle differenze d̄s_d / √nn − 1
Due campioni, varianza combinatax̄₁ − x̄₂√(s²_p (1/n₁ + 1/n₂))n₁ + n₂ − 2
Due campioni, Welchx̄₁ − x̄₂√(s₁²/n₁ + s₂²/n₂)dalle due varianze, spesso non intero

Esempi svolti

Un campione contro una media dichiarata di 24

plain
20, 22, 24, 25, 26, 27, 28, 29, 30, 29 against μ₀ = 24

I dieci valori hanno media 26 e varianza campionaria 32/3. L'errore standard è la radice di 32/30, circa 1.033, quindi t vale circa 1.94 con 9 gradi di libertà e un p a due code di circa 0.085. Non significativo al 5%: una media di 26 rientra in ciò che un campione di dieci da una popolazione con media 24 produrrebbe circa una volta su dodici.

Due campioni indipendenti

plain
84, 79, 91, 88, 76, 85, 90 against 78, 81, 74, 80, 77, 83, 79

Il primo gruppo ha una media di circa 84.7, il secondo di circa 78.9. Il test di Welch dà t di circa 2.46 con circa 9 gradi di libertà e p intorno a 0.036; la versione con varianza combinata dà lo stesso t con 12 gradi di libertà e p intorno a 0.030. Significativo in entrambi i casi, e l'intervallo per la differenza va più o meno da 0.5 a 11.2.

Prima e dopo, dati appaiati

plain
72, 68, 75, 80, 66, 71 before; 75, 70, 79, 84, 69, 74 after

Ogni coppia è salita da 2 a 4 punti. Le differenze hanno media 19/6, circa 3.17, con una dispersione piccola, quindi il t appaiato è grande, circa 10.3 con 5 gradi di libertà, e p è circa 0.0001. Un test a due campioni sugli stessi numeri avrebbe trovato molto meno, perché la variabilità tra le persone sommerge la variazione dentro ciascuna.

Errori nei t test

  • Fare un test a due campioni su dati appaiati. L'appaiamento è l'informazione; buttarlo via è il modo in cui un cambiamento reale sparisce nel rumore.
  • Presumere varianze uguali senza controllare. Il test con varianza combinata è corretto solo quando le dispersioni coincidono; Welch non costa quasi niente quando coincidono e salva il test quando non coincidono.
  • Usare la formula della popolazione per la varianza. Un t test usa la varianza campionaria, dividendo per n meno 1, e la pagina fa così.
  • Leggere la significatività come grandezza. Una differenza minuscola è significativa con abbastanza dati; l'intervallo e la d di Cohen dicono se conta davvero.
  • Scegliere la coda dopo aver visto il segno. Se la domanda era "diverso", il test è a due code anche quando il risultato è andato come speravi.
  • Testare una metrica molto asimmetrica con una manciata di valori. Con n sotto circa 15 e una coda lunga, la curva t è una guida approssimativa; un test sui ranghi o un bootstrap sono l'alternativa onesta.

Domande frequenti sul t test

Quando usare un t test invece di uno z test?
Ogni volta che la deviazione standard è stimata dallo stesso campione, cioè quasi sempre. Le code più pesanti della curva t tengono conto di questa incertezza in più. Uno z test serve nel caso da manuale in cui la deviazione standard della popolazione è nota in anticipo, o per campioni molto grandi in cui le due curve coincidono.
Che differenza c'è tra t test appaiato e non appaiato?
Un test appaiato usa le differenze dentro coppie abbinate, come la stessa persona misurata due volte, così il rumore condiviso da ogni coppia si annulla. Un test non appaiato (a due campioni) confronta due gruppi separati. Usa quello appaiato ogni volta che ogni valore di una lista ha un partner naturale nell'altra; altrimenti quello a due campioni.
Meglio il t test di Welch o quello di Student?
Welch, a meno che un corso o una rivista non indichino altro. Il test di Student con varianza combinata presuppone che entrambi i gruppi abbiano la stessa varianza e dà tassi di errore sbagliati quando non è così; Welch rinuncia a quell'ipotesi e concorda con Student quando vale. Questa pagina usa Welch di default e offre la varianza combinata con un interruttore.
Come leggo i gradi di libertà del test di Welch?
I gradi di libertà di Welch derivano da una formula sulle due varianze campionarie e sulle numerosità, e di solito non sono un numero intero, per esempio 9.87. È normale; la curva t è definita per qualsiasi gl positivo. Quando le due varianze e le numerosità sono uguali si riduce a n1 più n2 meno 2.
Cosa significa l'intervallo di confidenza per la differenza?
L'insieme dei valori della differenza vera con cui i dati sono compatibili al livello scelto. Se esclude lo zero, il test è significativo all'alfa corrispondente; la sua ampiezza dice con quanta precisione è stata individuata la differenza. Riportalo accanto al valore p.
Cos'è la d di Cohen?
La differenza tra le medie divisa per la deviazione standard, quindi una dimensione dell'effetto espressa in deviazioni standard, confrontabile tra studi con scale diverse. Per convenzione 0.2 è piccola, 0.5 media e 0.8 grande, anche se cosa conta come rilevante dipende dal campo.
Posso usarlo per un test A/B?
Per un tasso di conversione no: è un confronto tra proporzioni, e la calcolatrice per test A/B nelle pagine degli strumenti lo fa con lo z test per due proporzioni. Per una metrica continua come il ricavo per utente o il tempo sulla pagina sì, se hai i valori per utente da incollare; il test di Welch a due campioni è la scelta giusta.

Altri strumenti di matematica

Illustrazione dei linguaggi di programmazione di Coddy

Impara la matematica con Coddy

INIZIA