Le cours de maths de Coddy enseigne la méthode elle-même : tu travailles chaque étape sur un tableau interactif et on te dit exactement où le mouvement a dérapé.
Un test t demande si une différence dépasse le bruit
Tous les tests t ont la même forme. Il y a une différence qui vous intéresse : une moyenne d'échantillon contre une valeur annoncée, deux moyennes de groupes l'une contre l'autre, ou le changement moyen entre paires. Il y a une erreur standard : de combien cette différence oscillerait d'un échantillon au suivant, estimée à partir de la dispersion des données. La statistique t est la première divisée par la seconde, donc t = 3 signifie que la différence fait trois erreurs standard de large, et la courbe t aux bons degrés de liberté transforme cela en valeur p.
Les trois tests ne diffèrent que par ce que sont la différence et l'erreur standard. Un échantillon : la moyenne moins la valeur supposée, sur s divisé par racine de n. Apparié : la même chose appliquée à la liste des différences, une par paire, ce qui explique la puissance de l'appariement quand chaque paire partage beaucoup de bruit. Deux échantillons : l'écart entre les moyennes sur une erreur standard construite à partir des deux dispersions. Pour deux échantillons, la page prend par défaut la version de Welch, qui ne suppose pas que les deux groupes ont la même variance et que tous les logiciels statistiques modernes prennent par défaut ; la version combinée de Student est à un bouton de distance pour quand un cours l'exige.
La page garde exact ce qui peut l'être. Une moyenne de 26 s'affiche 26 et une variance de 32/3 s'affiche 32/3, pas 10,67 ; l'erreur standard est montrée sous forme de radical, puisque c'est une racine carrée ; la statistique t est le premier décimal, parce que diviser par une racine ne laisse rien de rationnel à garder. En dessous, chaque étape est listée pour que le tableau récapitulatif des échantillons puisse être vérifié contre votre propre calcul.
À savoir sur les tests t
Les degrés de liberté sont n moins 1 pour un échantillon et pour des données appariées, et n1 plus n2 moins 2 pour un test à deux échantillons combinés. Les df de Welch sont une fraction calculée à partir des deux variances, et souvent pas un nombre entier.
L'appariement retire le bruit partagé. Des mesures avant et après sur les mêmes personnes doivent être un test apparié, jamais un test à deux échantillons ; ce dernier jette l'appariement et ne trouve généralement rien.
Welch est le choix sûr par défaut. Quand les deux variances sont vraiment égales, les deux versions concordent ; quand elles ne le sont pas, seul Welch tient le taux d'erreur promis.
L'intervalle de confiance dit ce que la valeur p ne peut pas dire : quelle taille la différence a probablement. Un t significatif avec un intervalle de 0,1 à 0,3 est un petit effet ; le même t avec un intervalle de 2 à 6 est un grand effet.
Le d de Cohen est la différence en unités d'écart type, il peut donc être comparé entre études à échelles différentes. Autour de 0,2 c'est petit, 0,5 moyen, 0,8 grand.
Comment mener un test t
1
Choisissez le type de test
Un échantillon contre une moyenne annoncée ; deux échantillons indépendants l'un contre l'autre ; apparié quand chaque valeur d'une liste a un partenaire dans l'autre.
2
Collez les données
Virgules, espaces ou retours à la ligne fonctionnent tous. Pour un test apparié, les deux listes doivent avoir la même longueur et le même ordre.
3
Fixez l'hypothèse et le seuil
Bilatéral pour « différent », unilatéral pour une direction fixée à l'avance. Un alpha de 0,05 est la convention.
4
Lisez d'abord le tableau récapitulatif
Vérifiez que les moyennes et les variances correspondent à ce que vous attendiez. La plupart des tests t faux le sont parce qu'une valeur a été saisie dans la mauvaise liste.
5
Puis lisez t, p et l'intervalle
Le verdict dit si la différence a franchi la barre ; l'intervalle dit quelle taille elle a probablement. Rapportez les deux.
Les dix valeurs ont une moyenne de 26 et une variance d'échantillon de 32/3. L'erreur standard est la racine de 32/30, environ 1,033, donc t vaut environ 1,94 avec 9 degrés de liberté et un p bilatéral d'environ 0,085. Non significatif à 5 % : une moyenne de 26 reste dans ce qu'un échantillon de dix tiré d'une population de moyenne 24 produirait environ une fois sur douze.
Le premier groupe a une moyenne d'environ 84,7, le second d'environ 78,9. Le test de Welch donne un t d'environ 2,46 sur environ 9 degrés de liberté et un p autour de 0,036 ; la version combinée donne le même t sur 12 degrés de liberté et un p autour de 0,030. Significatif dans les deux cas, et l'intervalle de la différence va d'à peu près 0,5 à 11,2.
Chaque paire a progressé de 2 à 4 points. Les différences ont une moyenne de 19/6, environ 3,17, avec une petite dispersion, donc le t apparié est grand, environ 10,3 sur 5 degrés de liberté, et p vaut environ 0,0001. Un test à deux échantillons sur les mêmes nombres aurait trouvé bien moins, parce que la dispersion entre personnes noie le changement chez chacune.
Les erreurs de test t
Faire un test à deux échantillons sur des données appariées. L'appariement est l'information ; le jeter est la façon dont un vrai changement disparaît dans le bruit.
Supposer des variances égales sans vérifier. Le test combiné n'est juste que quand les dispersions concordent ; Welch ne coûte presque rien quand c'est le cas et sauve le test quand ce ne l'est pas.
Utiliser la formule de population pour la variance. Un test t utilise la variance d'échantillon, en divisant par n moins 1, et c'est ce que fait la page.
Lire la significativité comme une taille. Une différence minuscule est significative avec assez de données ; l'intervalle et le d de Cohen disent si elle compte.
Choisir la queue après avoir vu le signe. Si la question était « différent », le test est bilatéral même quand le résultat est allé dans votre sens.
Tester une métrique très asymétrique avec une poignée de valeurs. Avec n sous environ 15 et une longue queue, la courbe t est un guide approximatif ; un test de rangs ou un bootstrap est l'alternative honnête.
FAQ sur le test t
Quand utiliser un test t plutôt qu'un test z ?
Chaque fois que l'écart type est estimé à partir du même échantillon, ce qui est presque toujours le cas. Les queues plus lourdes de la courbe t tiennent compte de cette incertitude supplémentaire. Un test z est réservé au cas d'école où l'écart type de la population est connu à l'avance, ou aux très grands échantillons où les deux courbes coïncident.
Quelle est la différence entre un test t apparié et non apparié ?
Un test apparié utilise les différences au sein de paires assorties, comme la même personne mesurée deux fois, si bien que le bruit partagé par chaque paire s'annule. Un test non apparié (à deux échantillons) compare deux groupes distincts. Utilisez l'apparié chaque fois que chaque valeur d'une liste a un partenaire naturel dans l'autre ; sinon, deux échantillons.
Dois-je utiliser le test t de Welch ou celui de Student ?
Welch, sauf si un cours ou une revue exige autre chose. Le test combiné de Student suppose que les deux groupes ont la même variance et donne des taux d'erreur faux quand ce n'est pas le cas ; Welch abandonne cette hypothèse et concorde avec Student quand elle tient. Cette page prend Welch par défaut et propose le combiné en option.
Comment lire les degrés de liberté du test de Welch ?
Les degrés de liberté de Welch viennent d'une formule sur les deux variances et tailles d'échantillon et ne sont généralement pas un nombre entier, par exemple 9,87. C'est normal ; la courbe t est définie pour tout df positif. Quand les deux variances et tailles sont égales, on retrouve n1 plus n2 moins 2.
Que signifie l'intervalle de confiance de la différence ?
La plage de valeurs de la vraie différence avec laquelle les données sont compatibles au niveau choisi. S'il exclut zéro, le test est significatif à l'alpha correspondant ; sa largeur dit avec quelle précision la différence est cernée. Rapportez-le à côté de la valeur p.
Qu'est-ce que le d de Cohen ?
La différence des moyennes divisée par l'écart type, donc une taille d'effet en unités d'écart type que l'on peut comparer entre études à échelles différentes. Par convention, 0,2 est petit, 0,5 moyen et 0,8 grand, même si ce qui compte comme significatif dépend du domaine.
Puis-je l'utiliser pour un test A/B ?
Pour un taux de conversion, non : c'est une comparaison de proportions et le calculateur de test A/B des pages outils le fait avec le test z à deux proportions. Pour une métrique continue comme le revenu par utilisateur ou le temps passé sur la page, oui, si vous avez les valeurs par utilisateur à coller ; le test de Welch à deux échantillons est le bon choix.