У каждого t-теста одна и та же форма. Есть разница, которая тебя интересует: выборочное среднее против заявленного значения, средние двух групп друг против друга или среднее изменение по парам. Есть стандартная ошибка: насколько эта разница колебалась бы от одной выборки к другой, оценённая по разбросу данных. Статистика t - это первое, делённое на второе, так что t = 3 означает, что разница шириной в три стандартные ошибки, а кривая t для нужных степеней свободы превращает это в p-значение.
Три теста различаются только тем, что такое разница и стандартная ошибка. Одновыборочный: среднее минус гипотетическое значение, делить на s делить на корень из n. Парный: то же самое, применённое к списку разностей, по одной на пару, поэтому спаривание так сильно, когда каждая пара делит много общего шума. Двухвыборочный: разрыв между средними, делённый на стандартную ошибку, построенную из обоих разбросов. Для двух выборок страница по умолчанию берёт версию Уэлча, которая не предполагает одинаковую дисперсию в группах и стоит по умолчанию в каждом современном статистическом пакете; объединённая версия Стьюдента в одном переключателе, для случаев, когда её требует курс.
Страница сохраняет точным то, что можно сохранить. Среднее 26 печатается как 26, а дисперсия 32/3 - как 32/3, а не 10.67; стандартная ошибка показана радикалом, поскольку это квадратный корень; статистика t - первая десятичная, потому что после деления на корень рационального не остаётся. Ниже перечислен каждый шаг, чтобы сводную таблицу выборок можно было сверить с собственным решением.
Что нужно знать о t-тестах
Степени свободы равны n минус 1 для одной выборки и для парных данных и n1 плюс n2 минус 2 для объединённого двухвыборочного теста. Df по Уэлчу - дробь, вычисленная из двух дисперсий, и часто не целое число.
Спаривание убирает общий шум. Измерения «до» и «после» на одних и тех же людях должны быть парным тестом и никогда двухвыборочным; двухвыборочный выбрасывает спаривание и обычно ничего не находит.
Уэлч - безопасный вариант по умолчанию. Когда две дисперсии действительно равны, обе версии согласны; когда нет, только Уэлч держит обещанную долю ошибок.
Доверительный интервал говорит то, чего p-значение не может: насколько велика, скорее всего, разница. Значимый t с интервалом от 0.1 до 0.3 - маленький эффект; тот же t с интервалом от 2 до 6 - большой.
D Коэна - это разница в единицах стандартного отклонения, поэтому её можно сравнивать между исследованиями с разными шкалами. Около 0.2 - маленький, 0.5 - средний, 0.8 - большой.
Как провести t-тест
1
Выбери вид теста
Одна выборка против заявленного среднего; две независимые выборки друг против друга; парный, когда у каждого значения в одном списке есть партнёр в другом.
2
Вставь данные
Запятые, пробелы или переносы строк - всё подходит. Для парного теста два списка должны быть одной длины и в одном порядке.
3
Задай гипотезу и уровень
Двусторонний для «отличается», односторонний для направления, зафиксированного заранее. Альфа 0.05 - общепринятый выбор.
4
Сначала прочитай сводную таблицу
Проверь, что средние и дисперсии совпадают с ожидаемыми. Большинство неверных t-тестов неверны потому, что значение попало не в тот список.
5
Затем прочитай t, p и интервал
Вердикт говорит, взяла ли разница планку; интервал говорит, насколько она, вероятно, велика. Сообщай оба.
У десяти значений среднее 26 и выборочная дисперсия 32/3. Стандартная ошибка - корень из 32/30, около 1.033, так что t около 1.94 при 9 степенях свободы и двустороннее p около 0.085. Незначимо на 5%: среднее 26 укладывается в то, что выборка из десяти из совокупности со средним 24 давала бы примерно один раз из двенадцати.
Первая группа в среднем около 84.7, вторая около 78.9. Тест Уэлча даёт t около 2.46 примерно при 9 степенях свободы и p около 0.036; объединённая версия даёт тот же t при 12 степенях свободы и p около 0.030. Значимо в любом случае, а интервал для разности тянется примерно от 0.5 до 11.2.
Каждая пара выросла на 2-4 пункта. Разности в среднем 19/6, около 3.17, с маленьким разбросом, поэтому парный t большой, около 10.3 при 5 степенях свободы, а p около 0.0001. Двухвыборочный тест на тех же числах нашёл бы гораздо меньше, потому что разброс между людьми заглушает изменение внутри каждого.
Ошибки с t-тестом
Гонять двухвыборочный тест на парных данных. Спаривание - это и есть информация; выбросить его - способ, которым настоящее изменение растворяется в шуме.
Предполагать равные дисперсии без проверки. Объединённый тест верен только когда разбросы совпадают; Уэлч почти ничего не стоит, когда они совпадают, и спасает тест, когда нет.
Использовать формулу дисперсии для совокупности. T-тест использует выборочную дисперсию, с делением на n минус 1, и страница так и делает.
Читать значимость как размер. Крошечная разница значима при достаточном объёме данных; интервал и d Коэна говорят, важна ли она.
Выбирать хвост после того, как увидел знак. Если вопрос был «отличается», тест двусторонний, даже когда результат вышел в твою сторону.
Тестировать сильно скошенную метрику на горстке значений. При n меньше примерно 15 и длинном хвосте кривая t - грубый ориентир; ранговый критерий или бутстрап - честная альтернатива.
Вопросы о t-тесте
Когда использовать t-тест вместо z-теста?
Всегда, когда стандартное отклонение оценено по той же выборке, а это почти всегда. Более тяжёлые хвосты кривой t учитывают эту дополнительную неопределённость. Z-тест - для учебного случая, когда стандартное отклонение совокупности известно заранее, или для очень больших выборок, где две кривые совпадают.
В чём разница между парным и непарным t-тестом?
Парный тест использует разности внутри сопоставленных пар, например один и тот же человек, измеренный дважды, так что общий для каждой пары шум сокращается. Непарный (двухвыборочный) тест сравнивает две отдельные группы. Бери парный всегда, когда у каждого значения одного списка есть естественный партнёр в другом; иначе двухвыборочный.
Использовать t-тест Уэлча или Стьюдента?
Уэлча, если курс или журнал не требуют иного. Объединённый тест Стьюдента предполагает одинаковую дисперсию в обеих группах и даёт неверные доли ошибок, когда это не так; Уэлч отбрасывает это предположение и согласен со Стьюдентом, когда оно выполняется. Эта страница по умолчанию использует Уэлча и предлагает объединённый переключателем.
Как читать степени свободы для теста Уэлча?
Степени свободы по Уэлчу вычисляются формулой из двух выборочных дисперсий и размеров и обычно не целые, например 9.87. Это нормально; кривая t определена для любого положительного df. Когда две дисперсии и размеры равны, формула сводится к n1 плюс n2 минус 2.
Что означает доверительный интервал для разности?
Диапазон значений истинной разности, с которыми данные согласуются при выбранном уровне. Если он не содержит ноль, тест значим при соответствующей альфе; его ширина говорит, насколько точно разность определена. Сообщай его рядом с p-значением.
Что такое d Коэна?
Разность средних, делённая на стандартное отклонение, то есть размер эффекта в единицах стандартного отклонения, который можно сравнивать между исследованиями с разными шкалами. По соглашению 0.2 - маленький, 0.5 - средний, 0.8 - большой, хотя что считать значимым, зависит от области.
Можно ли использовать это для A/B-теста?
Для конверсии нет: это сравнение долей, и калькулятор A/B-теста среди инструментов делает его z-тестом для двух долей. Для непрерывной метрики вроде выручки на пользователя или времени на странице да, если у тебя есть значения по каждому пользователю, которые можно вставить; двухвыборочный тест Уэлча - правильный выбор.