Menu

Калькулятор t-теста

Одновыборочный, двухвыборочный и парный t-тесты на твоих сырых данных, строка за строкой.

Автор Nethanel Bar, Сооснователь и генеральный директор

Обновлено

Хотите решать это без калькулятора?

Курс математики Coddy учит самому методу: вы прорабатываете каждый шаг на интерактивной доске и узнаёте, где именно ход пошёл не так.

T-тест спрашивает, больше ли разница, чем шум

У каждого t-теста одна и та же форма. Есть разница, которая тебя интересует: выборочное среднее против заявленного значения, средние двух групп друг против друга или среднее изменение по парам. Есть стандартная ошибка: насколько эта разница колебалась бы от одной выборки к другой, оценённая по разбросу данных. Статистика t - это первое, делённое на второе, так что t = 3 означает, что разница шириной в три стандартные ошибки, а кривая t для нужных степеней свободы превращает это в p-значение.

Три теста различаются только тем, что такое разница и стандартная ошибка. Одновыборочный: среднее минус гипотетическое значение, делить на s делить на корень из n. Парный: то же самое, применённое к списку разностей, по одной на пару, поэтому спаривание так сильно, когда каждая пара делит много общего шума. Двухвыборочный: разрыв между средними, делённый на стандартную ошибку, построенную из обоих разбросов. Для двух выборок страница по умолчанию берёт версию Уэлча, которая не предполагает одинаковую дисперсию в группах и стоит по умолчанию в каждом современном статистическом пакете; объединённая версия Стьюдента в одном переключателе, для случаев, когда её требует курс.

Страница сохраняет точным то, что можно сохранить. Среднее 26 печатается как 26, а дисперсия 32/3 - как 32/3, а не 10.67; стандартная ошибка показана радикалом, поскольку это квадратный корень; статистика t - первая десятичная, потому что после деления на корень рационального не остаётся. Ниже перечислен каждый шаг, чтобы сводную таблицу выборок можно было сверить с собственным решением.

Что нужно знать о t-тестах

  • Степени свободы равны n минус 1 для одной выборки и для парных данных и n1 плюс n2 минус 2 для объединённого двухвыборочного теста. Df по Уэлчу - дробь, вычисленная из двух дисперсий, и часто не целое число.
  • Спаривание убирает общий шум. Измерения «до» и «после» на одних и тех же людях должны быть парным тестом и никогда двухвыборочным; двухвыборочный выбрасывает спаривание и обычно ничего не находит.
  • Уэлч - безопасный вариант по умолчанию. Когда две дисперсии действительно равны, обе версии согласны; когда нет, только Уэлч держит обещанную долю ошибок.
  • Доверительный интервал говорит то, чего p-значение не может: насколько велика, скорее всего, разница. Значимый t с интервалом от 0.1 до 0.3 - маленький эффект; тот же t с интервалом от 2 до 6 - большой.
  • D Коэна - это разница в единицах стандартного отклонения, поэтому её можно сравнивать между исследованиями с разными шкалами. Около 0.2 - маленький, 0.5 - средний, 0.8 - большой.

Как провести t-тест

  1. Выбери вид теста

    Одна выборка против заявленного среднего; две независимые выборки друг против друга; парный, когда у каждого значения в одном списке есть партнёр в другом.

  2. Вставь данные

    Запятые, пробелы или переносы строк - всё подходит. Для парного теста два списка должны быть одной длины и в одном порядке.

  3. Задай гипотезу и уровень

    Двусторонний для «отличается», односторонний для направления, зафиксированного заранее. Альфа 0.05 - общепринятый выбор.

  4. Сначала прочитай сводную таблицу

    Проверь, что средние и дисперсии совпадают с ожидаемыми. Большинство неверных t-тестов неверны потому, что значение попало не в тот список.

  5. Затем прочитай t, p и интервал

    Вердикт говорит, взяла ли разница планку; интервал говорит, насколько она, вероятно, велика. Сообщай оба.

Три t-теста

Что на что делится в каждом.

ТестРазностьСтандартная ошибкаСтепени свободы
Одна выборкаx̄ − μ₀s / √nn − 1
Парныйсреднее разностей d̄s_d / √nn − 1
Две выборки, объединённыйx̄₁ − x̄₂√(s²_p (1/n₁ + 1/n₂))n₁ + n₂ − 2
Две выборки, Уэлчx̄₁ − x̄₂√(s₁²/n₁ + s₂²/n₂)из двух дисперсий, часто не целое

Разобранные примеры

Одна выборка против заявленного среднего 24

plain
20, 22, 24, 25, 26, 27, 28, 29, 30, 29 against μ₀ = 24

У десяти значений среднее 26 и выборочная дисперсия 32/3. Стандартная ошибка - корень из 32/30, около 1.033, так что t около 1.94 при 9 степенях свободы и двустороннее p около 0.085. Незначимо на 5%: среднее 26 укладывается в то, что выборка из десяти из совокупности со средним 24 давала бы примерно один раз из двенадцати.

Две независимые выборки

plain
84, 79, 91, 88, 76, 85, 90 against 78, 81, 74, 80, 77, 83, 79

Первая группа в среднем около 84.7, вторая около 78.9. Тест Уэлча даёт t около 2.46 примерно при 9 степенях свободы и p около 0.036; объединённая версия даёт тот же t при 12 степенях свободы и p около 0.030. Значимо в любом случае, а интервал для разности тянется примерно от 0.5 до 11.2.

Парные «до» и «после»

plain
72, 68, 75, 80, 66, 71 before; 75, 70, 79, 84, 69, 74 after

Каждая пара выросла на 2-4 пункта. Разности в среднем 19/6, около 3.17, с маленьким разбросом, поэтому парный t большой, около 10.3 при 5 степенях свободы, а p около 0.0001. Двухвыборочный тест на тех же числах нашёл бы гораздо меньше, потому что разброс между людьми заглушает изменение внутри каждого.

Ошибки с t-тестом

  • Гонять двухвыборочный тест на парных данных. Спаривание - это и есть информация; выбросить его - способ, которым настоящее изменение растворяется в шуме.
  • Предполагать равные дисперсии без проверки. Объединённый тест верен только когда разбросы совпадают; Уэлч почти ничего не стоит, когда они совпадают, и спасает тест, когда нет.
  • Использовать формулу дисперсии для совокупности. T-тест использует выборочную дисперсию, с делением на n минус 1, и страница так и делает.
  • Читать значимость как размер. Крошечная разница значима при достаточном объёме данных; интервал и d Коэна говорят, важна ли она.
  • Выбирать хвост после того, как увидел знак. Если вопрос был «отличается», тест двусторонний, даже когда результат вышел в твою сторону.
  • Тестировать сильно скошенную метрику на горстке значений. При n меньше примерно 15 и длинном хвосте кривая t - грубый ориентир; ранговый критерий или бутстрап - честная альтернатива.

Вопросы о t-тесте

Когда использовать t-тест вместо z-теста?
Всегда, когда стандартное отклонение оценено по той же выборке, а это почти всегда. Более тяжёлые хвосты кривой t учитывают эту дополнительную неопределённость. Z-тест - для учебного случая, когда стандартное отклонение совокупности известно заранее, или для очень больших выборок, где две кривые совпадают.
В чём разница между парным и непарным t-тестом?
Парный тест использует разности внутри сопоставленных пар, например один и тот же человек, измеренный дважды, так что общий для каждой пары шум сокращается. Непарный (двухвыборочный) тест сравнивает две отдельные группы. Бери парный всегда, когда у каждого значения одного списка есть естественный партнёр в другом; иначе двухвыборочный.
Использовать t-тест Уэлча или Стьюдента?
Уэлча, если курс или журнал не требуют иного. Объединённый тест Стьюдента предполагает одинаковую дисперсию в обеих группах и даёт неверные доли ошибок, когда это не так; Уэлч отбрасывает это предположение и согласен со Стьюдентом, когда оно выполняется. Эта страница по умолчанию использует Уэлча и предлагает объединённый переключателем.
Как читать степени свободы для теста Уэлча?
Степени свободы по Уэлчу вычисляются формулой из двух выборочных дисперсий и размеров и обычно не целые, например 9.87. Это нормально; кривая t определена для любого положительного df. Когда две дисперсии и размеры равны, формула сводится к n1 плюс n2 минус 2.
Что означает доверительный интервал для разности?
Диапазон значений истинной разности, с которыми данные согласуются при выбранном уровне. Если он не содержит ноль, тест значим при соответствующей альфе; его ширина говорит, насколько точно разность определена. Сообщай его рядом с p-значением.
Что такое d Коэна?
Разность средних, делённая на стандартное отклонение, то есть размер эффекта в единицах стандартного отклонения, который можно сравнивать между исследованиями с разными шкалами. По соглашению 0.2 - маленький, 0.5 - средний, 0.8 - большой, хотя что считать значимым, зависит от области.
Можно ли использовать это для A/B-теста?
Для конверсии нет: это сравнение долей, и калькулятор A/B-теста среди инструментов делает его z-тестом для двух долей. Для непрерывной метрики вроде выручки на пользователя или времени на странице да, если у тебя есть значения по каждому пользователю, которые можно вставить; двухвыборочный тест Уэлча - правильный выбор.

Другие инструменты по математике

Coddy programming languages illustration

Учите математику с Coddy

НАЧАТЬ