Калькулятор t-критерия
Результат
T-статистика
- P-значение
- 34,6594 %
- Степени свободы
- 8
- Стандартная ошибка
- 1,0000
Калькулятор t-критерия выполняет самый обычный критерий о среднем: он превращает выборочное среднее, стандартное отклонение и объём выборки в статистику t, p-значение и число степеней свободы, по которым читаются первые два. Режим одной выборки сравнивает среднее с фиксированным значением — целевым, нормативным, историческим средним. Режим двух выборок сравнивает две группы между собой, и реализован здесь двухвыборочный t-критерий с объединённой дисперсией, который предполагает, что у двух групп общая дисперсия: два стандартных отклонения усредняются с весами n − 1, и эта единственная объединённая дисперсия задаёт стандартную ошибку. Альтернатива, критерий Уэлча, отказывается от предположения о равных дисперсиях и безопаснее по умолчанию, когда группы различаются размером и разбросом, но его степени свободы получаются дробными, и это другой расчёт в другом месте кода; страница делает критерий с равными дисперсиями и говорит об этом прямо, а не подменяет его тихо. P-значение — это площадь хвоста распределения Стьюдента за статистикой, и выводится оно в процентах.
Формула
t = (x̄ − μ₀) / (s / √n) t = (x̄₁ − x̄₂) / √(s_p²(1/n₁ + 1/n₂)) s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)
- t
- Статистика критерия — на сколько стандартных ошибок наблюдённое среднее отстоит от проверяемого значения. Знак несёт направление, и поэтому односторонний критерий не в ту сторону возвращает большое p-значение, а не ошибку: t = −1 против альтернативы «больше» это не малый эффект, а свидетельство, указывающее в другую сторону, и площадь хвоста об этом и говорит
- x̄, μ₀
- Выборочное среднее и значение, с которым его сравнивают, в режиме одной выборки. Числитель — их разность, поэтому статистика измеряет расстояние в единицах данных: одна и та же разность весит куда меньше, если разброс велик или выборка мала, а это и поставляет знаменатель
- s
- Выборочное стандартное отклонение, оценённое по данным, а не известное заранее. Сама эта оценка и есть причина, по которой вместо нормального распределения берут распределение Стьюдента: добавляемая ею неопределённость делает хвосты тяжелее, и именно её учитывает критическое значение t. Из него и объёма выборки складывается стандартная ошибка s / √n, и она стоит в знаменателе статистики. Оно должно быть больше нуля: у выборки без разброса нет знаменателя, на который делить
- n
- Объём выборки. В режиме одной выборки он даёт n − 1, и эти степени свободы печатаются рядом с ответом, чтобы значение t можно было прочитать по таблице. В двухвыборочном критерии два объёма складываются в величину на единицу большую, чем каждый по отдельности: n₁ + n₂ − 2, потому что объединённая дисперсия тратит по одной степени свободы на среднее каждой группы, прежде чем измерить разброс вокруг него
- s_p²
- Объединённая дисперсия — взвешенное среднее дисперсий двух групп, где каждая взвешена по собственным степеням свободы. Здесь и входит предположение о равных дисперсиях: две группы рассматриваются как две выборки из одного общего разброса, поэтому объединённая дисперсия одна на обе, и группа с большим числом наблюдений или с меньшей собственной дисперсией вносит в неё пропорционально больший вклад. Если две дисперсии заметно различаются, портится именно объединение, и лекарство — критерий Уэлча
- p-значение
- Вероятность получить статистику хотя бы настолько далёкую от нуля, в ту сторону, о которой спрашивает критерий, если средние на самом деле совпадают. Два хвоста удваивают площадь за |t|, альтернативы «больше» и «меньше» берут по одному хвосту. Здесь оно выводится в процентах, поэтому 5 % — это знакомые 0,05, и это утверждение о данных при данной гипотезе, а не о гипотезе при данных
Берите её, когда есть среднее и стандартное отклонение по выборке и нужно узнать, больше ли разница с целевым значением или с другой группой, чем объяснил бы выборочный шум. Режим одной выборки обслуживает случай, когда величина сравнения — фиксированное число: станок, настроенный наполнять 500 граммов, норматив 5 мм, прошлогоднее среднее, — а режим двух выборок обслуживает случай, когда обе величины измерены и ни одна не главнее. Прежде чем читать ответ, стоит решить две вещи. Первая — один хвост или два: двусторонний критерий спрашивает, различаются ли группы вообще, и это верный выбор по умолчанию, а односторонний задаёт вопрос о направлении, и брать его следует потому, что направление было задано заранее, а не потому, что ответ получится выгоднее. Вторая — предположение о равных дисперсиях, которое режим двух выборок делает и проверить за вас не может. Ответ виден на панели: если два введённых стандартных отклонения близки, объединение почти ничего не стоит, а если они различаются вдвое и больше, нужен критерий Уэлча. Эта страница считает объединённый критерий — то, что большинство учебников и большинство статистиков и называют t-критерием в случае равных дисперсий, — и печатает оба введённых стандартных отклонения, чтобы предположение можно было оценить, а не принимать на веру.
Разобранные примеры
По умолчанию: среднее выборки 6 против цели 5
- Стандартная ошибка: s / √n = 3 / 3 = 1
- Статистика t: (6 − 5) / 1 = 1 — выборочное среднее стоит на одну стандартную ошибку выше цели
- Степени свободы: n − 1 = 8
- Двустороннее p-значение: площадь за ±1 у распределения Стьюдента с 8 степенями свободы, то есть 34,66 %
Разница в целую единицу кажется большой, пока рядом с ней не поставлена стандартная ошибка: одна стандартная ошибка вполне укладывается в диапазон, который порождает выборочный шум, и p-значение об этом и говорит. Сравнение с нормальной кривой поучительно: то же t = 1 дало бы 31,7 %, будь распределение нормальным, и лишние три процента — это плата за то, что стандартное отклонение оценили по девяти наблюдениям, а не знали заранее.
Статистика t = 2,306 даёт ровно 5 %
- Стандартная ошибка: 3 / √9 = 1, поэтому статистика t равна самому среднему
- Статистика t: (2,306 − 0) / 1 = 2,306
- Двусторонняя граница t для 95 % при 8 степенях свободы равна 2,306
- Стоять ровно на границе означает, что двустороннее p-значение равно ровно 5 %
Это та же пара, которую страница критического значения выдаёт с другого конца, и вместе они нагляднее всего показывают, что перед нами один факт, прочитанный с двух сторон. Спросите там двустороннюю границу t для 95 % при 8 степенях свободы — она вернёт 2,306; подставьте 2,306 сюда, и p-значение придёт ровно 5 %. Ничто в промежутке не округлено: число выбрано потому, что стандартное отклонение 3 и объём выборки 9 дают ровно 1 в стандартной ошибке, так что статистика и граница — одна и та же величина. Чуть меньше — и результат оказался бы выше 5 %, чуть больше — ниже.
Две группы по десять с одинаковым разбросом
- Объединённая дисперсия: ((9 × 4) + (9 × 4)) / 18 = 72 / 18 = 4, поэтому объединённое стандартное отклонение равно 2
- Стандартная ошибка: √(4 × (1/10 + 1/10)) = √0,8 = 0,8944
- Статистика t: (5 − 4) / 0,8944 = 1,118
- Степени свободы: 10 + 10 − 2 = 18, что даёт двустороннее p-значение 27,83 %
Когда дисперсии двух групп равны, объединение ничего не меняет: объединённая дисперсия выходит 4, то есть ровно то значение, которое дала каждая группа, а стандартная ошибка меньше, чем собственное стандартное отклонение любой из групп, делённое на её собственный √n. Сравнивать два средних по десяти наблюдениям менее точно, чем оценивать одно среднее по десяти: стандартная ошибка 0,8944 против 0,6325, потому что вычитаются две неточные величины, а не измеряется одна, и эта плата оправдана, только когда сравнение отвечает на вопрос, которого одна выборка задать не может. Заметьте, что поле для среднего совокупности на экране и в этом режиме не используется: обе величины измерены, поэтому ни одна не является фиксированной целью.
Разные разбросы и разные объёмы, где за объединением нужно следить
- Объединённая дисперсия: ((9 × 4,41) + (11 × 3,24)) / 20 = (39,69 + 35,64) / 20 = 3,7665
- Стандартная ошибка: √(3,7665 × (1/10 + 1/12)) = √0,6905 = 0,831
- Статистика t: (5,2 − 4,1) / 0,831 = 1,3237
- Степени свободы: 10 + 12 − 2 = 20
Объединённая дисперсия равна 3,7665, и это не середина между 4,41 и 3,24: группа из двенадцати взвешена сильнее, потому что вносит одиннадцать степеней свободы против девяти у группы из десяти. Именно в этом взвешивании весь смысл слова «объединённая», и именно поэтому ответ нельзя получить, просто усреднив два стандартных отклонения. Здешние два разброса достаточно близки, чтобы предположение о равных дисперсиях не мешало; пара вроде 2,1 и 0,6 при таких объёмах групп — уже нет, и критерий Уэлча дал бы заметно другое p-значение.
t = 1,96 по 900 наблюдениям, где t и z сошлись
- Стандартная ошибка: 3 / √900 = 3 / 30 = 0,1
- Статистика t: (5,196 − 5) / 0,1 = 1,96
- Степени свободы: 899
- Двустороннее p-значение: 5,0304 % — чуть выше 5, а не ровно на нём
Знаменитое 1,96 даёт 5 % на нормальной кривой и 5,0304 % здесь, и этот зазор и есть суть примера. При 899 степенях свободы распределение Стьюдента почти неотличимо от нормального, но не в точности: хвосты у него всё ещё чуть тяжелее, поэтому та же статистика стоит чуть дальше. Отсюда же и то, почему t = 1,96 не становится автоматически значимым на 5 % в большой выборке, и почему программа, напечатавшая 0,0499, и программа, напечатавшая 0,0501, могут разойтись насчёт одного и того же исследования в третьем знаке.
Ограничения
Режим двух выборок предполагает, что у двух групп общая дисперсия, и это предположение делает настоящую работу, а не приводит в порядок обозначения. Когда объёмы групп равны, объединённый критерий довольно устойчив даже при разных дисперсиях, но когда объёмы различны и дисперсии тоже, критерий может серьёзно ошибаться в любую сторону — это проблема Беренса — Фишера, и критерий Уэлча существует, чтобы её решить. Два стандартных отклонения для того и напечатаны на панели: сравните их, прежде чем доверять p-значению, и если одно больше другого примерно вдвое при разных объёмах групп, критерий с равными дисперсиями вам не подходит. У режима одной выборки такой проблемы нет, но он предполагает независимость наблюдений, а она нарушается при повторных измерениях одного и того же объекта и при подобранных или кластеризованных данных, где нужен парный или смешанный анализ. Оба режима предполагают, что данные примерно нормальны, и оба становятся менее чувствительны к этому по мере роста выборки: центральная предельная теорема — то, что делает t-критерий по 900 скошенным наблюдениям разумным, а по 9 скошенным — сомнительным. И наконец, страница сообщает статистику и p-значение, но не вывод. Уровня значимости, с которым их сравнивать, у неё нет, а число 0,05 — традиция, а не результат, поэтому решение остаётся там, где ему и место.
Частые вопросы
- Какой здесь двухвыборочный критерий — с объединённой дисперсией или Уэлча?
- С объединённой дисперсией, то есть критерий с равными дисперсиями и n₁ + n₂ − 2 степенями свободы. Критерий Уэлча лучше, когда две группы различаются и разбросом, и объёмом, и два поля для стандартных отклонений стоят на панели именно затем, чтобы это можно было проверить: если одно примерно вдвое больше другого и объёмы выборок разные, нужен Уэлч, а эта страница даст p-значение со сдвигом, иногда существенным. Версия с равными дисперсиями реализована здесь потому, что это учебниковый критерий, потому что справочник называет двухвыборочным t-критерием для равных средних именно его, и потому что его целые степени свободы оставляют арифметику этой страницы точной, а не приближённой.
- Брать односторонний критерий или двусторонний?
- Двусторонний, если направление не было задано до того, как увидели данные. Двусторонний критерий спрашивает, различаются ли группы вообще, и делит уровень значимости между двумя концами; односторонний спрашивает, больше ли одна группа, и кладёт весь уровень в один хвост, из-за чего до значимости добраться легче — ровно вдвое легче на том же уровне, поскольку 1,96 превращается в 1,645. Это законный выбор, когда вопрос действительно направленный, и это форма подгонки результата, когда направление выбрали после того, как увидели, в какую сторону пошла разница.
- Чем статистика t отличается от p-значения?
- Статистика t измеряет разницу в стандартных ошибках и несёт внутри себя объём выборки, а p-значение переводит эту величину в вероятность по распределению Стьюдента при соответствующих степенях свободы. То есть t отвечает на вопрос «на сколько стандартных ошибок они разошлись?», а p-значение — «как часто один только выборочный разброс давал бы такой зазор?». Сообщают и то, и другое: первое сравнимо между исследованиями с одинаковым замыслом, а со вторым сравнивают уровень значимости. Ни то, ни другое не является величиной эффекта: большая выборка может заставить ничтожную разницу дать большое t и крошечное p-значение.
- Почему статистика t = 1,96 не даёт ровно 5 %?
- Потому что 1,96 — граница 5 % для нормальной кривой, а у распределения Стьюдента хвосты чуть тяжелее при любом конечном числе степеней свободы. При 899 степенях свободы t = 1,96 даёт 5,0304 %, чуть выше черты; при 8 степенях свободы та же статистика даёт 8,57 %. Распределение Стьюдента сходится к нормальному по мере роста степеней свободы, и это всё та же кривая — меняется только вес хвостов. Поэтому программа и может напечатать p-значение 0,0499 там, где расчёт вручную против 1,96 говорит «значимо», и ни одна из них не ошибается.
- Что означает отрицательная статистика t?
- То, что выборочное среднее оказалось ниже значения, с которым его сравнивают, или ниже среднего второй группы в двухвыборочном режиме. Знак несёт информацию о направлении и больше ничего: p-значение считается по величине статистики относительно распределения. В двустороннем критерии знак отбрасывается, потому что считается любая из крайностей. В одностороннем он важен и бывает содержателен: t = −2,5 против альтернативы «больше» даёт p-значение около 99 %, и это не нулевой результат, а свидетельство, указывающее в другую сторону, и сообщить о нём как о «незначимом» значит выбросить эту информацию.
- Сколько наблюдений нужно для t-критерия?
- Страница требует не меньше двух на группу, потому что стандартное отклонение одного наблюдения не определено. Это математический минимум, а не практическая рекомендация: t-критерий по двум наблюдениям на группу имеет одну степень свободы и почти не способен заметить ничего, кроме огромной разницы, и p-значение будет большим, если только группы почти не перекрываются. Полезный вопрос не в том, какой минимум допускает формула, а в том, какой объём выборки нужен, чтобы заметить интересующую вас разницу, а это зависит от разброса данных и от величины эффекта, который вы хотите увидеть; этим расчётом занята страница объёма выборки, и она идёт назад от погрешности, а не вперёд от набора данных.
- Где таблица критических значений t?
- На странице критического значения, и в этом наборе только там: эта страница её не печатает, потому что таблицу пришлось бы индексировать и по степеням свободы, и по уровню значимости, а это уже по странице из учебника на каждый уровень, а не таблица. Поэтому ответ здесь и считается, а не ищется: таблица может перечислить лишь те степени свободы, которые кто-то решил напечатать, а степени свободы двухвыборочного критерия, n₁ + n₂ − 2, почти никогда в их число не попадают. Одна граница стоит того, чтобы держать её в голове: значения t сходятся к 1,96 по мере роста выборки, так что искомая таблица — это таблица нормального распределения с надбавкой, которая тает вместе с ростом степеней свободы.
Источники
- 1.3.5.3. Two-Sample t-Test for Equal Means — e-Handbook of Statistical Methods (the pooled two-sample test this page implements, including the pooled standard deviation and its n₁ + n₂ − 2 degrees of freedom) — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods (the sample mean and the standard error that the one-sample statistic is built from) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the curve the t distribution approaches as the degrees of freedom grow, which is why 1.96 and 5% are only approximately each other's partner) — National Institute of Standards and Technology (NIST)