Калькулятор p-значения
Результат
P-значение
Калькулятор p-значения переводит статистику критерия в вероятность увидеть значение не менее крайнее, если нулевая гипотеза верна. Он работает с четырьмя статистиками, на которых держится прикладная статистика, — z, t, хи-квадрат и F — и ему нужны только сама статистика, её степени свободы и выбор хвоста. Настройка хвоста ошибается чаще всего остального: двусторонний критерий считает оба направления, односторонний — только то, которое было предсказано. На выходе одно число, в процентах. А чего страница намеренно не делает — не выносит вердикт, потому что уровень значимости приносите вы сами.
Формула
верхний хвост: p = P(T ≥ t) нижний хвост: p = P(T ≤ t) двусторонний: p = 2 · min( верхний, нижний ) — только для симметричных распределений
- t
- Уже посчитанная статистика критерия — z по большой выборке, t по маленькой, хи-квадрат по подсчитанным категориям или F по отношению двух дисперсий. Сама статистика критерия здесь не считается, она только переводится
- T
- Распределение, которому статистика следовала бы, будь нулевая гипотеза верна. Какое именно — задаёт переключатель из четырёх вариантов, и выбор здесь не вкусовой: подстановка нормального распределения там, где нужно t, делает каждое p-значение слишком маленьким
- df
- Степени свободы — свойство того, как посчитана статистика, а не самих данных, и они нужны t, хи-квадрату и F. Для F их две: степени свободы числителя, то есть число сравниваемых групп или слагаемых, и степени свободы знаменателя, которые берутся из остаточного объёма выборки
- α
- Уровень значимости, порог, с которым p-значение будут сравнивать. На этой странице он не входной, потому что не входит в расчёт: он принадлежит решению, которое вы собираетесь принять, а печатать вердикт против умалчиваемого порога 0,05 значило бы выбрать этот порог за вас
- p
- Площадь хвоста, показанная в процентах, а не долей. P-значение 0,05 выводится как 5,0000, так что число на экране можно сравнивать с названным уровнем значимости напрямую, не переводя сначала запятую
Берите её, когда статистика уже есть, а нужно p-значение при ней: из учебной задачи, где статистика дана, из программы, которая напечатала статистику, но не p-значение, или из ручного расчёта, который хочется проверить. Важнее всего здесь выбор хвоста, и правило фиксируется до того, как увидели данные, а не после: берите двусторонний, когда отклонением от нуля считается любое из двух направлений, — это обычный случай, — и односторонний только тогда, когда результат в противоположную сторону не интересен вовсе и вы сказали об этом заранее. Второй выбор — распределение. Согласуйте его с тем, как построена статистика, а не с тем, какое p-значение хочется получить: z принадлежит доле или среднему с известной дисперсией, t — среднему, разброс которого взят из той же маленькой выборки, хи-квадрат — подсчитанным категориям, F — сравнению дисперсий. Именно неверная пара чаще всего и превращает правильную арифметику в бессмысленное число.
Разобранные примеры
z = 1,96 — классический двусторонний порог
- Верхний хвост: P(Z ≥ 1,96) = 0,025002 по стандартному нормальному распределению
- Нормальная кривая симметрична, поэтому нижний хвост такой же: P(Z ≤ −1,96) = 0,025002
- Двусторонний: 2 × 0,025002 = 0,050004
- В процентах: 5,0000 %, то есть те самые 5 %, которые все цитируют
1,96 — значение, выбранное ровно затем, чтобы получилось 5 %, и то, что видно 4,9996, а не ровное 5,0000, не ошибка: истинный квантиль равен 1,959964, поэтому и 1,96 — уже округление. Все три поля степеней свободы заполнены, а читаются только статистика и выбор хвоста, потому что z не нужны ни те, ни другие: два неиспользуемых поля всегда на экране, и пустое или неиспользуемое значение в них ничего не меняет.
t = 2,2281 при 10 степенях свободы
- Распределение Стьюдента с 10 степенями свободы имеет более тяжёлые хвосты, чем нормальная кривая
- Верхний хвост: P(T ≥ 2,2281) = 0,0250015
- Двусторонний: 2 × 0,0250015 = 0,050003, то есть 5,0003 %
Сравните с примером для z, и смысл распределения Стьюдента становится виден: та же площадь хвоста в 5 % стоит на 2,2281, а не на 1,96, потому что маленькой выборке нужно забраться дальше, прежде чем свидетельство станет настолько же необычным. Этот зазор и есть то, чем управляет объём выборки: при 1000 степенях свободы критическое значение t равно 1,962, и два распределения практически одна и та же кривая.
Хи-квадрат 20 при трёх степенях свободы, только верхний хвост
- У распределения хи-квадрат нет отрицательной половины, поэтому здесь доступен только верхний хвост
- P(χ² ≥ 20) при 3 степенях свободы = 0,00016975
- В процентах: 0,017 %
Это та статистика, которую страница хи-квадрата получает из частот 30, 10, 20 и 40 против равномерного ожидания. Значение p вышло маленьким — 0,017 %, — значит четыре категории не равновероятны. Заметьте, чего здесь нет и что приходится спрашивать отдельно: эта страница говорит, насколько необычна статистика, и молчит о наименьшей ожидаемой частоте, а именно она решает, было ли приближение хи-квадрата вообще уместно.
Ограничения
P-значение отвечает на один узкий вопрос, а читают его как ответ на несколько других, которых оно не покрывает. Это не вероятность того, что нулевая гипотеза верна, не вероятность того, что результат получился случайно, и не мера величины эффекта: ничтожное различие становится подавляюще значимым, если выборка достаточно велика, а важное может стоять на p = 0,20 в выборке из двенадцати наблюдений. Оно к тому же не лучше модели, стоящей за статистикой: четыре распределения здесь предполагают независимые наблюдения, а статистика, посчитанная по кластеризованным или повторным измерениям, несёт меньше независимых наблюдений, чем думает её формула, и каждое напечатанное по ней p-значение выходит слишком маленьким. Две проверки здесь выполняются, а не оставляются читателю. Отрицательная статистика отклоняется для хи-квадрата и F, потому что эти распределения живут на положительной полуоси и отрицательное значение означает, что статистику посчитали неверно. И двусторонний вариант для хи-квадрата и F отклоняется, потому что эти распределения несимметричны и общепринятого однозначного двустороннего соглашения для них нет.
Частые вопросы
- Что такое p-значение?
- Вероятность получить статистику критерия не менее крайнюю, чем ваша, при условии, что нулевая гипотеза верна и модель за статистикой выбрана правильно. Оно описывает данные, а не гипотезу: маленькое p-значение говорит, что наблюдённый результат был бы необычен, если бы ничего не происходило, и это не то же самое, что «что-то происходит». Шаг от него к выводу идёт через уровень значимости, выбранный заранее, и через всё, что вы знаете о предмете помимо чисел.
- Брать один хвост или два?
- Два, если вы не решили иначе до того, как увидели данные, и не можете назвать предсказанное направление. Двусторонний критерий считает свидетельством против нуля результат в любую из сторон, и это соответствует тому, как большинство вопросов и ставится: лекарство, которое делает хуже, — тоже находка. Односторонний вариант законен, но он вдвое уменьшает p-значение, а выбор хвоста после взгляда на данные — самый распространённый способ изготовить значимый результат из ничего. Если сомневаетесь, берите двусторонний: это осторожный выбор, и его же ждёт рецензент.
- С каким уровнем значимости сравнивать p-значение?
- С тем, который вы зафиксировали до сбора данных, — по традиции это 0,05, но сама традиция скорее привычка, чем результат. Здесь он намеренно не входной, и вердикт не печатается, потому что одно и то же p-значение 0,04 в одном деле открытие, а в другом шум: просеивать десять тысяч генов в поисках сигнала или проверять одну гипотезу, за которой стоит десять лет прошлой работы, — это очень разные пороги. Стоит держаться одного: уровень выбирается заранее и указывается рядом с p-значением, а не подгоняется после того, как число оказалось на экране.
- Почему нельзя выбрать два хвоста для хи-квадрата или F?
- Потому что эти два распределения несимметричны, и общепринятого способа сделать их двусторонними нет. Обычный рецепт — удвоить меньший хвост — ведёт себя хуже всего там, где это важнее всего: при хи-квадрате ровно 0, то есть при идеальном совпадении наблюдения с ожиданием и, значит, при самом незначимом результате из возможных, он возвращает p-значение 0 %. Идеальное совпадение, показанное как максимальная значимость, — не погрешность округления, а неверный ответ, и выглядел бы он на экране совершенно обычно. У симметричного распределения два хвоста определены однозначно, и удвоение одного из них точно; для несимметричного один верхний хвост отвечает на тот вопрос, который и задают: насколько удивительна настолько большая статистика?
- Почему страница отклоняет отрицательную статистику хи-квадрата или F?
- Потому что ни та, ни другая статистика не может быть отрицательной, и отрицательное значение означает, что число пришло не из того критерия, которому его приписывают. Обе построены из квадратов: хи-квадрат из квадратов расхождений между частотами, F из отношения двух дисперсий, — а квадрат никогда не бывает меньше нуля. Страница могла бы вернуть 100 %, и арифметически это было бы согласованно, но тогда она приняла бы неверно посчитанный ввод и подала его как настоящий результат. Отказ здесь ничего не стоит, потому что законного отрицательного хи-квадрата, который он заблокировал бы, не существует.
- Почему на этой странице нет таблицы критических значений?
- Потому что таблицу p-значений пришлось бы индексировать по статистике критерия, а статистика может быть любым числом, так что строк в такой таблице понадобилось бы бесконечно много. Таблицы в конце учебника устроены наоборот: несколько строк для принятых уровней значимости и столбцы для возможных степеней свободы, и на страницу они помещаются только потому, что уровней мало и они согласованы заранее. Эта страница считает площадь хвоста ровно при той статистике, которую вы ввели, а таблица так не умеет — она может лишь сказать, попало ли ваше значение выше или ниже перечисленных в ней. Ближайшая таблица этого набора — на странице критического значения, где строки это уровни значимости, а столбцы дают соответствующее z. Две страницы — один и тот же факт, прочитанный с разных концов, поэтому каждая и ссылается первой именно на другую.
Источники
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the cumulative function a tail probability is read from, and the table it is normally looked up in) — National Institute of Standards and Technology (NIST)
- 6.2 Using the Normal Distribution — Introductory Statistics 2e (reading probabilities off a normal curve, including the upper and lower complements a two-tailed test is assembled from) — OpenStax, Rice University
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (a test statistic as a quantity with a distribution under a stated hypothesis, which is what makes a tail area meaningful) — National Institute of Standards and Technology (NIST)