Калькулятор критерия хи-квадрат
Результат
Статистика хи-квадрат
- P-значение
- 0,0170 %
- Степени свободы
- 3
- Наименьшая ожидаемая частота
- 25,0000
Критерий хи-квадрат сравнивает подсчитанные по категориям частоты с теми, которые вы ожидали, и печатает статистику, число степеней свободы и p-значение к ней. Это критерий согласия: критерий хи-квадрат отвечает на любой вопрос вида «одинаково ли велики группы» — честна ли кость, одинаково ли часто выбирали четыре варианта, совпадает ли наблюдённая частота в каждой категории с ожидаемой, которую было за чем предсказать. Оставьте ожидаемые частоты пустыми — и страница решит, что все категории равновероятны; это и самый частый случай, и тот, для которого ничего не надо считать заранее. Наименьшая ожидаемая частота печатается рядом, потому что именно с ней сверяют условия применимости самого критерия.
Формула
χ² = Σ ( O − E )² / E df = k − 1 p = P( χ² ≥ χ²₀ )
- O
- Наблюдаемая частота в каждой категории — счёт, а не измерение, поэтому числа целые, а их сумма равна объёму выборки. Ноль здесь допустим: наблюдаемая частота, равная нулю, означает, что категория не встретилась ни разу, и это результат, а не ошибка
- E
- Ожидаемая частота в каждой категории, то есть то, что предсказывает нулевая гипотеза, а не то, что вы надеетесь увидеть. Если оставить её пустой, ожидаемая частота становится суммой, делённой на число категорий, и критерий спрашивает, равновероятны ли категории
- k
- Число категорий, оно читается по длине введённого списка. Оно задаёт степени свободы и оно же то, по скольким категориям усредняются ожидаемые частоты, когда их оставляют пустыми, поэтому один список частот определяет и то, и другое
- df
- Степени свободы, и это k − 1, а не k. Вычитание здесь забывают чаще всего: как только известны сумма и все частоты, кроме одной, последняя частота определена, поэтому категории несут на одну единицу информации меньше, чем их самих
- χ²₀
- Статистика, которую посчитала эта страница, подставленная в собственное нулевое распределение, чтобы получить площадь хвоста. Это та же операция, что и чтение значения по нормальной кривой, только вместо нормальной кривой здесь кривая хи-квадрата, — и именно поэтому p-значению нужны не только значение статистики, но и степени свободы
Берите её, когда данные — это наборы подсчитанных частот по категориям, а вопрос в том, согласуются ли эти количества с каким-то предсказанием. Именно счёт отличает этот критерий от критериев о среднем и о доле: наблюдения здесь не измерены по шкале, и важно лишь то, сколько их попало в каждую корзину, а не насколько велико было каждое. Предсказанием может быть равномерное разбиение или набор ожидаемых частот, построенный по прошлым данным: общенациональный показатель, приложенный к местному населению, менделевское соотношение, вывод модели. Критерий хорош ровно настолько, насколько хороши эти ожидания: он сравнивает подсчитанное с тем, что вы назвали, и не заметит, что само предсказание было неверным. Перед тем как доверять p-значению, стоит проверить два условия, и первое из них страница печатает за вас: наименьшая ожидаемая частота — это та самая величина, о которой говорит обычное правило.
Разобранные примеры
Четыре категории с неровным счётом и пустым полем ожиданий
- Сумма равна 100, и при пустом поле ожиданий на каждую из 4 категорий приходится по 100 / 4 = 25
- Квадраты отклонений от 25: (30 − 25)² = 25, (10 − 25)² = 225, (20 − 25)² = 25, (40 − 25)² = 225
- Разделите каждое на его ожидаемые 25 и сложите: 1 + 9 + 1 + 9 = 20
- Степени свободы: k − 1 = 3, а площадь хвоста за 20 равна 0,017 %
Это режим по умолчанию, и он выбран намеренно неровным: 40 и 10 против ожидания в 25 на каждую. Значение p получается 0,017 %, то есть частоты далеки от равномерного разбиения, а наименьшая ожидаемая частота 25 уверенно выше любого из употребительных порогов, так что приближение, на котором держится p-значение, стоит здесь на твёрдой почве. Заметьте, что ожидаемые частоты не пришлось вводить: пустое поле и есть способ выразить равномерное разбиение, и ради этого поле и сделано необязательным.
Три категории против ожиданий из прошлого опроса
- Оба списка дают в сумме 100, значит ожидание согласуется с подсчитанным и критерий можно применять
- Квадраты отклонений: (50 − 60)² = 100, (30 − 30)² = 0, (20 − 10)² = 100
- Разделите на каждое ожидание и сложите: 100/60 + 0/30 + 100/10 = 1,6667 + 0 + 10 = 11,6667
- Степени свободы: 3 − 1 = 2, а площадь хвоста за 11,6667 равна 0,2928 %
Оба списка должны описывать одно и то же число наблюдений, и здесь оба дают 100 — именно это и делает второй список гипотезой о первом, а не другим экспериментом. Читать слагаемые по одному поучительно: средняя категория совпала с ожиданием в точности и не дала ничего, а третья принесла десять из одиннадцати с половиной пунктов статистики, хотя она самая маленькая, — потому что промахнулась мимо ожидания на 100 %. Наименьшее ожидание 10 всё ещё выше обычно требуемого уровня.
Монета, подброшенная 20 раз, против равномерного разбиения
- Ожидаемые частоты: 20 подбрасываний, поделённые поровну между двумя исходами, дают 10 и 10
- Квадраты отклонений: (12 − 10)² = 4 и (8 − 10)² = 4
- Разделите и сложите: 4/10 + 4/10 = 0,8
- Степени свободы: 2 − 1 = 1, а площадь хвоста за 0,8 равна 37,1093 %
12 орлов из 20 выглядят как смещённая монета, пока не прочитано p-значение: 37 % честных монет дают разброс не менее неровный, так что результат ничем не примечателен. Это та же арифметика, что и в первом примере, только на самой маленькой осмысленной таблице, и она показывает, почему статистику никогда не читают в одиночку: 0,8 и 20 — несопоставимые числа, и на одну шкалу их ставит только p-значение. У случая с двумя категориями есть и полезное сокращение: статистика хи-квадрат равна квадрату z, который дал бы критерий для двух долей.
Ограничения
P-значение опирается на приближение, которому нужны достаточно большие ожидаемые частоты, и напечатанная наименьшая ожидаемая частота — это то, с чем его сверяют; учебники расходятся в том, где проходит граница, и в ходу и «не меньше 5 в каждой категории», и «не меньше 1 в каждой и не меньше 5 в большинстве». Когда ожидания слишком малы, приближение отказывает тихо, возвращая p-значение обычного вида. Частоты к тому же предполагаются независимыми, а это нарушается при парных или повторных измерениях и при кластерной выборке, и каждое из этих нарушений делает статистику слишком большой. Сами ожидания принимаются как данность, поэтому критерий против неверного предсказания отвечает на другой вопрос. И наконец, малое p-значение говорит, что частоты несовместимы с ожиданием, но не говорит почему: оно не указывает, какая категория виновата, и при нескольких категориях различия, которые двигают статистику, стоит осмотреть по отдельности.
Частые вопросы
- Что вообще показывает критерий хи-квадрат?
- Согласуются ли подсчитанные частоты с ожидаемыми при данном числе наблюдений. Статистика растёт вместе с суммарным квадратом расхождения между наблюдением и ожиданием, поделённым на величину каждого ожидания, поэтому один и тот же относительный промах весит больше, когда ожидания малы. Затем p-значение говорит, как часто честный мир давал бы расхождение не меньше этого. Это критерий обо всей таблице, а не об отдельной категории, и два этих чтения легко перепутать, когда одна категория очевидно выбивается.
- Что будет, если оставить ожидаемые частоты пустыми?
- Страница решит, что все категории равновероятны, и посчитает ожидаемую частоту как сумму, делённую на число категорий. Это самое частое применение критерия — кость, рулетка, четыре кнопки, которым следовало бы получать одинаковый поток, — и оно избавляет от набора списка, все значения которого и так одинаковы. Это же единственное прочтение, доступное, когда прошлых данных, по которым можно предсказать разбиение, нет. Вводите ожидаемые частоты, когда у вас есть настоящее предсказание: прошлогоднее распределение или теоретическое соотношение, — потому что критерий против равномерного разбиения и критерий против конкретной модели отвечают на разные вопросы, и только второй использует уже имеющуюся у вас информацию.
- Почему оба списка должны давать одну и ту же сумму?
- Потому что ожидаемые частоты в критерии согласия выводятся из общего числа наблюдений, а не выбираются свободно: они описывают, как эти же наблюдения распределились бы, будь гипотеза верна. Два списка с разными суммами описывают два разных эксперимента, и статистика, посчитанная по ним, не проверяет ничего. Когда каждая ожидаемая частота записана целым числом, каждая может отклониться на пол-единицы, не меняя замысла, поэтому страница допускает отклонение 0,5 на категорию: 20,5, 20,5 и 20,5 против суммы 60 принимаются, поскольку это округлённые значения точного равномерного разбиения по 20.
- Может ли у категории быть нулевая частота?
- У наблюдённой — да, у ожидаемой — нет, и эта асимметрия прямо следует из формулы. Наблюдённый ноль — обычный результат, категория просто не встретилась, и квадрат отклонения выходит большим, как и должно быть. Ожидаемый ноль использовать нельзя, потому что он стоит в знаменателе и слагаемое обратилось бы в бесконечность: предсказание «эта категория не может произойти» не то предсказание, которое этот критерий способен взвесить против счёта. Если настоящее ожидание очень мало, но не ноль, критерий его принимает, а наименьшая ожидаемая частота под результатом показывает, проблема ли это.
- Где таблица критических значений хи-квадрата?
- Не на этой странице, и по той же причине, что и на странице p-значения: единственное нужное значение уже напечатано, поскольку статистика и её степени свободы определяют площадь хвоста напрямую. Таблицу пришлось бы строить под один уровень значимости, и читатель, работающий на 1 %, смотрел бы на таблицу, противоречащую панели. Искать её нужно на странице критического значения, и есть ещё одна причина, по которой эта страница не может показать таблицу даже в принципе: её степени свободы равны k − 1, где k — сколько категорий ввёл читатель, поэтому нужная строка таблицы неизвестна, пока не введены частоты.
Источники
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (a test statistic as a quantity with its own distribution under the null hypothesis, which is what makes the tail area computable) — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e (relative frequency as an estimate of a probability, which is the step that turns a category's probability into an expected count of observations) — OpenStax (Rice University)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the same reading of a tail area off a cumulative curve that this page performs with the chi-square curve instead) — National Institute of Standards and Technology (NIST)