Калькулятор погрешности
Результат
Предельная ошибка
- Стандартная ошибка
- 1,2000
- Критическое значение
- 1,9842
Калькулятор погрешности превращает разброс выборки в то самое «плюс-минус», которое называют вместе с результатом опроса. Ему нужно ровно три вещи, и страница спрашивает именно их: доверительный уровень — 90, 95 или 99 %, объём выборки и то, насколько изменчивой оказалась оцениваемая величина, а это стандартное отклонение, когда оценивается среднее, и сама доля, когда оценивается процент. Арифметика здесь — критическое значение, умноженное на стандартную ошибку, и печатаются оба множителя, потому что две самые частые ошибки живут по одной в каждом: подставить критическое значение t там, где нужен z, или разделить на объём выборки вместо его квадратного корня. От центра выборки результат не зависит никак. Погрешность говорит, насколько оценка может отклониться, а не чему она равна: опрос с 60 % и погрешностью в 3 процентных пункта с тем же успехом мог прийти из совокупности с 57 % или 63 %.
Формула
Погрешность: ME = z* × SE Стандартная ошибка среднего: SE = s / √n Стандартная ошибка доли: SE = √(p(1 − p) / n)
- ME
- Погрешность — половина ширины доверительного интервала, в единицах оценки. Это именно полуширина, а не ширина, потому что интервал записывают как оценка ± ME: одно и то же число вычитается с одной стороны и прибавляется с другой. Единицы следуют за оценкой: процентные пункты для доли и то, в чём измерялись данные, для среднего
- z*
- Критическое значение. В режиме среднего это всегда значение t при n − 1 степенях свободы, а не привычное 1,96. Разница мала рядом с теми объёмами выборки, какие обычно бывают у опросов, но она не нулевая и максимальна ровно там, где погрешность наибольшая: при n = 2 значение t равно 12,7062, поэтому выборка из двух человек со стандартным отклонением 4 получает погрешность 35,94
- s
- Выборочное стандартное отклонение, используется только в режиме среднего. В опросе оно редко известно заранее, поэтому опросы и сообщают доли, а не средние: для вопроса «да или нет» изменчивость следует из самого процента, и отдельно оценивать ничего не нужно
- p
- Выборочная доля: в формуле это дробь, на панели — процент. Её вклад в ширину максимален при 50 %: половина выборки согласна, половина нет — это самое неопределённое состояние, какое бывает у вопроса с двумя ответами, поэтому погрешность, которую называют для опроса, обычно относится к наихудшему случаю p = 0,5, а не к собственному результату этого опроса
- n
- Объём выборки, входящий как √n. Из-за этого квадратного корня удвоение выборки не уменьшает погрешность вдвое — оно делит её лишь на 1,41, так что для двукратного уменьшения выборку нужно увеличить вчетверо. Это ещё и единственный множитель, которым распоряжается исследователь: p берётся из данных, а доверительный уровень — утверждение о том, насколько осторожным должен быть ответ
Обращайтесь к нему, когда данные уже собраны и нужно понять, какая часть сообщённой цифры — шум, или когда вы читаете чужое число и хотите увидеть, из чего оно состоит. Две самые полезные вещи здесь видны на панели, а не в главном результате: критическое значение, которое выдаёт, что было использовано — t или z, а значит, учёл ли аналитик оценивание разброса, и стандартная ошибка, которая делает закон квадратного корня заметным: учетверите выборку, и она уменьшится вдвое. Для планирования исследования, а не для его разбора, лучше подходит страница об объёме выборки: она разворачивает вопрос и спрашивает, сколько ответов нужно для погрешности, которую вы уже признали приемлемой. Разбирая результат опроса, помните, что погрешность охватывает только ошибку выборки. Она ничего не говорит о том, кто отвечал, не был ли вопрос наводящим и не была ли выборка построена так, что у любого человека из совокупности был шанс в неё попасть. Эти проблемы не уменьшаются с ростом n, и большая выборка с малой погрешностью — как раз то, из-за чего смещённый опрос выглядит авторитетно.
Разобранные примеры
Значения по умолчанию: среднее, оценённое по 100 наблюдениям
- Стандартная ошибка: s / √n = 12 / 10 = 1,2
- Критическое значение: значение t при 99 степенях свободы, 1,9842, а не 1,9600
- Погрешность: 1,9842 × 1,2 = 2,3811
- Сама оценка в число входных данных не входит, поэтому ответ — полуширина, а не интервал
Читать стоит строку с критическим значением, потому что именно на ней расчёт руками обычно и разваливается: сто наблюдений — большая выборка, и подстановка 1,96 вместо 1,9842 меняет ответ на 1,2 %. Здесь это мало, а при n = 2 огромно: та же замена превратила бы 35,9 процентного пункта в 5,5, то есть занизила бы неопределённость в шесть раз. Страница печатает критическое значение именно для того, чтобы этот шаг можно было проверить, а не прятать его внутри умножения.
Доля по 1000 ответам
- Доля как дробь: 50 % = 0,5
- Стандартная ошибка в процентных пунктах: √(0,5 × 0,5 / 1000) × 100 = 1,5811
- Критическое значение: нормальное значение 1,9600, потому что режим доли использует z
- Погрешность: 1,96 × 1,5811 = 3,099 процентного пункта
Это форма той цифры, которую цитируют газеты, и в ней стоит развести три детали. Критическое значение здесь 1,9600, тогда как пример со средним выше использовал 1,9842, потому что изменчивость доли полностью определяется p и не нуждается в степенях свободы. Поле стандартного отклонения стоит на панели неиспользованным: в этом режиме изменчивость берётся из процента, а не из отдельной оценки. И p = 50 % — это наихудший случай, поэтому число обобщается: у любого вопроса в том опросе погрешность не больше этой.
Девять наблюдений ставят погрешность ровно на критическое значение
- Стандартная ошибка: 3 / √9 = 1, ровно
- Критическое значение при 8 степенях свободы: 2,306
- Погрешность: 2,306 × 1 = 2,306
- Две из трёх строк печатают одно и то же число, и это совпадение выбранных входных данных, а не правило
На это совпадение стоит взглянуть один раз, чтобы потом не принять его за закономерность: стандартная ошибка вышла ровно 1, поэтому умножение ничего не меняет и критическое значение остаётся видимым как ответ. Девять наблюдений и стандартное отклонение три — естественная постановка для малой выборки, и это то же самое значение t, которое даёт страница о доверительном интервале при n = 9: обе страницы делят весь расчёт и различаются только тем, подставлено ли выборочное среднее, чтобы сдвинуть результат.
Те же данные, прочитанные при 99 %, а не при 95 %
- Стандартная ошибка не изменилась: 1,2, потому что в данных ничего не сдвинулось
- Критическое значение при 99 % и 99 степенях свободы: 2,6264
- Погрешность: 2,6264 × 1,2 = 3,1517
- Сравните со случаем 95 %: 2,3811, то есть дополнительная уверенность стоит на 32 % большей ширины
Меняется только одна из трёх строк, и в этом и смысл того, что печатаются все три: доверительный уровень задевает критическое значение и ничего больше, а объём выборки задевает стандартную ошибку и ничего больше. Две ручки независимы, и путать их — распространённый способ неверно понять, что же изменилось. Сам обмен стоит назвать: 99 % уверенности — это не более высокая точность, а более высокая осторожность. Она покупает более широкий интервал, который накрывает истину чаще и при этом менее плотно прижимает оценку в каждом отдельном случае.
Ограничения
Погрешность охватывает только один источник ошибки: изменчивость, возникающую оттого, что измерена выборка, а не вся совокупность. О смещении она не говорит ничего, и эти две вещи не взаимозаменяемы: выборка из тысячи добровольцев с сайта имеет маленькую погрешность и может ошибаться на двадцать пунктов, потому что решившие ответить — не случайное извлечение. Погрешность также предполагает, что наблюдения независимы. Опрос нескольких человек из одного домохозяйства или двукратное измерение одного и того же объекта снижают эффективный объём выборки намного ниже числа ответов, и формула об этом знать не может: погрешность выходит слишком узкой. И формула для среднего, и формула для доли — приближения для больших выборок: версия для доли особенно ненадёжна, когда n·p или n·(1 − p) малы, а это как раз случай редких категорий — долю в 2 % по выборке из 100 вообще не стоит сообщать с симметричным «плюс-минус». И наконец, погрешность описывает одну оценку в отдельности. Для сравнения двух групп это неподходящий инструмент: там важна погрешность разности, а она не равна сумме двух отдельных погрешностей, если только группы не независимы.
Частые вопросы
- Что на самом деле означает погрешность в 3 %?
- Она означает, что если повторить тот же опрос много раз, то около 95 % получившихся интервалов — сообщённая цифра плюс-минус 3 процентных пункта — накрыли бы истинное значение для совокупности. Это не значит, что истинное значение с уверенностью лежит в пределах 3 пунктов, и не значит, что опрос ошибается не более чем на 3 пункта. Отсюда следуют два вывода, которые легко упустить. Истинное значение либо внутри интервала, либо снаружи, поэтому 95 % описывают процедуру, а не этот отдельный результат. И погрешности складываются, когда вы сравниваете группы: если два кандидата в опросе с погрешностью 3 пункта у каждого расходятся на 4 пункта, гонка не «в пределах погрешности» в каком-то простом смысле — у разности своя погрешность, и она больше каждой из двух. Читая результаты опроса, держите это в голове.
- Почему при большей выборке погрешность меньше, но не пропорционально?
- Потому что объём выборки входит в формулу под квадратным корнем. Переход от 100 ответов к 400 уменьшает погрешность вдвое, а от 400 к 1600 — ещё вдвое; каждое такое уменьшение стоит вчетверо большей выборки. Это самый значимый факт о планировании опроса, и он объясняет, почему опросы сходятся на нескольких сотнях — двух тысячах респондентов: первая тысяча покупает большую часть доступной точности, а следующая тысяча покупает вдвое меньше. По той же причине погрешность нельзя улучшить более качественным анализом. Единственный рычаг — больше данных, и работает он через квадратный корень.
- Большая погрешность — это хуже?
- Она честнее, а не хуже. Более широкий интервал чаще накрывает истину, поэтому исследование, сообщающее ±5 пунктов при 99 % уверенности, делает более безопасное утверждение, чем сообщающее ±3 при 90 %: эти два числа несравнимы, пока не назван доверительный уровень. Действительно хуже — несообщённая погрешность или погрешность без указания уровня уверенности, потому что тогда читатель не может понять, какой вес имеет число. Ещё одно, о чём говорит широкая погрешность, — просто то, что выборка была маленькой, а это информация, а не дефект: она сообщает, что исследование не способно различить тонкие расхождения, и читать его так, будто оно способно, не следует.
- Почему страница отвергает долю 0 % или 100 %?
- Потому что формула там вырождается. Стандартная ошибка для доли равна √(p(1 − p)/n), а при p = 0 или p = 1 множитель p(1 − p) равен нулю, поэтому погрешность выходит ровно нулевой. Напечатать «60 % ± 0 пунктов» — это заявить об определённости, которой никакая выборка подтвердить не может: получается, что значение для совокупности равно 60 %, тогда как данные говорят лишь о том, что никто в этой выборке не вышел за пределы категории. Существуют корректные способы работать с нулевым или полным счётом, и все они что-то добавляют к счётам, а не доверяют пустой ячейке; ни один из них не является обычной погрешностью, поэтому страница отказывается, а не возвращает число, которое прочли бы как уверенность.
- Учитывает ли погрешность смещённую выборку?
- Нет, и это важнейшее ограничение всей идеи. Погрешность измеряет выборочную изменчивость — ту часть ошибки, которая возникает оттого, что мы смотрим на часть совокупности, а не на всю её. Смещение — ошибка другого рода, порождённая способом отбора или формулировкой вопросов, и она не уменьшается с ростом выборки. Добровольный интернет-опрос десяти тысяч человек может иметь погрешность в один процентный пункт и при этом ошибаться на пятнадцать, потому что ответившие — не случайное извлечение из совокупности. Большие выборки делают ошибку выборки маленькой; смещение они делают лишь более точным на вид. Разбирая любую сообщённую погрешность, сначала спросите, как строилась выборка.
- Чем погрешность отличается от стандартной ошибки?
- Стандартная ошибка — это исходный разброс оценки, а погрешность — тот же разброс, умноженный на критическое значение, которое зависит от доверительного уровня. Поэтому стандартная ошибка есть свойство одних только данных, а погрешность — утверждение о том, сколько уверенности вы хотите в них вложить. При 95 % множитель близок к двум, поэтому два числа часто отличаются меньше чем вдвое и потому их путают. Обе строки и печатаются на панели: стандартная ошибка говорит, сколько информации несёт выборка, а погрешность — что вы решили на основании этой информации заявить.
Источники
- 1.3.5.6. Measures of Scale — e-Handbook of Statistical Methods (the standard deviation the standard error is built from, and the n − 1 denominator the degrees of freedom come from) — National Institute of Standards and Technology (NIST)
- 6.2 Using the Normal Distribution — Introductory Statistics 2e (the critical value that multiplies the standard error, and the tail areas a confidence level is split into) — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the sampling distribution whose spread is the standard error, which is what the plus-or-minus sign is describing) — National Institute of Standards and Technology (NIST)