Калькулятор объёма выборки
Результат
Нужный объём выборки
- Критическое значение
- 1,9600
Калькулятор объёма выборки отвечает на вопрос, который возникает до опроса: сколько ответов нужно, чтобы уложиться в приемлемую погрешность? Погрешность здесь задаётся в процентных пунктах, а не в долях единицы. Укажите доверительный уровень, целевую погрешность и примерное значение доли, которое ожидаете увидеть, — и калькулятор вернёт наименьший объём выборки, при котором цель достигается. Формула — та же зависимость, что и в калькуляторе доверительного интервала, только обращённая: та страница считает ширину по выборке, а эта решает уравнение относительно объёма. Когда опрос охватывает небольшую совокупность, поправка на конечную совокупность уменьшает ответ, а для коллектива предприятия или одной школы — очень заметно.
Формула
n₀ = z² · p (1 − p) / e² малая совокупность: n = n₀ / ( 1 + (n₀ − 1) / N )
- z
- Критическое значение для доверительного уровня: 1,9600 при 95 %, 1,6449 при 90 % и 2,5758 при 99 %. Оно печатается отдельной строкой, потому что это единственное число в формуле, которое берётся из доверительного уровня, а не из ваших предположений о совокупности
- p
- Ожидаемая доля, которую вы рассчитываете найти, в виде дроби. Это единственный вход, который является догадкой, и входит он как p(1 − p), а это выражение максимально при p = 0,5: значит, 50 % — то предположение, которое даёт самую большую и самую безопасную выборку
- e
- Погрешность в виде дроби — полуширина, которую вы готовы принять, в тех же единицах, что и доля. В знаменателе она возводится в квадрат, поэтому её уменьшение вдвое увеличивает выборку примерно вчетверо
- n₀
- Объём выборки для совокупности настолько большой, что её размер уже не важен. Это и есть ответ, когда совокупность неизвестна, а когда она известна — это вход для поправки, а не окончательный ответ
- N
- Объём совокупности; вводится как 0, когда он неизвестен или практически неограничен. Поправка делит n₀ на число, большее доли n₀/N, поэтому исправленная выборка всегда выходит меньше N: попросить больше людей, чем существует, эта формула породить не может
Обращайтесь к нему до сбора данных, когда стоимость выборки реальна: опрос с вознаграждением за каждый ответ, лабораторное измерение с ценой за образец, клиническое исследование с планом набора. Порядок решений такой: зафиксируйте погрешность, с которой готовы жить, зафиксируйте доверительный уровень, затем предположите долю и прочитайте объём выборки. Только первое из этого — суждение об исследовании; остальные два — обычай или догадка. Если ответ не по средствам, честный ход — расширить погрешность и сказать об этом в отчёте, потому что погрешность, которую вы не можете оплатить, не является целью. Вводите объём совокупности всегда, когда совокупность действительно мала — меньше нескольких тысяч, — потому что там поправка существенна, а её игнорирование означает набор куда большего числа людей, чем нужно исследованию.
Разобранные примеры
Всероссийский опрос при 95 % уверенности и ±5 пунктах
- Критическое значение при 95 % уверенности: 1,96
- При p = 0,5 произведение p(1 − p) равно 0,25 — своему наибольшему возможному значению
- n₀ = 1,96² × 0,25 / 0,05² = 3,8416 × 0,25 / 0,0025 = 384,1459
- Округляем вверх до целого человека: 385 ответов
385 — то самое число, из которого выросло известное утверждение, что опрос примерно тысячи человек точен до трёх пунктов: сузьте погрешность до ±3, и ответ станет 1068, откуда эта цифра и берётся. Объём совокупности оставлен нулём, потому что всероссийский опрос — ничтожная доля страны, и при таком отношении поправка изменила бы ответ меньше чем на одного человека.
Тот же опрос с более жёсткой погрешностью ±3 пункта
- Критическое значение не изменилось: 1,96, потому что доверительный уровень остался прежним
- n₀ = 1,96² × 0,25 / 0,03² = 0,9604 / 0,0009 = 1067,0719
- Округляем вверх: 1068 ответов
- Сравните с 385: погрешность уменьшилась в 1,667 раза, а выборка выросла в 2,78 раза, то есть в 1,667²
Точность покупается квадратично. Переход от ±5 к ±3 пунктам — это не рост работы на 67 %, а рост на 178 %, потому что погрешность в знаменателе возводится в квадрат. Практическое следствие: у того, насколько точно можно дёшево провести опрос, есть нижняя граница, и заявлять погрешность жёстче примерно ±3 пунктов означает выборку в тысячи человек — а это как раз тот диапазон, где смещение из-за неответов начинает значить больше, чем ошибка выборки, которой управляет формула.
Опрос сотрудников компании из 1000 человек
- Непоправленное значение по-прежнему 384,1459, потому что оно ещё ничего не знает о совокупности
- Поправка: 384,1459 / ( 1 + 383,1459 / 1000 ) = 384,1459 / 1,3831459 = 277,73
- Округляем вверх: 278 сотрудников
- Это 28 % коллектива вместо 38 %, которые дало бы непоправленное значение
Именно поправка делает опросы малых совокупностей доступными: 278 вместо 385, экономия больше сотни интервью при той же заявленной погрешности. Она растёт по мере того, как выборка занимает всё большую долю совокупности. Для 100 сотрудников ответ равен 80 — выбрать больше, чем у вас есть, нельзя, — а для миллиона сотрудников поправка стоит одного человека, поэтому 0 для неизвестной совокупности и есть разумное значение по умолчанию, а не упрощение.
Ограничения
Формула определяет объём выборки ответов, а не списка приглашений. Если треть приглашённых не отвечает, то 385 ответов означают, что пригласить надо около 580 человек, а если ответившие систематически отличаются от неответивших, никакой объём выборки не исправит возникшее смещение — он лишь сделает ошибку выборки меньше полной ошибки. Модель также предполагает, что каждый ответ — независимое извлечение из совокупности, а это нарушается при группированном отборе: опрос 400 учеников из 8 классов имеет эффективную выборку гораздо ближе к 8, и число с этой страницы стоит умножить на коэффициент дизайна, прежде чем им пользоваться. Оценка сделана для одной доли; среднее требует вместо неё стандартного отклонения, которого эта страница не принимает, а опрос, который будут разбирать по подгруппам, нужно рассчитывать на самую маленькую подгруппу, а не на целое. И наконец, все три предложенных доверительных уровня — это обычаи, и ни один из них не учитывает нескольких сравнений, которые реальный анализ обычно делает.
Частые вопросы
- Сколько ответов мне нужно?
- Для обычных ±5 процентных пунктов при 95 % уверенности — 385, а для ±3 пунктов — 1068. Эти два числа покрывают большинство публикуемых опросов, и оба предполагают совокупность настолько большую, что её размер не играет роли. Если совокупность мала настолько, что вы могли бы охватить заметную её долю, введите её размер, и поправка снизит цифру: 1000 сотрудников требуют 278 ответов вместо 385, а 200 сотрудников — 132. Отталкивайтесь сначала от погрешности, потому что именно это число ваша аудитория и прочитает.
- Почему ожидаемая доля по умолчанию равна 50 %?
- Потому что p(1 − p) максимально при p = 0,5, а объём выборки пропорционален этому произведению, так что 50 % даёт самый большой ответ, какой только может потребоваться. Это и делает такую долю безопасным предположением, когда вы действительно не знаете: опрос, вернувшийся с 60 %, будет иметь погрешность чуть лучше запланированной. Быть конкретнее выгодно: при p = 90 % множитель падает с 0,25 до 0,09, поэтому та же погрешность требует 36 % выборки. Берите значение, отличное от 50 %, только если у вас есть защитимое основание — например, предыдущая волна того же опроса.
- Что делает поправка на конечную совокупность?
- Она уменьшает выборку, когда совокупность достаточно мала, чтобы бесповторный отбор из неё заметно снижал неопределённость. Сила эффекта зависит от того, какую долю совокупности вы охватываете: для 1000 сотрудников поправка снимает 107 человек из 385 и оставляет 278, а для 100 сотрудников ответ падает до 80. Вводите 0 вместо объёма совокупности, когда он неизвестен или очень велик, и вводите настоящее число, когда совокупность меньше нескольких тысяч, — это то поле, которое чаще всего меняет уже посчитанный ответ.
- На какой погрешности и каком уровне уверенности остановиться?
- ±5 пунктов при 95 % — значение по умолчанию в большинстве публикуемых работ, ±3 пункта — там, где решение зависит от близкого результата, ±10 пунктов — для поисковых работ, где важно только большое различие. По уровню уверенности: 95 % — обычай, а 99 % стоят примерно на 73 % больше выборки ради интервала, который шире лишь на треть. Прежде чем ужесточать любой из двух параметров, посмотрите, сколько стоит ответ: ±3 пункта при 99 % уверенности требуют 1843 ответов, то есть примерно впятеро больше значения по умолчанию. Если это не по средствам, сообщите более широкую погрешность, а не набирайте выборку, которую не сможете завершить.
- Почему ответ округляется вверх, до целого человека?
- Потому что дробное число — это точная арифметика, а набрать можно только целое, и два обычая перевода одного в другое указывают в разные стороны. Округление до ближайшего могло бы превратить 384,1459 в 384, а это недотягивает до целевой погрешности на волосок — тогда как цель вы и заказывали. Округление вверх гарантирует, что погрешность будет достигнута или улучшена, стоит не более одного лишнего интервью и совпадает с тем, как объём выборки записывают в протоколе, где 385 — это обязательство, а 384,1459 — промежуточное значение.
- Почему на этой странице нет таблицы объёмов выборки?
- Потому что нужная здесь таблица — это сетка «уровень уверенности × погрешность», а эту сетку уже считает панель. Таблица, напечатанная при фиксированных 95 %, противоречила бы панели в тот момент, когда вы переключились на 99 %, а страница, спорящая сама с собой, хуже отсутствия таблицы: читателю пришлось бы решать, какому из двух чисел верить. Вторая причина в том, что таблице пришлось бы ещё и выбрать долю, а 50 % — правильный выбор лишь до тех пор, пока остаётся безопасным значением по умолчанию. Измените уровень уверенности, погрешность, долю или объём совокупности — и ответ пересчитается, а это и есть всё содержание той таблицы, которую ищут.
Источники
- 3.1 Terminology — Introductory Statistics 2e (relative frequency approaching probability as a sample grows, which is the property that makes a target margin of error meaningful in advance) — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the distribution of an estimate, which is what the margin of error is a quantile of) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the cumulative function the critical values come from; the same values, used in reverse here to size a sample rather than to bound an estimate) — National Institute of Standards and Technology (NIST)