Калькулятор медианы
Результат
Медиана
- Меньшее из двух средних значений
- 4,0000
- Большее из двух средних значений
- 5,0000
- Количество
- 8
Медиана — это значение, которое стоит посередине, если список отсортировать: половина чисел оказывается ниже него, половина выше. Это единственная сводная мера набора данных, которую не может сдвинуть одно крайнее измерение: сделайте наибольшее значение в десять раз больше, и медиана останется ровно там, где была. Вставьте числа — по одному в строке либо через точку с запятой, запятую или пробел — и калькулятор отсортирует их, вернёт серединное значение и покажет два средних значения, из которых оно получено, если количество чётное. Ничего здесь не делится ни на n − 1, ни на n, поэтому переключателя «выборка или генеральная совокупность» у этой страницы нет.
Формула
Медиана = серединное значение отсортированного списка; при чётном количестве — среднее двух средних значений
- xᵢ
- Одно значение из набора данных. Важно только его место в отсортированном списке — насколько оно далеко от остальных, в расчёт не входит, и именно поэтому крайнее измерение ответ не трогает
- n
- Сколько значений в списке, здесь не больше двухсот. Нечётное количество даёт одно среднее значение, чётное — два, и медианой становится их среднее
- Y₍ₖ₎
- k-е значение после сортировки списка от меньшего к большему. NIST записывает чётный случай как (Y(N/2) + Y(N/2+1)) / 2 — это ровно та пара наблюдений, которую страница печатает под ответом
- Y₍ₙ/₂₎ и Y₍ₙ/₂₊₁₎
- Два средних значения. Они печатаются, чтобы деление можно было проверить на глаз, а при нечётном количестве это одно и то же число, записанное дважды: посередине действительно стоит ровно одно значение
- M
- Сама медиана. Она несёт исходные единицы данных, а прибавление одной и той же постоянной ко всем значениям сдвигает её на эту постоянную и больше ни на что не влияет
Берите медиану всегда, когда одно измерение может оказаться сильно мимо, а типичное значение всё равно нужно: цены на жильё, доходы, время ожидания — всё, у чего длинный хвост. Она считает позиции, а не размеры, поэтому наибольшее число в списке может быть огромным, а медиана не сдвинется, и эта устойчивость к выбросам и есть вся причина, по которой она существует рядом со средним. Это ещё и естественный центр для упорядоченных меток — шкалы оценок, размера, — где расстояние между двумя соседними категориями ничего не значит и усреднить его нельзя. Двух вещей она не скажет: ничего о разбросе и ничего о значениях вдали от середины. Для чётного количества медиана — это среднее двух значений, стоящих в середине набора данных; добавляйте к ней квартили, когда важна форма распределения, и помните, что на симметричном наборе медиана и среднее почти совпадают, так что заметный промежуток между ними сам по себе кое-что говорит о скошенности.
Разобранные примеры
Чётное количество: два средних значения — 4 и 5
- Отсортируйте: 2, 4, 4, 4, 5, 5, 7, 9
- Сосчитайте: 8 значений, значит, одного среднего нет — средняя пара это 4-е и 5-е
- Четвёртое значение равно 4, пятое равно 5
- Медиана: (4 + 5) ÷ 2 = 4,5
4,5 не совпадает ни с одним числом из списка, и для чётного количества это нормально. Панель печатает рядом 4 и 5 как раз поэтому: без них нельзя понять, усреднила ли программа правильную пару или тихо выбрала одно из двух.
Нечётное количество, и одно значение далеко от остальных
- Отсортируйте: 3, 7, 9, 12, 40
- Сосчитайте: 5 значений, значит, посередине стоит третье
- Медиана: 9 — без деления, потому что среднее значение всего одно
Среднее этих пяти чисел равно 14,2, и его подтянуло вверх число 40; медиана равна 9 и на 40 не смотрит. Замените 40 на 4000 — среднее станет 806,2, а медиана по-прежнему 9. В этом и весь довод в пользу медианы на скошенных данных, и стоит такой расчёт ровно ничего.
Четыре значения, где середина — вообще не значение
- Отсортируйте: 1, 2, 3, 4
- Средняя пара — 2-е и 3-е значения: 2 и 3
- Медиана: (2 + 3) ÷ 2 = 2,5
Для этого случая есть ещё две договорённости — взять из пары нижнее (2) или верхнее (3), — и все три встречаются в учебниках. Эта страница берёт среднее, как это делает и NIST. То же правило действует на страницах квартилей и процентилей, поэтому 2,5 отсюда — это ещё и второй квартиль там.
Ограничения
Медиана — это одна позиция, поэтому обо всём остальном в данных она умалчивает. Два списка могут иметь одну и ту же медиану и выглядеть совершенно по-разному — один плотно собран вокруг неё, другой растянут от края до края, — и поэтому медиану обычно называют вместе с квартилями, а не одну. Она требует отсортированного списка, то есть каждое значение нужно прочитать, прежде чем ответ появится. О самих значениях она не говорит ничего: медиана 9 сообщает, что посередине стоит число около девятки, а не то, что девятка вообще встречается. Для упорядоченных меток — размеров, оценок — арифметика тоже работает, но ответом будет средняя метка, а не число, которое можно сложить. Список ограничен двумястами значениями. Запись вида 1,500 отклоняется, а не угадывается: три цифры после запятой одинаково похожи и на дробь 1,5, и на тысячу пятьсот, поэтому пишите 1500 или 1,5. Правила разделителей здесь одинаковы во всех языках: числа читаются ровно так, как набраны.
Частые вопросы
- Как найти медиану набора чисел?
- Отсортируйте числа от меньшего к большему и сосчитайте их. При нечётном количестве посередине стоит одно значение — если чисел семь, то это четвёртое. При чётном их два, и медианой становится их среднее: для 1, 2, 3, 4 средняя пара — это 2 и 3, поэтому медиана равна 2,5. Вот и весь способ. Панель выше печатает количество, два средних значения и ответ, так что каждый шаг можно проверить, ничего не пересортировывая.
- Почему медиана иногда оказывается числом, которого нет в списке?
- Потому что при чётном количестве одного среднего значения не существует, и медианой становится среднее двух чисел, стоящих по бокам от центра. Число 4,5 выше — не одно из восьми значений, и всё же это верный ответ: половина значений лежит ниже него, половина выше. Два средних значения и печатаются рядом с результатом именно для того, чтобы это не выглядело ошибкой.
- Когда брать медиану, а не среднее?
- Когда одно крайнее измерение может исказить картину: доходы, цены на жильё, время ожидания — всё, у чего длинный хвост с одной стороны. Среднее складывает все значения, поэтому одно далёкое число тянет его на себя; медиана считает только, сколько значений лежит с каждой стороны, и то же самое число для неё ничего не меняет. На симметричном наборе оба ответа почти совпадают, так что разрыв между медианой и средним сам по себе подсказывает, что данные скошены.
- Можно ли вставить столбец прямо из таблицы?
- Да. Переводы строк, табуляции, точки с запятой, пробелы и запятая с пробелом после неё разделяют значения, поэтому вставленный столбец или строка, набранная через точки с запятой, одинаково подходят, а пустые куски пропускаются, а не отклоняются. Читается до двухсот значений. Одна форма отклоняется намеренно: запись вида 1,500 или 1.500, где после разделителя стоят три цифры, — в одних странах это разделитель разрядов, в других десятичная точка, поэтому пишите 1500 или 1,5.
- Есть ли у медианы версия для выборки и для генеральной совокупности?
- Нет, и переключателя для этого на странице нет. Поправка на n − 1 принадлежит мерам разброса, которые делят сумму квадратов отклонений на количество; медиана не делит ничего, она берёт позицию. Выборка у вас или вся группа целиком, серединное значение остаётся серединным значением. Выбор действительно нужен на страницах стандартного отклонения и дисперсии, и там делитель по-настоящему меняет ответ.
- Почему тот же список даёт другую медиану в другом инструменте?
- Почти всегда дело в правиле для чётного количества. В ходу три договорённости: усреднить два средних значения, взять нижнее из них или взять верхнее. Для 1, 2, 3, 4 они дают 2,5, 2 и 3. Эта страница усредняет, следуя определению NIST, и печатает оба средних значения, чтобы было видно, какая именно пара взята. Вторая, более редкая причина — значение, набранное с десятичной запятой, которую другой инструмент прочитал как разделитель.
Источники
- Measures of Location — e-Handbook of Statistical Methods, section 1.3.5.1 — National Institute of Standards and Technology (NIST)
- Measures of the Center of the Data — Introductory Statistics 2e, section 2.5 — OpenStax, Rice University