Зарегистрированная негосударственная некоммерческая организация свидетельство № 1052p

Статьи

Статистика в повседневной жизни: как читать цифры

12 мин чтения

Среднее, медиана и мода, разброс, проценты и процентные пункты, выборка, корреляция и обманчивые диаграммы: простые примеры и практика.

Мы сталкиваемся с цифрами каждый день: средний балл в школе, количество шагов в телефоне, заголовок «выросло в два раза», красивая диаграмма в соцсетях. Большинство этих цифр верны, но понять их неправильно очень легко. Статистика — не только для учёных, это навык правильно читать цифры. В этой статье без сложных формул разберём основные понятия: среднее, медиана и мода (и когда какое из них честнее), разброс, разница между процентами и процентными пунктами, выборка и её репрезентативность, почему корреляция — не причина, обманчивые диаграммы и опасность маленькой выборки. Затем покажем, как всё это посчитать в Excel, дадим список вопросов для проверки цифр в новостях, а в конце предложим практическое упражнение и чек-лист.

Важное замечание: все цифры в статье — условные примеры, а не результаты реальных измерений или исследований. Они придуманы только для того, чтобы показать идею.

Среднее, медиана и мода: когда какое честнее

В обычной речи слово «средний» означает что-то одно, а в статистике есть как минимум три способа описать «центральное значение».

Среднее арифметическое

Все значения складываются и делятся на их количество. Условный пример: Дильшод неделю записывает количество шагов по данным телефона:

  • понедельник — 4000, вторник — 4500, среда — 5000, четверг — 5000, пятница — 5500, суббота — 6000, воскресенье — 21000.

В воскресенье он ходил с друзьями в горы. Сумма — 51000, делим на семь дней и получаем в среднем около 7286 шагов. Но ни в один «обычный» день Дильшод не прошёл больше 7000. Один необычный день потянул среднее вверх.

Медиана

Значения выстраиваются по возрастанию, и берётся то, что стоит посередине. Шаги Дильшода по порядку: 4000, 4500, 5000, 5000, 5500, 6000, 21000. Среднее, то есть четвёртое, значение — 5000. Медиана гораздо лучше описывает его обычный день. Если значений чётное количество, берётся среднее двух центральных.

Мода

Значение, которое встречается чаще всего. Условный пример: учительница Нилуфар оценила контрольную работу 10 учеников по пятибалльной системе: 5, 4, 4, 3, 5, 4, 2, 4, 5, 3. Чаще всего встречается оценка 4 (четыре раза). Мода для этого класса — 4, среднее — 3,9, медиана — 4. Мода особенно полезна для категориальных данных: например, чтобы понять, какой размер школьной формы нужен чаще всего, нужен не средний размер, а именно мода.

Что выбрать

  • Значения близки друг к другу и резких выбросов нет — хорошо работает среднее.
  • Есть несколько очень больших или очень маленьких значений — честнее медиана. Она не «чувствительна» к крайним значениям.
  • На вопрос «что встречается чаще всего?» отвечает мода.

Полезная привычка: смотрите на среднее и медиану вместе. Если они сильно расходятся, в данных есть выбросы, и одно число не даёт полной картины.

Разброс: среднее говорит не всё

Даже если у двух наборов данных одинаковое среднее, сами наборы могут быть совершенно разными. Условный пример: Зарина может ездить на работу двумя автобусными маршрутами. Пять дней она записывала время ожидания каждого в минутах:

  • маршрут 1: 9, 10, 10, 11, 10;
  • маршрут 2: 2, 18, 5, 20, 5.

У обоих среднее время ожидания — 10 минут. Но автобус первого маршрута приходит почти всегда в одно и то же время, а второго — то сразу, то через 20 минут. Если нельзя опоздать на важную встречу, Зарине лучше выбрать первый маршрут. Эту разницу показывает разброс.

Размах

Самая простая мера: из наибольшего значения вычитается наименьшее. У первого маршрута размах 11 - 9 = 2 минуты, у второго 20 - 2 = 18 минут. Недостаток: размах смотрит только на два крайних значения, и один необычный день резко его увеличивает.

Идея стандартного отклонения

Стандартное отклонение показывает, насколько значения обычно удалены от среднего. Формулу запоминать не нужно — Excel посчитает её сам. Идея такая: для каждого значения берётся его отличие от среднего, возводится в квадрат, эти квадраты усредняются, и из результата извлекается квадратный корень. В данных Зарины стандартное отклонение для первого маршрута — около 0,7 минуты, для второго — около 8,3 минуты. Маленькое число — стабильный результат, большое — нестабильный.

Вывод на каждый день: называя среднее, по возможности называйте и разброс. «В среднем я сплю 7 часов» и «каждую ночь я сплю от 6,5 до 7,5 часа» — это информация разной точности.

Проценты и процентные пункты: маленькое слово, большая разница

Эти два понятия чаще всего путают в новостях.

Процентный пункт — простая разность двух процентов. Изменение в процентах — изменение относительно исходного значения.

Условный пример: доля отличников в классе в первой четверти составляла 20%, во второй — 30%.

  • Доля выросла на 10 процентных пунктов (30 - 20 = 10).
  • Доля выросла на 50% (10 делим на 20 — получается половина).

Оба утверждения верны, но впечатление разное. Тот, кто хочет привлечь внимание, обычно выбирает цифру, которая выглядит больше. Поэтому, прочитав «выросло на 50%», спросите: с какого значения и до какого?

Проценты от маленькой базы

«Выросло в два раза» или «рост на 100%» звучит очень впечатляюще. Но если в махаллинскую библиотеку за месяц записались не один, а два новых читателя, это тоже «рост на 100%». Видя процент, всегда спрашивайте и абсолютное число: со скольких до скольких?

Процент без базы

Встретив фразу «на 40% больше», задайте вопрос: больше чего? Чем в прошлом году, чем у другого товара, чем у конкурента? Процент без базы сравнения почти ничего не значит.

Выборка, репрезентативность и опасность маленькой выборки

Часто опросить всех невозможно, поэтому опрашивают часть. Вся группа, о которой мы хотим что-то узнать, — генеральная совокупность, часть, которую реально опросили, — выборка. Чтобы набор данных, собранный по выборке, был полезен, выборка должна быть похожа на генеральную совокупность, то есть быть репрезентативной.

Нерепрезентативная выборка

Условный пример: родительский комитет школы хочет узнать, сколько часов спят ученики. Опрос отправляют только в Telegram-группу одного класса в 23:00, и отвечают 15 человек. Проблемы:

  • Ответили самые активные родители группы. Неактивные не участвовали вовсе.
  • Ответили те, кто в такой поздний час ещё не спал, — это может случайно увеличить долю «поздно ложащихся» семей.
  • Результат говорит не обо всей школе, а о «родителях, которые вечером читают группу и захотели ответить».

Ещё одна частая ситуация — самоотбор: люди охотнее отвечают на добровольные опросы, особенно если тема их очень порадовала или очень расстроила. Поэтому онлайн-отзывы и голосования часто недооценивают «средние» мнения.

Опасность маленькой выборки

Чем меньше выборка, тем сильнее результат зависит от случайности. Условный пример: Сардор три ночи пробовал новое приложение для сна и в две из трёх ночей спал хорошо. Вывод «приложение помогает в 67% случаев» был бы смешным: за три ночи свою роль могли сыграть погода, усталость за день или просто случай.

Признаки маленькой выборки:

  • Проценты «красивые», но абсолютное число не названо («80% участников» — это 4 человека из 5?).
  • Результат очень резкий и не совпадает с другими источниками.
  • Наблюдение за несколько дней или несколько человек подаётся как «закономерность».

Корреляция — не причина

Корреляция — это совместное изменение двух показателей: когда один растёт, второй тоже растёт (или падает). Но это не значит, что один вызывает другой.

Условный пример: Малика месяц записывала свои шаги и часы сна. Она заметила, что в дни, когда много ходила, спала дольше. Доказывает ли это, что «ходьба продлевает сон»? Пока нет. Есть и другие объяснения:

  1. Третий фактор. Дни с большим количеством шагов в основном выпадали на выходные. В выходной не нужно рано вставать — поэтому она и спала дольше. Оба показателя на самом деле менял фактор «выходной день».
  2. Обратная связь. Выспавшись, на следующий день она чувствовала себя бодрее и больше ходила.
  3. Случайность. На данных за один месяц два показателя могут случайно меняться в одном направлении.

Классический пример: летом продаётся больше мороженого и чаще случаются солнечные ожоги. Мороженое не вызывает ожогов — и то и другое вызывает жаркая погода.

Чтобы установить причину, обычно нужен эксперимент: например, одна из двух групп что-то меняет, другая нет, а остальные условия по возможности остаются одинаковыми. Увидев в новостях заголовок «X приводит к Y», спросите: это эксперимент или просто замеченная связь?

Обманчивые диаграммы

Диаграмма помогает быстро понять цифры, но построить её неправильно тоже легко — иногда случайно, иногда намеренно.

Обрезанная ось

Условный пример: средний балл 7 «А» класса — 3,9, 7 «Б» — 4,1. Если вертикальная ось столбчатой диаграммы начинается с 0, столбцы выглядят почти одинаковыми — это соответствует действительности. Если же ось начинается с 3,8, столбец «А» рисуется высотой 0,1 единицы, а «Б» — 0,3 единицы. В итоге кажется, что 7 «Б» учится в три раза лучше, хотя разница всего 0,2 балла.

Правило: у столбчатой диаграммы вертикальная ось должна начинаться с нуля, потому что высота столбца и есть само значение. На линейном графике начинать ось не с нуля иногда уместно — он показывает направление изменений. Но тогда значения на оси должны быть чётко подписаны.

Другие приёмы

  • Неравные промежутки времени. На горизонтальной оси январь, февраль, а потом сразу июнь — промежутки выглядят одинаковыми, но это не так.
  • Подобранный период. Чтобы был виден рост, показываются только удобные месяцы, а остальные «обрезаются».
  • Объёмная (3D) круговая диаграмма. Передний сектор кажется больше заднего.
  • Нет подписей осей и единиц. Если неизвестно, что и в каких единицах измерено, диаграмма создаёт лишь впечатление.
  • Диаграмма с двумя осями. Если два показателя нарисованы на одном графике по разным осям, легко показать связь, которой нет.

Подробнее о том, как строить диаграммы и готовить данные, читайте в нашей статье об анализе данных.

Расчёты в Excel и Google Sheets

Все показатели выше можно посчитать в таблице за несколько секунд. Если вы ещё не знакомы с основами работы с таблицами, сначала прочитайте статью Основы Excel и Google Sheets.

Предположим, в ячейках B2:B8 записаны шаги Дильшода за семь дней. В русском интерфейсе Excel названия функций русские, в скобках указаны английские варианты.

  • =СРЗНАЧ(B2:B8) (AVERAGE) — среднее арифметическое.
  • =МЕДИАНА(B2:B8) (MEDIAN) — медиана. Заранее сортировать значения не нужно.
  • =МОДА.ОДН(B2:B8) (MODE.SNGL) — мода. Если повторяющихся значений нет, возвращает ошибку #Н/Д (#N/A). В Google Sheets работает и =MODE(B2:B8).
  • =МИН(B2:B8) (MIN) и =МАКС(B2:B8) (MAX) — наименьшее и наибольшее значение.
  • =МАКС(B2:B8)-МИН(B2:B8) — размах.
  • =СТАНДОТКЛОН.В(B2:B8) (STDEV.S) — стандартное отклонение для выборки.

Обратите внимание: разделителем аргументов в формуле, в зависимости от настроек компьютера, бывает запятая или точка с запятой.

Чтобы проверить ось диаграммы:

  1. Создайте столбчатую диаграмму: выделите данные, затем Insert → Chart (в русском интерфейсе — «Вставка» → «Диаграмма»).
  2. В Excel щёлкните правой кнопкой по вертикальной оси и откройте Format Axis → Axis Options → Bounds → Minimum. Там должен стоять 0.
  3. В Google Sheets дважды щёлкните по диаграмме и проверьте значение Min. в разделе Customise → Vertical axis.

Вопросы для критического чтения цифр в новостях

В следующий раз, увидев цифру в заголовке, задайте эти вопросы:

  1. Кто измерял и с какой целью? Не провела ли исследование сама сторона, заинтересованная в результате?
  2. Где первоисточник? Из какого отчёта или исследования взята цифра и есть ли на него ссылка?
  3. Кого опрашивали и сколько? Похожа ли выборка на генеральную совокупность, достаточен ли её размер?
  4. Какое «среднее»? Среднее арифметическое или медиана? Сказано ли что-нибудь о разбросе?
  5. Процент от чего? Процентные пункты или относительное изменение? Каковы абсолютные числа?
  6. Какой период? Почему выбран именно он? Что было до и после?
  7. Не выдаётся ли связь за причину? Может ли быть третий фактор или обратная связь?
  8. Честна ли диаграмма? С чего начинается ось, подписаны ли единицы, равны ли промежутки?
  9. Что говорят другие источники? Совпадает ли результат с данными других надёжных источников?

Не обязательно находить ответ на каждый вопрос. Но если на два-три вопроса ответа нет, это уже достаточная причина относиться к цифре осторожно.

Практическое упражнение и чек-лист

Проверьте изученное на собственных данных. В этом упражнении используется личный дневник сна — он остаётся только у вас.

  1. Две недели каждый день записывайте, сколько часов вы спали (например, 7,5 или 6). При желании добавьте количество шагов.
  2. Откройте таблицу: в столбце A — дата, в B — часы сна, в C — шаги, в D — тип дня («рабочий» или «выходной»).
  3. Посчитайте для часов сна СРЗНАЧ, МЕДИАНА, МИН, МАКС и СТАНДОТКЛОН.В. Близки ли среднее и медиана?
  4. Посчитайте размах. Вспомните, что происходило в дни самого короткого и самого долгого сна.
  5. Отдельно посчитайте среднее для рабочих и выходных дней (фильтром или функцией СРЗНАЧЕСЛИ, AVERAGEIF). Есть ли разница?
  6. Постройте столбчатую диаграмму часов сна. Затем сделайте её копию и измените минимум вертикальной оси на значение чуть ниже среднего. Сравните две диаграммы: какая показывает разницу крупнее?
  7. Если видна связь между шагами и сном, найдите третий фактор, который может её объяснить.
  8. Напишите вывод из трёх предложений: сколько вы обычно спите, насколько стабильно и от чего это может зависеть. Упомяните, что это маленькая выборка за две недели.

Чек-лист перед тем, как использовать цифру

  • Понятно, какое «среднее» использовано, выбросы проверены.
  • Вместе со средним показан разброс (размах или стандартное отклонение).
  • Вместе с процентом даны абсолютные числа и база сравнения; проценты и процентные пункты не перепутаны.
  • Указано, из кого состоит выборка и какого она размера.
  • Связь не выдаётся за причину.
  • У столбчатой диаграммы ось начинается с нуля, оси и единицы подписаны.
  • Указан источник, условные примеры помечены как условные.

Статистика учит не бояться цифр и не верить им вслепую. Этот навык пригодится и при чтении новостей, и при подготовке рабочего отчёта, и когда нужно разобраться в оценках ребёнка.

Если хотите глубже освоить работу с данными, познакомьтесь с бесплатными программами нашей ассоциации «Аналитика данных» и Data Science, а также с другими учебными программами. Когда будете готовы, оставьте заявку — наши специалисты свяжутся с вами.

Вернуться к статьям

Другие статьи

13 мин чтения

Знакомство с 1С: основы учётной программы

Что такое 1С:Предприятие, разница платформы и конфигурации, справочники, проведение документов, отчёты, резервная копия и упражнение для новичков.

Начните обучение сегодня

Набор в группы открыт. Оставьте заявку — наши специалисты свяжутся с вами и помогут выбрать подходящее направление.

Написать в Telegram