Понимание распределений данных и их применение
Мы уже научились рассчитывать «центр» данных через среднее и медиану, а также измерять разброс с помощью стандартного отклонения. Однако сухие цифры бывают коварны. Два набора данных могут иметь одинаковое среднее и разброс, но описывать совершенно разные бизнес-процессы.
Чтобы увидеть полную картину, нужно понять распределение данных — закон, который показывает, как часто встречаются те или иные значения. Если представить данные как ландшафт, то распределение — это его рельеф: где-то видны пики (частые значения), а где-то — низины (редкие события).
От гистограммы к плотности распределения
Основной инструмент для визуализации распределения — гистограмма. Она разбивает диапазон значений на равные интервалы (бины) и показывает количество наблюдений в каждом из них.
Когда данных становится много, а интервалы — мелкими, ступенчатый график превращается в плавную линию. Ее называют кривой плотности распределения. Она наглядно показывает зоны, где вероятность встретить значение выше.
График 1 демонстрирует, как дискретные столбцы превращаются в непрерывную модель.
Нормальное распределение
В аналитике чаще всего встречается нормальное распределение (распределение Гаусса). Оно симметрично, напоминает колокол, а среднее, медиана и мода в нем совпадают в одной точке — на вершине.
К этой форме стремятся многие явления: рост людей, ошибки измерений, точность работы станков. Для аналитика нормальность данных — это сигнал, что можно использовать классические методы статистики.
Правило трех сигм
Нормальное распределение позволяет предсказывать разброс. Зная среднее () и стандартное отклонение (), вы точно определите границы, в которых лежат данные:
- 68,2% значений находятся в пределах одного стандартного отклонения ().
- 95,4% значений — в пределах двух отклонений ().
- 99,7% значений — в пределах трех отклонений ().
Асимметрия и эксцесс
В бизнесе данные редко бывают идеально «колоколообразными». Форма графика подсказывает, что происходит в процессах.
- Асимметрия (Skewness):
- Правосторонняя (положительная): «хвост» графика уходит вправо. Типично для доходов или чеков в ритейле: большинство тратит немного, но есть единицы, совершающие покупки на миллионы.
- Левосторонняя (отрицательная): «хвост» уходит влево. Пример — возраст выхода на пенсию или результаты легкого теста, где большинство получает высокий балл.
- Эксцесс (Kurtosis): показывает «остроту» пика и «тяжесть» хвостов. Высокий эксцесс говорит о том, что экстремальные выбросы случаются чаще, чем ожидается.
Кейс: Зарплаты в IT-стартапе
- Средняя зарплата: 250 000 руб.
- Медиана: 120 000 руб. Разрыв указывает на сильную правостороннюю асимметрию. Несколько топ-менеджеров с высокими доходами тянут среднее вверх. В этом случае для отчета лучше использовать медиану, чтобы не искажать реальную картину.
Практический инструмент: Z-оценка
Чтобы сравнивать значения из разных наборов или быстро находить аномалии, используют Z-оценку (Z-score). Она показывает, на сколько стандартных отклонений значение отстоит от среднего.
Где — значение, — среднее, — стандартное отклонение.
Задание на самопроверку Время доставки заказов распределено нормально. Среднее время — 40 минут, стандартное отклонение — 5 минут.
- Рассчитайте Z-оценку для курьера с результатом 55 минут.
- Является ли такая доставка аномалией по правилу трех сигм?
Типичная ошибка Нельзя предполагать нормальность данных «на глаз». Если применить правило трех сигм к данным с сильной асимметрией (например, количеству лайков), вы примете обычную популярность за технический сбой. Всегда стройте гистограмму перед расчетами 📊
Понимание формы данных — фундамент для поиска взаимосвязей. В следующей теме мы разберем корреляцию и научимся определять, зависит ли рост продаж от рекламного бюджета или это просто совпадение.
Понравился урок?
Сохраните прогресс и получите персональный курс по любой теме — без форм и паролей
Продолжить в Telegram