Полигон частот
Полиго́н часто́т (в математической статистике) — один из способов графического представления плотности вероятности случайной величины. Представляет собой ломаную линию, которая соединяет точки, соответствующие срединным значениям интервалов группировки и частотам этих интервалов.
История
Вероятностно-теоретические основы
Случайная величина и её распределение
В основе математической статистики лежит понятие случайной величины — величины, значение которой определяется исходом случайного эксперимента[1]. Случайные величины бывают дискретными (принимающими отдельные изолированные значения, например число дефектных деталей в партии) и непрерывными (способными принимать любое значение из некоторого промежутка, например рост человека или температура воздуха).
Поведение случайной величины полностью описывается её функцией распределения:
вероятность
Функция распределения определена для любой случайной величины — как дискретной, так и непрерывной. Она является неубывающей, непрерывной справа и удовлетворяет условиям и [2].
Плотность вероятности
Для непрерывных случайных величин существует более удобная характеристика — плотность вероятности . Она определяется как производная функции распределения:
Плотность вероятности показывает, насколько «густо» сосредоточены значения случайной величины в окрестности данной точки. Чем выше значение , тем чаще случайная величина принимает значения вблизи .
Вероятность попадания случайной величины в интервал от до равна площади под кривой плотности на этом интервале:
Полная площадь под кривой плотности всегда равна единице:
Это означает, что случайная величина с вероятностью 1 примет какое-либо значение. Важно подчеркнуть: для непрерывной случайной величины вероятность принять какое-то одно точное значение всегда равна нулю; осмысленна лишь вероятность попадания в интервал.
Понятие плотности вероятности является центральным для понимания полигона в математической статистике, поскольку именно плотность (а не частота) является тем теоретическим объектом, который полигон призван оценивать.
На верхнем графике (Плотность вероятности, f(x))
Синяя кривая f(x) — это и есть плотность вероятности. Её форма показывает, где значения «гуще» всего. Пик кривой находится на среднем значении (здесь это 0), что означает, что значения вблизи нуля наиболее вероятны.
Высота кривой — чем выше кривая в точке x, тем «плотнее» значения случайной величины в окрестности этой точки.
Закрашенная голубая область — это визуализация интеграла . Площадь этой фигуры — это в точности вероятность того, что случайная величина X примет значение из интервала [0.5, 1.8]. Как видно из подписи, эта вероятность ≈ 0.272.
f(x) = F'(x) — эта надпись напоминает, что высота этой кривой в любой точке x равна наклону (производной) нижней кривой в той же точке x.
На нижнем графике (Функция распределения, F(x))
Зелёная кривая F(x) — это функция распределения. Она показывает накопленную вероятность, то есть F(x) = P(X ≤ x). Она всегда возрастает от 0 до 1.
Вероятность через разность: график наглядно демонстрирует, что вероятность попадания в интервал [a, b] можно найти и без интегрирования. Это просто разность значений функции распределения на концах интервала: P(a ≤ X ≤ b) = F(b) — F(a).
Фиолетовая стрелка на оси Y показывает эту разность. Её длина (≈ 0.272) в точности равна площади закрашенной фигуры на верхнем графике.
Выборка и генеральная совокупность
Генеральная совокупность — это полное (как правило, бесконечное или очень большое) множество всех возможных значений изучаемого признака (например, рост всех взрослых мужчин на планете). Распределение признака в генеральной совокупности описывается теоретической плотностью , которая, как правило, неизвестна.
Выборка — это конечная совокупность наблюдений , извлечённых из генеральной совокупности. Задача математической статистики состоит в том, чтобы по данным выборки сделать выводы о свойствах генеральной совокупности — в частности, оценить неизвестную плотность [3]. Полигон частот является одним из простейших непараметрических методов такого оценивания: он не предполагает, что принадлежит какому-либо конкретному семейству распределений (нормальному, показательному и т. д.), а строит оценку непосредственно по данным[4].
Вариационный ряд и группировка данных
Для построения полигона данные выборки необходимо предварительно упорядочить и сгруппировать. Вариационный ряд — это последовательность значений выборки, расположенных в порядке возрастания. Если признак принимает отдельные, изолированные значения, получается дискретный вариационный ряд; если значения группируются в интервалы — интервальный.
При группировке данных в интервалы возникают три ключевых понятия.
Абсолютная частота — число наблюдений, попавших в -й интервал. Относительная частота — доля наблюдений в -м интервале. Плотность частоты — число наблюдений, приходящихся на единицу длины оси в -м интервале, где — ширина интервала.
Именно плотность частоты, а не абсолютная или относительная частота, является корректной эмпирической оценкой теоретической плотности вероятности .
Выбор числа интервалов (или их ширины ) существенно влияет на форму гистограммы и полигона. Наиболее известные следующие правила.
Формула Стёрджеса: . Оптимальна для симметричных, унимодальных распределений, близких к нормальному[5].
Правило Скотта: ширина интервала , где — выборочное стандартное отклонение. Минимизирует среднеинтегральную квадратическую ошибку (MISE) гистограммы при допущении о нормальности данных[6]. Правило Скотта смотрит на всех людей на фото и вычисляет их «средний рост» (среднее значение) и «средний разброс в росте» (стандартное отклонение). На основе этого «среднего разброса» оно вычисляет оптимальную ширину столбиков, предполагая, что группа людей выглядит как «стандартная» толпа: большинство людей среднего роста, и лишь немногие — очень высокие или очень низкие. Правило Скотта стремится найти такую ширину интервала, которая минимизирует ожидаемую ошибку между построенной гистограммой и истинной кривой плотности вероятности, при условии, что эта кривая — нормальное распределение.
Правило Фридмана — Диакониса: , где IQR — межквартильный размах. Более устойчиво к выбросам и отклонениям от нормальности, чем правило Скотта[7]. Это правило не смотрит на весь разброс данных от самого маленького до самого большого значения, потому что одно-единственное аномальное число (например, доход миллиардера в опросе о зарплатах) может всё испортить. Вместо этого оно сначала отбрасывает 25 % самых маленьких и 25 % самых больших значений, а затем измеряет разброс только у оставшейся, центральной половины данных. Тем самым убираются случайные выбросы. Чем больше данных, тем больше деталей. Правило понимает, что если имеется всего 10 измерений, то пытаться разглядеть мелкие детали бессмысленно. А если у имеется 10 000 измерений, то можно и нужно показывать более подробную картину. Поэтому оно автоматически делает столбики гистограммы (и, соответственно, отрезки полигона) тем короче, чем больше у вас данных. В итоге, правило Фридмана-Диакониса работает как умный автофокус: оно наводится на «суть» данных, игнорируя мешающие выбросы, и подбирает такой уровень детализации, который соответствует количеству информации. Это позволяет получить честный и информативный график, который не обманывает зрителя ни излишним сглаживанием, ни случайным шумом.
| Критерий | Правило Скотта | Правило Фридмана — Диакониса |
|---|---|---|
| Ключевая мера разброса | Стандартное отклонение (s) | Межквартильный размах (IQR) |
| Устойчивость к выбросам | Низкая (неустойчивое правило) |
Высокая (робастное правило) |
| Исходное предположение о данных | Данные распределены близко к нормальному | Не делает строгих предположений о форме распределения |
| Рекомендуемая область применения | Для «чистых», симметричных данных без выбросов | Для большинства практических задач, особенно для данных с выбросами или асимметрией |
| Аналогия | «Оптимистичный» подход, рассчитанный на идеальные, лабораторные условия | «Осторожный» подход, готовый к особенностям данных из реального мира |
Определение и построение полигона частот
Полигон абсолютных частот
Полигон абсолютных частот — ломаная линия, вершинами которой служат точки с координатами , где — значение признака (для дискретного ряда) или середина -го интервала (для интервального ряда), а — абсолютная частота. Середина -го интервала вычисляется по формуле:
где и — нижняя и верхняя границы интервала. Для замыкания полигона добавляются две точки с нулевой частотой: слева — на расстоянии одного шага от первой середины, справа — на расстоянии одного шага от последней. Замыкание обеспечивает равенство площади под полигоном и площади соответствующей гистограммы.
Полигон относительных частот
Полигон относительных частот строится аналогично, но по оси ординат откладываются относительные частоты . Такой полигон особенно удобен при сравнении двух и более выборок разного объёма, поскольку приводит данные к единому масштабу. Как отмечал Б. Л. ван дер Варден, использование относительных частот является необходимым условием корректного сравнительного анализа эмпирических распределений[8].
Полигон плотности
Полигон плотности — ломаная линия, вершинами которой служат точки , где:
Именно полигон плотности, а не полигон частот, является корректной непараметрической оценкой теоретической плотности вероятности . Принципиальное отличие от полигона относительных частот состоит в делении на ширину интервала : это устраняет зависимость высоты графика от произвольного выбора ширины интервала и позволяет сравнивать полигоны, построенные с разным шагом группировки[9]
Построение полигона для дискретных данных
Для дискретного вариационного ряда полигон строится следующим образом. Составляется таблица значений признака и соответствующих частот . Выбирается масштаб осей координат. На координатной плоскости отмечаются точки . Точки последовательно соединяются отрезками прямых. Для замыкания крайние точки соединяются с осью абсцисс через точки и , где — шаг между соседними значениями.
Построение полигона для интервальных данных
Для интервального ряда алгоритм аналогичен, но в качестве абсцисс используются середины интервалов. Определяются границы интервалов и вычисляются их середины . Определяются частоты (абсолютные, относительные или плотности) каждого интервала. На оси откладываются середины интервалов, на оси — соответствующие значения. Точки соединяются отрезками. Полигон замыкается добавлением нулевых точек слева и справа. Использование середин интервалов основано на допущении о равномерном распределении наблюдений внутри каждого интервала. При существенной неравномерности это допущение может приводить к искажению формы полигона.
Связь с гистограммой
Гистограмма — графическое изображение интервального ряда распределения в виде смежных прямоугольников, основаниями которых служат интервалы группировки, а высоты пропорциональны частотам (или плотностям частот). Термин «гистограмма» был введён Карлом Пирсоном в 1895 году. Полигон и гистограмма связаны простым геометрическим соотношением: полигон получается путём соединения отрезками прямых середин верхних оснований столбцов гистограммы. Это соотношение, впервые чётко сформулированное Пирсоном, означает, что оба графика несут одну и ту же информацию, но представляют её в разной форме. При замыкании полигона (добавлении нулевых точек по краям) площадь фигуры, ограниченной полигоном и осью абсцисс, равна площади гистограммы. Это следует из того, что треугольники, «срезаемые» полигоном с верхушек столбцов, в точности равны треугольникам, «добавляемым» полигоном в промежутках между столбцами. Сравнительная характеристика:
| Характеристика | Гистограмма | Полигон |
|---|---|---|
| Тип графика | Ступенчатый (столбчатый) | Линейный (ломаная линия) |
| Непрерывность | Разрывная функция | Непрерывная функция |
| Применимость | Интервальные данные | Дискретные и интервальные данные |
| Сравнение нескольких рядов | Затруднительно (столбцы перекрываются) | Удобно (линии разного цвета/типа) |
| Скорость сходимости | (эффективнее) |
Последняя строка таблицы отражает результат Дэвида Скотта: по критерию MISE полигон плотности сходится к истинной плотности быстрее, чем гистограмма. Это связано с тем, что кусочно-линейная интерполяция (полигон) точнее приближает гладкую кривую, чем ступенчатая функция (гистограмма)[10].
Полигон предпочтительнее гистограммы в следующих случаях:
- необходимо сравнить несколько распределений на одном графике;
- требуется визуально оценить гладкость и форму распределения;
- данные представляют собой дискретный ряд.
Гистограмма предпочтительнее в случаях, когда важна наглядность «массы» данных в каждом интервале.
Сходимость полигона к плотности вероятности
Центральный теоретический результат
Главное теоретическое положение, связывающее полигон с плотностью вероятности, состоит в следующем: при неограниченном увеличении числа наблюдений и одновременном стремлении ширины интервалов к нулю полигон плотности сходится к теоретической кривой плотности вероятности:
Связь с теоремой Гливенко—Кантелли
Сходимость полигона к плотности тесно связана с фундаментальной теоремой Гливенко—Кантелли (1933), согласно которой эмпирическая функция распределения сходится к теоретической функции распределения равномерно и с вероятностью единица:
Поскольку плотность вероятности является производной функции распределения (), сходимость эмпирической функции распределения влечёт (при определённых условиях гладкости) сходимость и её «производной» — эмпирической оценки плотности, в том числе полигона.
Скорость сходимости и выбор параметров
Точность оценки плотности зависит от соотношения между объёмом выборки и шириной интервала . При слишком большом оценка «сглаживает» реальные особенности распределения (смещение); при слишком малом оценка «шумит», отражая случайные колебания выборки (дисперсия). Оптимальный выбор минимизирует суммарную ошибку — среднеинтегральную квадратическую ошибку (MISE):
Для полигона плотности Дэвид Скотт показал, что оптимальная ширина интервала имеет порядок , а соответствующая скорость сходимости MISE составляет , что быстрее, чем для гистограммы[10].
Свойства полигона и интерпретация формы распределения
Одно из главных достоинств полигона состоит в том, что по его форме можно визуально оценить важнейшие характеристики распределения.
Модальность
Мода — значение признака, которому соответствует наибольшая частота (вершина полигона).
- одномодальный (унимодальный) полигон имеет одну вершину. Характерен для однородных совокупностей.
- бимодальный полигон имеет две вершины. Как отмечал Джон Тьюки, бимодальность нередко указывает на то, что выборка состоит из двух неоднородных подсовокупностей с различными характеристиками[11].
- мультимодальный полигон (три и более вершин) может свидетельствовать о сложной структуре совокупности или о неудачном выборе числа интервалов.
Симметрия и асимметрия
Если полигон симметричен относительно вертикальной оси, проходящей через вершину, это свидетельствует о симметричном распределении (среднее, медиана и мода совпадают). Правосторонняя (положительная) асимметрия — «хвост» полигона вытянут вправо. Характерна, например, для распределения доходов населения. Левосторонняя (отрицательная) асимметрия — «хвост» вытянут влево.
Визуальная оценка асимметрии по полигону даёт предварительное представление о знаке и величине коэффициента асимметрии:
где — третий, а — второй центральные моменты.
Эксцесс (островершинность)
Эксцесс характеризует «остроту» вершины полигона и «тяжесть» его хвостов по сравнению с нормальным распределением. Положительный эксцесс (лептокуртическое распределение) — полигон более островершинный, чем нормальный, с более тяжёлыми хвостами. Отрицательный эксцесс (платикуртическое распределение) — полигон более плосковершинный.
Коэффициент эксцесса:
Для нормального распределения .
Кумулятивный полигон (огива)
Кумулятивный полигон, или огива (от архитектурного термина, введённого Фрэнсисом Гальтоном в 1875 году), — ломаная линия, ординаты которой равны накопленным (кумулятивным) частотам. Для интервального ряда кумулятивный полигон строится следующим образом: — по оси откладываются правые границы интервалов . — по оси откладываются накопленные относительные частоты:
— точки соединяются отрезками. — слева добавляется точка . Кумулятивный полигон является эмпирическим приближением к теоретической функции распределения . По нему можно графически определить: — медиану — значение , при котором (50 %). — квартили — значения , при которых и . — перцентили — значения , при которых равно заданной доле. Огива имеет характерную S-образную форму (при одномодальном распределении): медленный рост на хвостах и быстрый — в области сосредоточения основной массы наблюдений.
Преимущества и ограничения полигона
Наглядность. Полигон позволяет одним взглядом оценить форму распределения: его центр, разброс, симметрию, модальность.
Возможность сравнения. На одном координатном поле можно совместить несколько полигонов для разных выборок, что затруднительно для гистограмм.
Простота построения. Полигон не требует сложных вычислений и может быть построен вручную.
Полигон является эмпирическим приближением к теоретической плотности вероятности и служит отправной точкой для подбора распределения.
Более быстрая сходимость. По результатам Скотта (1985), полигон плотности сходится к истинной плотности быстрее, чем гистограмма.
Зависимость от группировки. Форма полигона может существенно изменяться при изменении числа и ширины интервалов. Как отмечал Стёрджес (1926), неудачный выбор интервалов может привести к появлению ложных вершин или, наоборот, к маскировке реальных особенностей распределения.
Кусочная линейность. Полигон является ломаной, а не гладкой кривой. Истинная плотность вероятности, как правило, гладкая, и ломаная линия лишь грубо её приближает.
Уступает ядерным оценкам по точности. Как показали Розенблатт (1956), Парзен (1962) и Силверман (1986), ядерные оценки плотности обеспечивают более точное и гладкое приближение к .
Чувствительность к выбросам. При малых выборках одно аномальное наблюдение может существенно исказить форму полигона.
Допущение о равномерности. При интервальном ряде предполагается, что наблюдения распределены равномерно внутри каждого интервала, что не всегда соответствует действительности.
Примечания
Литература
- Ван дер Варден Б. Л. Математическая статистика / пер. с нем. Л. Н. Большева; под ред. Н. В. Смирнова. — М.: Издательство иностранной литературы, 1960. — 436 с. — 4000 экз.
- Гмурман В. Е. Теория вероятностей и математическая статистика : учебное пособие для бакалавров. — 12-е изд., стер.. — М.: Юрайт, 2014. — 478 с. — ISBN 978-5-9916-3461-8.
- Кобзарь А. И. Прикладная математическая статистика : для инженеров и научных работников. — М.: Физматлит, 2006. — 813 с. — (Современные методы в математике). — ISBN 5-9221-0707-0.
- Колмогоров А. Н. Основные понятия теории вероятностей. — 2-е изд., перераб.. — М.: Наука, 1974. — 119 с. — 23 000 экз.
- Крамер Г. Математические методы статистики / пер. с англ. А. Н. Монина, А. А. Петрова; под ред. А. Н. Колмогорова. — 2-е изд., стер.. — М.: Мир, 1975. — 648 с. — 15 000 экз.
- Тьюки Д. У. Анализ результатов наблюдений : разведочный анализ / пер. с англ. А. Ф. Кушнира, А. Л. Петросяна, Е. Л. Резникова; под ред. В. Ф. Писаренко. — М.: Мир, 1981. — 693 с. — 11 500 экз.
- Ширяев А. Н. Вероятность. — М.: Наука, 1989. — 640 с. — 25 000 экз. — ISBN 5-02-013955-6.
