Полигон частот

Полиго́н часто́тматематической статистике) — один из способов графического представления плотности вероятности случайной величины. Представляет собой ломаную линию, которая соединяет точки, соответствующие срединным значениям интервалов группировки и частотам этих интервалов.

Пример полигона частот

История

Вероятностно-теоретические основы

Случайная величина и её распределение

В основе математической статистики лежит понятие случайной величины — величины, значение которой определяется исходом случайного эксперимента[1]. Случайные величины бывают дискретными (принимающими отдельные изолированные значения, например число дефектных деталей в партии) и непрерывными (способными принимать любое значение из некоторого промежутка, например рост человека или температура воздуха).

Поведение случайной величины полностью описывается её функцией распределения:

вероятность

Функция распределения определена для любой случайной величины — как дискретной, так и непрерывной. Она является неубывающей, непрерывной справа и удовлетворяет условиям и [2].

Плотность вероятности

Для непрерывных случайных величин существует более удобная характеристика — плотность вероятности . Она определяется как производная функции распределения:

Плотность вероятности показывает, насколько «густо» сосредоточены значения случайной величины в окрестности данной точки. Чем выше значение , тем чаще случайная величина принимает значения вблизи .

Вероятность попадания случайной величины в интервал от до равна площади под кривой плотности на этом интервале:

Полная площадь под кривой плотности всегда равна единице:

Это означает, что случайная величина с вероятностью 1 примет какое-либо значение. Важно подчеркнуть: для непрерывной случайной величины вероятность принять какое-то одно точное значение всегда равна нулю; осмысленна лишь вероятность попадания в интервал.

Понятие плотности вероятности является центральным для понимания полигона в математической статистике, поскольку именно плотность (а не частота) является тем теоретическим объектом, который полигон призван оценивать.

undefined

На верхнем графике (Плотность вероятности, f(x))

Синяя кривая f(x) — это и есть плотность вероятности. Её форма показывает, где значения «гуще» всего. Пик кривой находится на среднем значении (здесь это 0), что означает, что значения вблизи нуля наиболее вероятны.

Высота кривой — чем выше кривая в точке x, тем «плотнее» значения случайной величины в окрестности этой точки.

Закрашенная голубая область — это визуализация интеграла . Площадь этой фигуры — это в точности вероятность того, что случайная величина X примет значение из интервала [0.5, 1.8]. Как видно из подписи, эта вероятность ≈ 0.272.

f(x) = F'(x) — эта надпись напоминает, что высота этой кривой в любой точке x равна наклону (производной) нижней кривой в той же точке x.

На нижнем графике (Функция распределения, F(x))

Зелёная кривая F(x) — это функция распределения. Она показывает накопленную вероятность, то есть F(x) = P(X ≤ x). Она всегда возрастает от 0 до 1.

Вероятность через разность: график наглядно демонстрирует, что вероятность попадания в интервал [a, b] можно найти и без интегрирования. Это просто разность значений функции распределения на концах интервала: P(a ≤ X ≤ b) = F(b) — F(a).

Фиолетовая стрелка на оси Y показывает эту разность. Её длина (≈ 0.272) в точности равна площади закрашенной фигуры на верхнем графике.

Выборка и генеральная совокупность

Генеральная совокупность — это полное (как правило, бесконечное или очень большое) множество всех возможных значений изучаемого признака (например, рост всех взрослых мужчин на планете). Распределение признака в генеральной совокупности описывается теоретической плотностью , которая, как правило, неизвестна.

Выборка — это конечная совокупность наблюдений , извлечённых из генеральной совокупности. Задача математической статистики состоит в том, чтобы по данным выборки сделать выводы о свойствах генеральной совокупности — в частности, оценить неизвестную плотность [3]. Полигон частот является одним из простейших непараметрических методов такого оценивания: он не предполагает, что принадлежит какому-либо конкретному семейству распределений (нормальному, показательному и т. д.), а строит оценку непосредственно по данным[4].

Вариационный ряд и группировка данных

Для построения полигона данные выборки необходимо предварительно упорядочить и сгруппировать. Вариационный ряд — это последовательность значений выборки, расположенных в порядке возрастания. Если признак принимает отдельные, изолированные значения, получается дискретный вариационный ряд; если значения группируются в интервалы — интервальный.

При группировке данных в интервалы возникают три ключевых понятия.

Абсолютная частота  — число наблюдений, попавших в -й интервал. Относительная частота  — доля наблюдений в -м интервале. Плотность частоты  — число наблюдений, приходящихся на единицу длины оси в -м интервале, где  — ширина интервала.

Именно плотность частоты, а не абсолютная или относительная частота, является корректной эмпирической оценкой теоретической плотности вероятности .

Выбор числа интервалов (или их ширины ) существенно влияет на форму гистограммы и полигона. Наиболее известные следующие правила.

Формула Стёрджеса: . Оптимальна для симметричных, унимодальных распределений, близких к нормальному[5].

Правило Скотта: ширина интервала , где  — выборочное стандартное отклонение. Минимизирует среднеинтегральную квадратическую ошибку (MISE) гистограммы при допущении о нормальности данных[6]. Правило Скотта смотрит на всех людей на фото и вычисляет их «средний рост» (среднее значение) и «средний разброс в росте» (стандартное отклонение). На основе этого «среднего разброса» оно вычисляет оптимальную ширину столбиков, предполагая, что группа людей выглядит как «стандартная» толпа: большинство людей среднего роста, и лишь немногие — очень высокие или очень низкие. Правило Скотта стремится найти такую ширину интервала, которая минимизирует ожидаемую ошибку между построенной гистограммой и истинной кривой плотности вероятности, при условии, что эта кривая — нормальное распределение.

undefined

Правило Фридмана — Диакониса: , где IQR — межквартильный размах. Более устойчиво к выбросам и отклонениям от нормальности, чем правило Скотта[7]. Это правило не смотрит на весь разброс данных от самого маленького до самого большого значения, потому что одно-единственное аномальное число (например, доход миллиардера в опросе о зарплатах) может всё испортить. Вместо этого оно сначала отбрасывает 25 % самых маленьких и 25 % самых больших значений, а затем измеряет разброс только у оставшейся, центральной половины данных. Тем самым убираются случайные выбросы. Чем больше данных, тем больше деталей. Правило понимает, что если имеется всего 10 измерений, то пытаться разглядеть мелкие детали бессмысленно. А если у имеется 10 000 измерений, то можно и нужно показывать более подробную картину. Поэтому оно автоматически делает столбики гистограммы (и, соответственно, отрезки полигона) тем короче, чем больше у вас данных. В итоге, правило Фридмана-Диакониса работает как умный автофокус: оно наводится на «суть» данных, игнорируя мешающие выбросы, и подбирает такой уровень детализации, который соответствует количеству информации. Это позволяет получить честный и информативный график, который не обманывает зрителя ни излишним сглаживанием, ни случайным шумом.

Правило Скотта и правило Фридмана — Диакониса
Критерий Правило Скотта Правило Фридмана — Диакониса
Ключевая мера разброса Стандартное отклонение (s) Межквартильный размах (IQR)
Устойчивость к выбросам Низкая
(неустойчивое правило)
Высокая
(робастное правило)
Исходное предположение о данных Данные распределены близко к нормальному Не делает строгих предположений о форме распределения
Рекомендуемая область применения Для «чистых», симметричных данных без выбросов Для большинства практических задач, особенно для данных с выбросами или асимметрией
Аналогия «Оптимистичный» подход, рассчитанный на идеальные, лабораторные условия «Осторожный» подход, готовый к особенностям данных из реального мира

Определение и построение полигона частот

Полигон абсолютных частот

Полигон абсолютных частот — ломаная линия, вершинами которой служат точки с координатами , где  — значение признака (для дискретного ряда) или середина -го интервала (для интервального ряда), а  — абсолютная частота. Середина -го интервала вычисляется по формуле:

где и  — нижняя и верхняя границы интервала. Для замыкания полигона добавляются две точки с нулевой частотой: слева — на расстоянии одного шага от первой середины, справа — на расстоянии одного шага от последней. Замыкание обеспечивает равенство площади под полигоном и площади соответствующей гистограммы.

undefined

Полигон относительных частот

Полигон относительных частот строится аналогично, но по оси ординат откладываются относительные частоты . Такой полигон особенно удобен при сравнении двух и более выборок разного объёма, поскольку приводит данные к единому масштабу. Как отмечал Б. Л. ван дер Варден, использование относительных частот является необходимым условием корректного сравнительного анализа эмпирических распределений[8].

undefined

Полигон плотности

Полигон плотности — ломаная линия, вершинами которой служат точки , где:

Именно полигон плотности, а не полигон частот, является корректной непараметрической оценкой теоретической плотности вероятности . Принципиальное отличие от полигона относительных частот состоит в делении на ширину интервала : это устраняет зависимость высоты графика от произвольного выбора ширины интервала и позволяет сравнивать полигоны, построенные с разным шагом группировки[9]

undefined

Построение полигона для дискретных данных

Для дискретного вариационного ряда полигон строится следующим образом. Составляется таблица значений признака и соответствующих частот . Выбирается масштаб осей координат. На координатной плоскости отмечаются точки . Точки последовательно соединяются отрезками прямых. Для замыкания крайние точки соединяются с осью абсцисс через точки и , где  — шаг между соседними значениями.

undefined

Построение полигона для интервальных данных

Для интервального ряда алгоритм аналогичен, но в качестве абсцисс используются середины интервалов. Определяются границы интервалов и вычисляются их середины . Определяются частоты (абсолютные, относительные или плотности) каждого интервала. На оси откладываются середины интервалов, на оси  — соответствующие значения. Точки соединяются отрезками. Полигон замыкается добавлением нулевых точек слева и справа. Использование середин интервалов основано на допущении о равномерном распределении наблюдений внутри каждого интервала. При существенной неравномерности это допущение может приводить к искажению формы полигона.

undefined

Связь с гистограммой

Гистограмма — графическое изображение интервального ряда распределения в виде смежных прямоугольников, основаниями которых служат интервалы группировки, а высоты пропорциональны частотам (или плотностям частот). Термин «гистограмма» был введён Карлом Пирсоном в 1895 году. Полигон и гистограмма связаны простым геометрическим соотношением: полигон получается путём соединения отрезками прямых середин верхних оснований столбцов гистограммы. Это соотношение, впервые чётко сформулированное Пирсоном, означает, что оба графика несут одну и ту же информацию, но представляют её в разной форме. При замыкании полигона (добавлении нулевых точек по краям) площадь фигуры, ограниченной полигоном и осью абсцисс, равна площади гистограммы. Это следует из того, что треугольники, «срезаемые» полигоном с верхушек столбцов, в точности равны треугольникам, «добавляемым» полигоном в промежутках между столбцами. Сравнительная характеристика:

Характеристика Гистограмма Полигон
Тип графика Ступенчатый (столбчатый) Линейный (ломаная линия)
Непрерывность Разрывная функция Непрерывная функция
Применимость Интервальные данные Дискретные и интервальные данные
Сравнение нескольких рядов Затруднительно (столбцы перекрываются) Удобно (линии разного цвета/типа)
Скорость сходимости (эффективнее)

Последняя строка таблицы отражает результат Дэвида Скотта: по критерию MISE полигон плотности сходится к истинной плотности быстрее, чем гистограмма. Это связано с тем, что кусочно-линейная интерполяция (полигон) точнее приближает гладкую кривую, чем ступенчатая функция (гистограмма)[10].

Полигон предпочтительнее гистограммы в следующих случаях:

  • необходимо сравнить несколько распределений на одном графике;
  • требуется визуально оценить гладкость и форму распределения;
  • данные представляют собой дискретный ряд.

Гистограмма предпочтительнее в случаях, когда важна наглядность «массы» данных в каждом интервале.

undefined

Сходимость полигона к плотности вероятности

Центральный теоретический результат

Главное теоретическое положение, связывающее полигон с плотностью вероятности, состоит в следующем: при неограниченном увеличении числа наблюдений и одновременном стремлении ширины интервалов к нулю полигон плотности сходится к теоретической кривой плотности вероятности:

undefined

Связь с теоремой Гливенко—Кантелли

Сходимость полигона к плотности тесно связана с фундаментальной теоремой Гливенко—Кантелли (1933), согласно которой эмпирическая функция распределения сходится к теоретической функции распределения равномерно и с вероятностью единица:


Поскольку плотность вероятности является производной функции распределения (), сходимость эмпирической функции распределения влечёт (при определённых условиях гладкости) сходимость и её «производной» — эмпирической оценки плотности, в том числе полигона.

Скорость сходимости и выбор параметров

Точность оценки плотности зависит от соотношения между объёмом выборки и шириной интервала . При слишком большом оценка «сглаживает» реальные особенности распределения (смещение); при слишком малом оценка «шумит», отражая случайные колебания выборки (дисперсия). Оптимальный выбор минимизирует суммарную ошибку — среднеинтегральную квадратическую ошибку (MISE):

Для полигона плотности Дэвид Скотт показал, что оптимальная ширина интервала имеет порядок , а соответствующая скорость сходимости MISE составляет , что быстрее, чем для гистограммы[10].

undefined

Свойства полигона и интерпретация формы распределения

Одно из главных достоинств полигона состоит в том, что по его форме можно визуально оценить важнейшие характеристики распределения.

Модальность

Мода — значение признака, которому соответствует наибольшая частота (вершина полигона).

  • одномодальный (унимодальный) полигон имеет одну вершину. Характерен для однородных совокупностей.
  • бимодальный полигон имеет две вершины. Как отмечал Джон Тьюки, бимодальность нередко указывает на то, что выборка состоит из двух неоднородных подсовокупностей с различными характеристиками[11].
  • мультимодальный полигон (три и более вершин) может свидетельствовать о сложной структуре совокупности или о неудачном выборе числа интервалов.
undefined

Симметрия и асимметрия

Если полигон симметричен относительно вертикальной оси, проходящей через вершину, это свидетельствует о симметричном распределении (среднее, медиана и мода совпадают). Правосторонняя (положительная) асимметрия — «хвост» полигона вытянут вправо. Характерна, например, для распределения доходов населения. Левосторонняя (отрицательная) асимметрия — «хвост» вытянут влево.

undefined

Визуальная оценка асимметрии по полигону даёт предварительное представление о знаке и величине коэффициента асимметрии:

где  — третий, а  — второй центральные моменты.

Эксцесс (островершинность)

Эксцесс характеризует «остроту» вершины полигона и «тяжесть» его хвостов по сравнению с нормальным распределением. Положительный эксцесс (лептокуртическое распределение) — полигон более островершинный, чем нормальный, с более тяжёлыми хвостами. Отрицательный эксцесс (платикуртическое распределение) — полигон более плосковершинный.

undefined

Коэффициент эксцесса:

Для нормального распределения .

Площадь под полигоном

Для полигона плотности площадь под кривой приближённо равна единице (точно — при бесконечном числе наблюдений):

Для полигона абсолютных частот площадь пропорциональна объёму выборки . При замыкании полигона площадь под ним равна площади соответствующей гистограммы.

undefined

Кумулятивный полигон (огива)

Кумулятивный полигон, или огива (от архитектурного термина, введённого Фрэнсисом Гальтоном в 1875 году), — ломаная линия, ординаты которой равны накопленным (кумулятивным) частотам. Для интервального ряда кумулятивный полигон строится следующим образом: — по оси откладываются правые границы интервалов . — по оси откладываются накопленные относительные частоты:

— точки соединяются отрезками. — слева добавляется точка . Кумулятивный полигон является эмпирическим приближением к теоретической функции распределения . По нему можно графически определить: — медиану — значение , при котором (50 %). — квартили — значения , при которых и . — перцентили — значения , при которых равно заданной доле. Огива имеет характерную S-образную форму (при одномодальном распределении): медленный рост на хвостах и быстрый — в области сосредоточения основной массы наблюдений.

undefined

Преимущества и ограничения полигона

Наглядность. Полигон позволяет одним взглядом оценить форму распределения: его центр, разброс, симметрию, модальность.

Возможность сравнения. На одном координатном поле можно совместить несколько полигонов для разных выборок, что затруднительно для гистограмм.

Простота построения. Полигон не требует сложных вычислений и может быть построен вручную.

Полигон является эмпирическим приближением к теоретической плотности вероятности и служит отправной точкой для подбора распределения.

Более быстрая сходимость. По результатам Скотта (1985), полигон плотности сходится к истинной плотности быстрее, чем гистограмма.

Зависимость от группировки. Форма полигона может существенно изменяться при изменении числа и ширины интервалов. Как отмечал Стёрджес (1926), неудачный выбор интервалов может привести к появлению ложных вершин или, наоборот, к маскировке реальных особенностей распределения.

Кусочная линейность. Полигон является ломаной, а не гладкой кривой. Истинная плотность вероятности, как правило, гладкая, и ломаная линия лишь грубо её приближает.

Уступает ядерным оценкам по точности. Как показали Розенблатт (1956), Парзен (1962) и Силверман (1986), ядерные оценки плотности обеспечивают более точное и гладкое приближение к .

Чувствительность к выбросам. При малых выборках одно аномальное наблюдение может существенно исказить форму полигона.

Допущение о равномерности. При интервальном ряде предполагается, что наблюдения распределены равномерно внутри каждого интервала, что не всегда соответствует действительности.

Примечания

  1. Понятие случайной величины было строго формализовано в аксиоматике А. Н. Колмогорова. См.: 46. Колмогоров А. Н. Основные понятия теории вероятностей. — 2-е изд. — М. : Наука, 1974.
  2. Ширяев А. Н. Вероятность. — М.: Наука, 1989. — Т. 1. — С. 182—186.
  3. Крамер Г. Математические методы статистики. — 2-е изд. — М.: Мир, 1975. — 648 с.
  4. Wasserman L. All of Nonparametric Statistics. — Springer, 2006. — P. 97-100.
  5. Sturges H. A. The choice of a class interval // Journal of the American Statistical Association. — 1926. — Vol. 21, no. 153. — P. 65-66.
  6. Scott D. W. On optimal and data-based histograms // Biometrika. — 1979. — Vol. 66, no. 3. — P. 605—610.
  7. Freedman D., Diaconis P. On the histogram as a density estimator: theory // Zeitschrift für Wahrscheinlichkeitstheorie und verwandte Gebiete. — 1981. — Vol. 57, no. 4. — P. 453—476.
  8. Ван дер Варден Б. Л. Математическая статистика / Б. Л. ван дер Варден; пер. с нем. Л. Н. Большева; под ред. Н. В. Смирнова. — Москва : Издательство иностранной литературы, 1960. — 436 с.
  9. Кобзарь А. И. Прикладная математическая статистика. Для инженеров и научных работников. — М.: Физматлит, 2006.- С. 34-36.
  10. 1 2 Scott D. W. Frequency Polygons // Journal of the American Statistical Association. — 1985. — Vol. 80, № 390. — P. 348—354.
  11. Тьюки, Д. У. Анализ результатов наблюдений : разведочный анализ / Дж. Тьюки; пер. с англ. А. Ф. Кушнира [и др.]. — Москва : Мир, 1981. — С.66-69.

Литература

  • Ван дер Варден Б. Л. Математическая статистика / пер. с нем. Л. Н. Большева; под ред. Н. В. Смирнова. — М.: Издательство иностранной литературы, 1960. — 436 с. — 4000 экз.
  • Гмурман В. Е. Теория вероятностей и математическая статистика : учебное пособие для бакалавров. — 12-е изд., стер.. — М.: Юрайт, 2014. — 478 с. — ISBN 978-5-9916-3461-8.
  • Кобзарь А. И. Прикладная математическая статистика : для инженеров и научных работников. — М.: Физматлит, 2006. — 813 с. — (Современные методы в математике). — ISBN 5-9221-0707-0.
  • Колмогоров А. Н. Основные понятия теории вероятностей. — 2-е изд., перераб.. — М.: Наука, 1974. — 119 с. — 23 000 экз.
  • Крамер Г. Математические методы статистики / пер. с англ. А. Н. Монина, А. А. Петрова; под ред. А. Н. Колмогорова. — 2-е изд., стер.. — М.: Мир, 1975. — 648 с. — 15 000 экз.
  • Тьюки Д. У. Анализ результатов наблюдений : разведочный анализ / пер. с англ. А. Ф. Кушнира, А. Л. Петросяна, Е. Л. Резникова; под ред. В. Ф. Писаренко. — М.: Мир, 1981. — 693 с. — 11 500 экз.
  • Ширяев А. Н. Вероятность. — М.: Наука, 1989. — 640 с. — 25 000 экз. — ISBN 5-02-013955-6.