Байесовский вывод

Ба́йесовский вы́вод (также ба́йесовский подход) — направление в математической статистике, в котором неизвестные параметры модели рассматриваются как случайные величины, наделённые распределениями вероятностей, а обновление знаний о них производится по мере поступления новых данных в соответствии с теоремой Байеса[1][2][3]. Байесовский вывод составляет математическое ядро более широкой байесовской статистики, охватывающей также планирование экспериментов, сравнение моделей и прогнозирование в рамках данной парадигмы. Следует отличать байесовский вывод как методологическое направление от самой теоремы Байеса, которая является строгим математическим тождеством теории вероятностей и не зависит от той или иной интерпретации вероятности[4].

undefined

В рамках байесовского подхода вероятность трактуется как степень обоснованной уверенности в истинности некоторого утверждения (в соответствии с субъективной или объективной байесовской интерпретацией), а не исключительно как предельная относительная частота события в длинной серии повторений эксперимента[5]. Благодаря такой интерпретации вероятности могут быть приписаны не только исходам повторяющихся опытов, но и самим гипотезам, а также уникальным, неповторяемым событиям — в том числе значению физической константы или утверждению, рассматриваемому в судебном разбирательстве.

Широкое практическое распространение байесовских методов относится к концу XX — началу XXI века и связано с развитием вычислительной техники: расчёт многомерных апостериорных распределений стал возможен благодаря методам Монте-Карло по схеме марковских цепей (MCMC) и вариационному приближению[6]. В настоящее время байесовские методы применяются в машинном обучении, обработке сигналов, медицинской статистике, эконометрике, когнитивных науках и физике данных[7].

История

Идея «обратной вероятности» была изложена в посмертно опубликованном эссе Т. Байеса «An Essay towards solving a Problem in the Doctrine of Chances» (1763; подготовлено к печати Р. Прайсом). Систематическое развитие этот подход получил в работах П. С. Лапласа (мемуар 1774 года; итоговый труд «Théorie analytique des probabilités», 1812)[8]. В XIX веке близкие по духу рассуждения использовали К. Ф. Гаусс (обоснование метода наименьших квадратов в трактате «Theoria motus», 1809) и Ф. И. Эджуорт.

Во второй половине XIX — первой половине XX века данный подход подвергался критике со стороны Дж. Буля, а затем — Р. Фишера, Е. Неймана и представителей школы частотного вывода, считавших использование априорных распределений недостаточно обоснованным. Термин «байесовский» утвердился в научной литературе лишь в XX веке[9].

Формирование современного байесовского подхода происходило в несколько этапов и не сводится к единому периоду 1950–1960-х годов:

  • Г. Джеффрис в монографии «Theory of Probability» (1939) заложил основы линии «объективных» априорных распределений.
  • Б. де Финетти в работах 1931/1937 годов обосновал понимание вероятности как когерентной ставки и ввёл понятие обменности.
  • Л. Дж. Сэвидж в труде «The Foundations of Statistics» (1954), а также Д. Линдли, Г. Райффа и Р. Шлайфер в 1950–1960-е годы развили теорию статистических решений и субъективный байесовский подход[10].

Вычислительный прорыв, сделавший возможным практическое применение байесовских методов в многомерных задачах, связан с публикацией в 1990 году статьи А. Гелфанда и Э. Смита, популяризовавшей в статистике идею сэмплирования из полных условных распределений[11]. При этом сам гиббсовский алгоритм был ранее предложен С. и Д. Геманами (1984) для задач обработки изображений; схема Метрополиса была опубликована в 1953 году, а её обобщение, выполненное Гастингсом, — в 1970 году. С 2010-х годов широкое распространение получили гамильтонов метод Монте-Карло и его адаптивная модификация NUTS, реализованные в программных пакетах Stan и PyMC.

undefined

Философские и методологические основы

Интерпретация вероятности

В рамках байесовского подхода вероятность трактуется как степень обоснованной уверенности рационального агента в истинности некоторого утверждения[5]. Помимо выполнения аксиом Колмогорова (при этом Б. де Финетти в ряде работ ограничивался требованием конечной аддитивности), от оценок вероятностей требуется когерентность: если система оценок допускает построение серии ставок, гарантированно приводящей агента к проигрышу независимо от исхода — так называемый арбитраж (Dutch book; Ф. П. Рамсей, 1926; Б. де Финетти, 1937), — такие оценки признаются нерациональными[12].

В данной интерпретации теорема Байеса приобретает смысл правила рационального обновления убеждений при получении новых свидетельств:

Множитель осуществляет переход от априорного распределения к апостериорному. Следует отличать его от фактора Байеса, определяемого как отношение правдоподобий для двух конкурирующих гипотез и используемого при их сравнении.

В частотной трактовке вероятность определяется как предельная относительная частота события в длинной серии независимых повторений эксперимента. Утверждение вида «вероятность того, что закон всемирного тяготения верен, равна 0,95» не имеет смысла в частотной парадигме, поскольку закон не может быть подвергнут серии повторных испытаний. Байесовский подход снимает это ограничение, позволяя присваивать вероятности самим гипотезам.

Сравнение с частотным выводом

undefined
Аспект Байесовский подход Частотный подход
Параметр модели случайная величина (в эпистемическом смысле) фиксированная, но неизвестная константа
Результат вывода апостериорное распределение точечная оценка и доверительный интервал
Интервал неопределённости достоверный (credible interval) доверительный (confidence interval, Дж. Нейман)
Смысл 95 % после получения данных: до проведения опыта: в 95 % повторений эксперимента построенный интервал накроет истинное значение
Проверка гипотез апостериорные вероятности гипотез, факторы Байеса -значение, вычисляемое в предположении истинности нулевой гипотезы
Роль априорных знаний задаются явно через априорное распределение формально не используются (однако выбор модели и статистики служит их скрытым аналогом)

При большом объёме выборки и выполнении условий регулярности апостериорное распределение приближается к нормальному закону с центром в оценке максимального правдоподобия и дисперсией, обратной информации Фишера, — данный результат формализуется в теореме Бернштейна — фон Мизеса[13]. Данное асимптотическое сближение, однако, не устраняет различий в интерпретации интервалов неопределённости при конечных объёмах выборки.

Формальная постановка

Пусть наблюдаемые данные зависят от неизвестного параметра через функцию правдоподобия . Байесовский вывод начинается с задания априорного распределения , кодирующего знания о параметре до наблюдения данных. Тогда в соответствии с теоремой Байеса апостериорное распределение имеет вид:

Знаменатель называется свидетельством (evidence), или маргинальным правдоподобием, и выполняет роль нормирующей константы; одновременно он служит основой для сравнения статистических моделей. Все последующие выводы — точечные оценки, интервалы неопределённости, прогнозы — строятся на основе апостериорного распределения [1].

При решении задач выбора между конкурирующими статистическими моделями или гипотезами центральным инструментом выступает Байесовский коэффициент (также называемый фактором Байеса). В отличие от оценки параметров внутри заданной модели, байесовский коэффициент вычисляется как отношение маргинальных правдоподобий данных для двух сравниваемых моделей. Этот показатель количественно определяет, насколько наблюдаемые данные поддерживают одну гипотезу по сравнению с другой. Важным свойством байесовского коэффициента является то, что он автоматически реализует принцип «бритвы Оккама»: более сложные модели с большим числом параметров получают естественный штраф (за счёт интегрирования по априорному распределению), если их дополнительная сложность не приводит к пропорционально лучшему объяснению наблюдаемых данных.

Выбор априорного распределения

Сопряжённые семейства

Априорное распределение называется сопряжённым относительно заданного семейства правдоподобий, если апостериорное распределение принадлежит тому же параметрическому семейству, что и априорное. Например, бета-распределение сопряжено биномиальному правдоподобию, а нормальное распределение (при известной дисперсии) — нормальному правдоподобию с неизвестным средним[14].

undefined

Пример. Пусть априорное распределение параметра есть , а в серии из независимых испытаний зарегистрировано 7 успехов. Тогда апостериорное распределение имеет вид , а его математическое ожидание равно .

Слабоинформативные и объективные априорные распределения

Для уменьшения влияния априорного выбора на результат анализа применяются следующие классы априорных распределений[15]:

  • широкие собственные распределения (слабоинформативные априоры);
  • несобственные равномерные меры на (интеграл от плотности расходится, однако апостериорное распределение при достаточно регулярных моделях остаётся собственным);
  • априорное распределение Джеффриса , где информационная матрица Фишера; оно инвариантно относительно перепараметризации модели[16];
  • опорное априорное распределение (reference prior, Х. М. Бернардо, Дж. О. Бергер) — максимизирует ожидаемое расхождение между априорным и апостериорным распределениями, измеряемое дивергенцией Кульбака — Лейблера[17].

Субъективные априоры, иерархические модели и усреднение моделей

Экспертное априорное распределение позволяет формально учесть результаты предшествующих исследований и физические ограничения на параметры. При этом следует различать три методологических приёма, которые нередко смешиваются в литературе:

  • Иерархическая байесовская модель — параметры наделяются априорным распределением, зависящим от гиперпараметров, которые, в свою очередь, оцениваются по данным. Характерным следствием иерархической структуры является эффект сжатия (shrinkage) — частичного сближения оценок для отдельных групп, обусловленный заимствованием статистической силы между ними.
  • Байесовское усреднение моделей (BMA, Bayesian model averaging) — апостериорные выводы формируются как взвешенная смесь апостериорных распределений, полученных при различных моделях, с весами , пропорциональными апостериорным вероятностям самих моделей.
  • Регуляризация — использование MAP-оценки (апостериорной моды) с информативным априорным распределением эквивалентно введению штрафной функции, добавляемой к логарифму правдоподобия. Данный приём не следует отождествлять ни с байесовским усреднением моделей, ни с автоматической регуляризацией.
undefined

Вычислительные методы

Вычисление знаменателя в формуле Байеса и математических ожиданий по апостериорному распределению в задачах высокой размерности требует применения численных методов.

Методы Монте-Карло по схеме марковских цепей

Конструируется марковская цепь, стационарным распределением которой является целевое апостериорное распределение . После достижения цепью стационарного режима (этап сходимости, или прогрева) полученные сэмплы используются для приближённого вычисления любых характеристик апостериорного распределения[18].

undefined

Основные алгоритмы данного класса:

  • Алгоритм Метрополиса (1953, задачи статистической физики) и его обобщение — алгоритм Метрополиса — Гастингса (1970): предлагаемый сэмпл принимается с вероятностью, определяемой отношением плотностей целевого распределения.
  • Сэмплер Гиббса — обновление параметров производится по координатам из их полных условных распределений; алгоритм предложен С. и Д. Геманами (1984) для задач обработки изображений, а в байесовской статистике популяризован статьёй А. Гелфанда и Э. Смита (1990).
  • Гамильтонов метод Монте-Карло (hybrid Monte Carlo, М. Дуэйн и др., 1987; систематически развит Р. Нилом) и его адаптивная модификация NUTS — составляют вычислительную основу современных программных пакетов Stan и PyMC[19].

Вариационный байесовский вывод

В рамках вариационного подхода задача вычисления апостериорного распределения сводится к задаче оптимизации: среди некоторого параметрического семейства отыскивается распределение, минимизирующее дивергенцию Кульбака — Лейблера . Данный метод существенно быстрее алгоритмов MCMC при обработке больших массивов данных, однако даёт смещённое приближение, качество которого определяется выбором аппроксимирующего семейства[20].

Точечные оценки на основе апостериорного распределения

После получения апостериорного распределения точечная оценка параметра выбирается в зависимости от принятой функции потерь:

  • апостериорное среднее — оптимально при квадратичной функции потерь;
  • апостериорная медиана — оптимальна при функции абсолютных потерь;
  • апостериорная мода (MAP-оценка, maximum a posteriori) — при равномерном собственном априорном распределении совпадает с оценкой максимального правдоподобия[21].

Примеры

Монета и бета-априорное распределение

Рассмотренный ранее пример демонстрирует сопряжённость: априорное распределение и 7 успехов в 10 испытаниях дают апостериорное распределение . 95-процентный центральный достоверный интервал для параметра вычисляется непосредственно по соответствующим квантилям данного бета-распределения.

Медицинский тест

Пусть распространённость заболевания в популяции составляет 1 %, а чувствительность и специфичность диагностического теста равны 99 %. При обследовании 10 000 человек: 100 больных дают 99 истинно положительных и 1 ложноотрицательный результат; 9900 здоровых дают 99 ложноположительных результатов. Среди 198 положительных результатов истинно больными оказываются 99 человек, то есть

несмотря на декларируемую «точность теста 99 %». Данный эффект представляет собой характерный пример ошибки базового процента; теорема Байеса позволяет его корректно учесть при условии явного задания априорного распределения, отражающего распространённость заболевания.

undefined

Применение

  • Клинические испытания — байесовский подход позволяет формально учитывать информацию, накопленную на предыдущих фазах исследования, и формулировать результаты в виде вероятностных утверждений о параметрах (например, «вероятность того, что терапевтический эффект превышает заданный порог, составляет …»), что обеспечивает более прозрачную интерпретацию по сравнению с традиционными -значениями[22].
  • Машинное обучение — на теореме Байеса основан наивный байесовский классификатор, десятилетиями применявшийся в байесовской фильтрации спама[23]; более общий аппарат образуют байесовские сети доверия — графовые вероятностные модели, факторизующие совместное распределение по структуре условных зависимостей[24]; отдельным направлением является байесовская оптимизация гиперпараметров, позволяющая эффективно настраивать сложные модели машинного обучения.
  • Обработка сигналов и навигация — рекуррентное применение теоремы Байеса к последовательности наблюдений приводит к байесовским фильтрам; при линейно-гауссовой модели такой фильтр совпадает с фильтром Калмана, в общем случае применяются фильтры частиц. На той же основе строятся скрытые марковские модели, используемые в распознавании речи и биоинформатическом анализе последовательностей[25].
  • Судебная практика — вес улики оценивается через отношение правдоподобия. Данный подход формализован в практическом руководстве Королевского статистического общества (RSS): Aitken, Roberts, Jackson, «Fundamentals of Probability and Statistical Evidence in Criminal Proceedings» (2010)[26].
  • Эконометрика — байесовские векторные авторегрессии (BVAR) широко применяются в макроэкономическом прогнозировании, в том числе центральными банками; систематическое изложение подхода представлено в работах Г. Купа и соавторов.
  • Когнитивистика — байесовские модели используются для описания процессов восприятия, обучения и принятия решений; концепция «байесовского мозга» рассматривается как рабочая гипотеза о том, что нервная система приближённо реализует байесовский вывод, а не как установленный факт нейронной реализации[27].
  • Поисково-спасательные операции — при поиске пропавших объектов апостериорное распределение местоположения пересчитывается после каждого безрезультатного обследования участка, что позволяет оптимально распределять ресурсы[28].
  • Физика данных — байесовские методы применяются в космологии (сравнение моделей Вселенной, оценка параметров) и при обработке данных экспериментов на ускорителях элементарных частиц[29].
undefined

Критика и ограничения

  1. Субъективность априорных распределений. Представители частотной школы, начиная с Р. Фишера, указывают, что выбор априорного распределения вносит в анализ субъективный элемент, что противоречит идеалу объективности научного исследования. Байесовские статистики возражают, что явное указание априорных предположений методологически честнее, чем их скрытое использование через выбор модели, статистики или плана эксперимента в частотном анализе.
  2. Вычислительная сложность. Алгоритмы MCMC требуют значительных вычислительных ресурсов, особенно в задачах высокой размерности, а сходимость марковских цепей не всегда может быть надёжно верифицирована. Методы вариационного вывода существенно быстрее, однако дают смещённое приближение, зависящее от выбора аппроксимирующего семейства.
  3. Несобственные априорные распределения. Неинформативные априорные распределения часто оказываются несобственными (их интеграл расходится), что требует дополнительной проверки корректности: при некоторых моделях апостериорное распределение может оказаться несобственным, несмотря на формально заданный априор.
  4. Сравнение моделей. Байесовское сравнение моделей связано с вычислением маргинального правдоподобия , которое в многомерных задачах представляет собой отдельную вычислительную проблему. На практике применяются приближённые методы: информационные критерии (WAIC, LOO-CV)[30], вложенный сэмплинг и другие техники.

Примечания

  1. 1 2 Gelman A., Carlin J. B., Stern H. S. et al. Bayesian Data Analysis. — 3rd. — Boca Raton: CRC Press, 2014. — ISBN 978-1-4398-9820-8.
  2. Lee P. M. Bayesian Statistics: An Introduction. — 4th. — Chichester: Wiley, 2012. — ISBN 978-1-118-33257-3.
  3. Хей Дж. Введение в методы байесовского статистического вывода. — М.: Финансы и статистика, 1987. — С. 6.
  4. Курт Уилл (Will Kurt). Байесовская статистика: Star Wars®, LEGO®, резиновые уточки и многое другое / пер. с англ.. — СПб.: Питер, 2021. — 304 с. — (Библиотека программиста). — ISBN 978-5-4461-1655-3.
  5. 1 2 Jaynes E. T. Probability Theory: The Logic of Science. — Cambridge: Cambridge University Press, 2003. — С. 17, 270, 292, 576. — ISBN 978-0-511-06589-7.
  6. Brooks S., Gelman A., Jones G., Meng X.-L. Handbook of Markov Chain Monte Carlo. — Boca Raton: CRC Press, 2011. — ISBN 978-1-4200-7942-5.
  7. McGrayne S. B. The Theory That Would Not Die. — New Haven: Yale University Press, 2011. — ISBN 978-0-300-16969-0.
  8. Stigler S. M. Laplace's 1774 Memoir on Inverse Probability // Statistical Science. — 1986. — Т. 1, № 3. — С. 359–363. — doi:10.1214/ss/1177013620.
  9. Fienberg S. E. When Did Bayesian Inference Become «Bayesian»? // Bayesian Analysis. — 2006. — Т. 1, № 1. — С. 1–40.
  10. Savage L. J. The Foundations of Statistics. — 2nd. — New York: Dover, 1972. — ISBN 0-486-62349-1.
  11. Gelfand A. E., Smith A. F. M. Sampling-Based Approaches to Calculating Marginal Densities // Journal of the American Statistical Association. — 1990. — Т. 85, № 410. — С. 398–409.
  12. de Finetti B. Theory of Probability. — New York: Wiley, 2017. — Т. 1. — С. 118-120. — ISBN 978-1-119-28637-0.
  13. van der Vaart A. W. Asymptotic Statistics. — Cambridge: Cambridge University Press, 2000. — ISBN 978-0-521-78450-4.
  14. Raiffa H., Schlaifer R. Applied Statistical Decision Theory. — Boston: Harvard Business School, 1961.
  15. Kass R. E., Wasserman L. The Selection of Prior Distributions by Formal Rules // Journal of the American Statistical Association. — 1996. — Т. 91, № 435. — С. 1343–1370.
  16. Jeffreys H. Theory of Probability. — 3rd. — Oxford: Clarendon Press, 1961. — ISBN 978-0-1985-1215-8.
  17. Berger J. O., Bernardo J. M. On the Development of Reference Priors // Bayesian Statistics. — 1992. — Т. 4. — С. 35–60.
  18. Robert C. P., Casella G. Monte Carlo Statistical Methods. — 2nd. — New York: Springer, 2004. — ISBN 978-0-387-21239-5.
  19. Hoffman M. D., Gelman A. The No-u-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo // Journal of Machine Learning Research. — 2014. — Т. 15(1). — С. 1593–1623.
  20. Blei D. M., Kucukelbir A., McAuliffe J. D. Variational Inference: A Review for Statisticians // Journal of the American Statistical Association. — 2017. — Т. 112, № 518. — С. 859–877. — doi:10.1080/01621459.2017.1285773.
  21. Berger J. O. Statistical Decision Theory and Bayesian Analysis. — 2nd. — New York: Springer-Verlag, 1993. — 617 с. — ISBN 0-387-96098-8.
  22. Berry D. A. Bayesian Clinical Trials // Nature Reviews Drug Discovery. — 2006. — Т. 5. — С. 27–36.
  23. Маннинг К., Рагхаван П., Шютце Х. Введение в информационный поиск. — М.: Вильямс, 2011. — ISBN 978-5-8459-1623-5.
  24. Koller D., Friedman N. Probabilistic Graphical Models. — Cambridge, MA: MIT Press, 2009. — ISBN 978-02-6225-835-7.
  25. Thrun S., Burgard W., Fox D. Probabilistic Robotics. — Cambridge, MA: MIT Press, 2005. — ISBN 9-026-220-162-3.
  26. Aitken C., Roberts P., Jackson G. Fundamentals of Probability and Statistical Evidence in Criminal Proceedings. — London: Royal Statistical Society, 2012.
  27. Knill D. C., Pouget A. The Bayesian brain // Trends in Neurosciences. — 2004. — Т. 27, № 12. — С. 712–719. — doi:10.1016/j.tins.2004.10.007.
  28. Stone L. D. Theory of Optimal Search. — 2nd. — INFORMS, 1975. — ISBN 978-0126-72450-9.
  29. Trotta R. Bayes in the sky: Bayesian inference and model selection in cosmology // Contemporary Physics. — 2008. — Т. 49, № 2. — С. 71–104.
  30. Vehtari A., Gelman A., Gabry J. Practical Bayesian model evaluation using leave-one-out cross-validation and WAIC // Statistics and Computing. — 2017. — Т. 27. — С. 1413–1432.

Литература

  • Хей Дж. Введение в методы байесовского статистического вывода. — М.: Финансы и статистика, 1987. — 336 с.
  • Зельнер А. Байесовские методы в эконометрии. — М.: Статистика, 1980.
  • Маннинг К. Д., Рагхаван П., Шютце Х. Введение в информационный поиск / пер. с англ. Д. А. Клюшина. — М.: Вильямс, 2011. — 520 с. — (Профессионалам от профессионалов). — ISBN 978-5-8459-1623-5.
  • Berger J. O. Statistical Decision Theory and Bayesian Analysis. — 2nd. — New York: Springer-Verlag, 1993. — 617 с. — ISBN 0-387-96098-8.
  • Gelman A., Carlin J. B., Stern H. S. et al. Bayesian Data Analysis. — 3rd. — Boca Raton: CRC Press, 2014. — ISBN 978-1-4398-9820-8.
  • Jaynes E. T. Probability Theory: The Logic of Science. — Cambridge: Cambridge University Press, 2003. — ISBN 978-0-511-06589-7.
  • Jeffreys H. Theory of Probability. — 3rd. — Oxford: Clarendon Press, 1961. — ISBN 978-0-1985-1215-8.
  • Lee P. M. Bayesian Statistics: An Introduction. — 4th. — Chichester: Wiley, 2012. — ISBN 978-1-118-33257-3.
  • Savage L. J. The Foundations of Statistics. — 2nd. — New York: Dover, 1972. — ISBN 0-486-62349-1.

Дополнительно по теме