Теорема Байеса

ИИ-обзор статьи
Теорема Байеса позволяет уточнять вероятность гипотез, связывая априорные убеждения с новыми данными для получения апостериорной вероятности. В байесовской интерпретации вероятность выступает мерой доверия, обновляемой при получении доказательств. Математически теорема применима как для дискретных событий, так и для непрерывных величин через плотности распределения. Её использование часто приводит к контринтуитивным результатам, таким как парадокс ложноположительного результата, где интуитивная оценка вероятности расходится с точным расчетом.
Терминология теоремы Байеса
В теореме Байеса вероятности причин называют гипотезами, где априорная вероятность отражает исходную вероятность причины, а апостериорная — вероятность причины с учётом произошедшего события.
Парадокс ложноположительного результата
При низкой распространенности заболевания даже точный тест часто дает ложноположительные результаты, что иллюстрирует контринтуитивное применение теоремы Байеса при оценке вероятности болезни у пациента с положительным диагнозом.
Байесовская интерпретация вероятности
В байесовской интерпретации вероятность отражает уровень доверия, а теорема связывает его значения до и после получения новых доказательств.
Формула Байеса для событий
Теорема Байеса определяет условную вероятность события A при известном событии B, используя априорную вероятность и данные о взаимозависимости событий через математическое отношение их вероятностей.
Теорема Байеса для непрерывных величин
Для непрерывных случайных величин теорема Байеса формулируется с использованием плотностей распределения вероятностей, что позволяет применять её в пространствах с непрерывными переменными.

Теоре́ма Ба́йеса (фо́рмула Ба́йеса) — одна из основных теорем элементарной теории вероятностей, которая выражает условную вероятность события при наступлении события через условную вероятность при наступлении и безусловные вероятности этих событий[1][2]. Иными словами, формула Байеса позволяет пересчитать вероятность гипотезы, приняв в расчёт как ранее известные сведения, так и данные новых наблюдений.

undefined

Теорема выводится непосредственно из определения условной вероятности и потому является следствием аксиом теории вероятностей[3]. Никакой причинно-следственной связи между событиями и при этом не требуется; не требуется и того, чтобы события были зависимы, — для независимых событий формула даёт , что отвечает содержательному утверждению «наблюдение не меняет нашего знания об ».

История

Работа Байеса

Теорема названа в честь английского пресвитерианского священника и математика Томаса Байеса (1702—1761). Байес учился в Эдинбургском университете, поскольку как нонконформист не мог поступить в Оксфорд или Кембридж, а с 1730-х годов служил в Танбридж-Уэллсе[4].

undefined

При жизни Байес не опубликовал ни одной работы по теории вероятностей. После его смерти рукопись «An Essay towards solving a Problem in the Doctrine of Chances» нашёл среди бумаг покойного друг Байеса Ричард Прайс, который отредактировал текст, снабдил его предисловием и приложением и представил Королевскому обществу. Работа была прочитана 23 декабря 1763 года и напечатана в томе 53 «Философских трудов», датированном 1763 годом и вышедшем из печати в 1764 году[5][4].

Важно понимать, чего в работе Байеса нет. Он не выписывал формулу в современном виде и не рассматривал произвольное число гипотез: Байес решал одну частную задачу — как по числу успехов и неудач в серии испытаний оценить вероятность успеха, то есть находил апостериорное распределение параметра биномиального распределения при равномерном априорном[6]. Значительная часть очерка посвящена обоснованию того, почему равномерное априорное распределение вообще допустимо.

Вклад Лапласа

Независимо от Байеса и, по-видимому, не зная о его работе, общее правило сформулировал Пьер-Симон Лаплас в мемуаре «Mémoire sur la probabilité des causes par les événements» 1774 года[7]. Лаплас записал принцип для произвольного числа причин:

Если событие может быть произведено различными причинами, то вероятности существования этих причин, определяемые по событию, относятся между собой как вероятности события, вычисленные при этих причинах, а вероятность существования каждой из них равна вероятности события при этой причине, делённой на сумму всех подобных вероятностей.

П.-С. Лаплас, 1774[7]

Это в точности формула Байеса в развёрнутой форме. В дальнейшем Лаплас развивал теорию почти сорок лет, подытожив результаты в «Théorie analytique des probabilités» (1812) и в популярном «Essai philosophique sur les probabilités» (1814)[6]. Именно Лапласу принадлежат общая постановка, принцип недостаточного основания для выбора априорных распределений и первые содержательные приложения, поэтому историки статистики отмечают, что современная теория восходит скорее к Лапласу, тогда как имя закрепилось за Байесом как за автором более ранней публикации[8].

От «обратной вероятности» к байесовским методам

На протяжении столетия после Лапласа подход называли не байесовским, а методом обратной вероятности; им пользовались Гаусс, Эджуорт и ранний Пирсон[8]. Выводы Байеса принял Лаплас в мемуаре 1781 года; независимо к ним пришёл Кондорсе. Первым серьёзным критиком стал Джордж Буль в «Законах мышления» (1854), после чего метод надолго стал предметом споров[4].

В 1920—1950-х годах Роналд Фишер резко выступал против использования априорных вероятностей и в полемике называл этот подход «байесовским» — ярлык закрепился именно тогда[8]. Одновременно шло возрождение метода: Гарольд Джеффрис подвёл под правило Байеса аксиоматическую основу, а позднее Леонард Сэвидж, Бруно де Финетти и Деннис Линдли развили субъективную интерпретацию вероятности. Джеффрису принадлежит известное сравнение: теорема Байеса «для теории вероятностей то же, что теорема Пифагора для геометрии»[9].

Во время Второй мировой войны байесовские рассуждения применялись при дешифровке «Энигмы» в Блетчли-парке: Алан Тьюринг использовал накопление логарифмов отношения правдоподобия для отбора гипотез о настройках машины, введя для их измерения единицу «бан». Эти работы оставались засекреченными десятилетиями[10].

Широкое практическое применение байесовских методов началось лишь в конце XX века, когда развитие вычислительной техники и появление алгоритмов Монте-Карло по схеме марковских цепей, в частности алгоритма Метрополиса — Гастингса, сделали возможным расчёт апостериорных распределений в сложных моделях[11].

Формулировка

Формула Байеса. Пусть и — случайные события, причём . Тогда

где

  • априорная вероятность гипотезы , то есть вероятность до того, как стало известно о наступлении ;
  • апостериорная вероятность гипотезы после того, как событие произошло;
  • правдоподобие: вероятность наблюдения при условии, что гипотеза верна;
  • — безусловная (маргинальная) вероятность события .

Отношение называют коэффициентом Байеса (или отношением правдоподобия); именно оно показывает, во сколько раз наблюдение изменяет правдоподобие гипотезы[12][13].

Доказательство и вывод формул

Формула вытекает из определения условной вероятности. Вероятность совместного наступления событий и двояко выражается через условные вероятности:

Разделив на , получаем:

Вычисление P ( B ) {\displaystyle P(B)}

Пусть события образуют полную группу гипотез, то есть попарно несовместны ( при ), имеют положительные вероятности и в объединении дают всё пространство элементарных событий:

Здесь — число гипотез (конечное либо счётное; в последнем случае суммирование ведётся по всем ). Тогда безусловная вероятность события находится по формуле полной вероятности[14]:

где все вероятности в правой части либо известны из условия задачи, либо допускают экспериментальную оценку.

Подставляя это выражение в формулу Байеса, получаем её развёрнутый вид для гипотезы с номером , где :

Индекс суммирования пробегает номера всех гипотез полной группы, а индекс фиксирован и указывает ту гипотезу, вероятность которой требуется найти.

Для непрерывных случайных величин

Для случайных величин и формула Байеса напрямую к событиям вида неприменима: если величина непрерывна, то при любом , и выражение принимает неопределённый вид . Поэтому теорему переформулируют в терминах плотностей распределения.

Если непрерывна, а дискретна, то:

Если дискретна, а непрерывна:

Если обе величины непрерывны:

На практике совместное распределение обычно задают через априорную плотность и условную плотность . Тогда знаменатель (маргинальная плотность ) получается интегрированием числителя по всем значениям — это непрерывный аналог формулы полной вероятности:

Подставляя, получаем развёрнутую форму для непрерывного случая:

undefined

Именно вычисление этого интеграла — главная вычислительная трудность байесовских методов: в многомерных задачах он берётся приближённо, численно или методами Монте-Карло по схеме марковских цепей[15].

Смысл и терминология

Формула Байеса позволяет «переставить местами» условие и следствие: зная, что событие произошло, вычислить вероятность того, что оно вызвано той или иной причиной. Подчеркнём, что для применения теоремы причинно-следственная связь между и не обязательна: теорема является чисто арифметическим следствием определения условной вероятности.

События, отражающие действие возможных «причин», называют гипотезами. Безусловную вероятность гипотезы называют априорной (насколько причина вероятна вообще, до проведения опыта), а условную, с учётом наступившего события, — апостериорной (насколько причина вероятна в свете полученных данных)[16].

Хотя сама по себе формула Байеса является строгим математическим тождеством, её систематическое использование в качестве основы для обновления знаний и принятия решений сформировало целое методологическое направление — байесовский вывод (или байесовскую статистику). В этом подходе вероятности трактуются не только как частоты событий, но и как степени уверенности в истинности гипотез, что позволяет применять теорему к уникальным, неповторяемым событиям и сложным моделям машинного обучения.

Примеры

Машина не заводится

Пусть — событие «машина не заводится», а гипотеза — «в баке нет топлива». Если бак пуст, машина заведомо не заведётся, то есть . В этом частном случае формула Байеса упрощается:

Пусть , а . Тогда для случайно выбранной незаводящейся машины вероятность пустого бака равна . Наблюдение увеличило вероятность гипотезы в 50 раз, но она всё ещё не превышает половины: помимо пустого бака существуют другие причины неисправности.

Три рабочих

Пусть доля брака у первого рабочего , у второго , у третьего . Первый изготовил деталей, второй , третий . Начальник цеха берёт наугад деталь, и она оказывается бракованной. С какой вероятностью её изготовил третий рабочий?

Пусть — «деталь бракованная», — «деталь изготовил -й рабочий», . Гипотезы образуют полную группу. Тогда , где , и .

По формуле полной вероятности:

По формуле Байеса:

Хотя третий рабочий изготовил больше всех деталей, он аккуратнее прочих, поэтому вероятность его авторства для бракованной детали ниже, чем у второго: , . Сумма трёх апостериорных вероятностей равна единице.

Редкий подвид жуков

Энтомолог предполагает, что найденный жук относится к редкому подвиду, поскольку у него на спинке есть узор. В редком подвиде узор имеют 98 % особей: . Среди обычных жуков узор встречается лишь у 5 %: . Редкий подвид составляет 0,1 % популяции: . Какова вероятность того, что жук с узором относится к редкому подвиду?

undefined

Гипотезы «редкий» и «обычный» образуют полную группу, поэтому:

Несмотря на выразительный признак, вероятность остаётся малой: редких жуков попросту слишком мало. Тем не менее наблюдение узора повысило вероятность гипотезы примерно в 19 раз — с 0,1 до 1,9 %.

Парадокс медицинского теста

Пусть заболевание встречается у 0,1 % населения, а диагностический тест выявляет больного с вероятностью 0,9 и даёт ложноположительный результат у здорового с вероятностью 0,01. Первая величина называется чувствительностью теста, вторая дополняет его специфичность до единицы. Какова вероятность того, что человек с положительным результатом на самом деле здоров?

undefined

Для избежания путаницы обозначим положительный результат теста как , а истинное состояние пациента — как (болен) и (здоров). По условию:

Полная вероятность положительного результата:

Отсюда вероятность того, что пациент здоров при положительном тесте:

Таким образом, около 91,7 % положительных результатов ложные. Причина в том, что вероятность ложного срабатывания, хотя и мала сама по себе, на порядок превышает долю больных в обследуемой группе[17]. Этот эффект — характерный пример ошибки базового процента и служит доводом против сплошного скрининга редких заболеваний.

Если ошибки теста при повторном обследовании можно считать условно независимыми при известном состоянии пациента, то результат второго положительного теста пересчитывается по той же формуле, причём апостериорная вероятность первого шага становится априорной для второго:

После двух независимых положительных результатов доля ложных срабатываний падает с 91,7 до 11 %. Предположение об условной независимости здесь существенно: если ошибка вызвана устойчивой особенностью организма, повторный тест даст тот же неверный результат, и никакого уточнения не произойдёт[18].

Формы записи

Пропорциональная форма

Если событие зафиксировано, знаменатель представляет собой одно и то же число для всех гипотез, поэтому

то есть апостериорная вероятность пропорциональна произведению априорной вероятности на правдоподобие[19]. Коэффициент пропорциональности восстанавливается из условия нормировки. Для гипотезы и её отрицания

а так как сумма этих вероятностей равна единице,

Развёрнутая форма

Если задана полная группа гипотез , где (число гипотез конечно или счётно), то

и, следовательно, для любого из того же диапазона

В частном случае двух гипотез — и

Правило Байеса для шансов

Шансами (англ. odds) двух гипотез называют отношение их вероятностей:

Величина — априорные шансы, — апостериорные. Отношением правдоподобия называют

Если записать формулу Байеса для и и поделить одно равенство на другое, знаменатель сократится, и получится правило Байеса:

Апостериорные шансы равны априорным, умноженным на отношение правдоподобия. Эта форма удобна тем, что не требует вычисления , а при последовательном поступлении условно независимых данных отношения правдоподобия просто перемножаются; логарифмируя, их заменяют сложением, что и применялось при дешифровке «Энигмы»[10].

Например, в задаче о медицинском тесте априорные шансы «болен против здоров» равны , отношение правдоподобия положительного результата равно , поэтому апостериорные шансы составляют , что даёт вероятность болезни — тот же ответ, что и выше[20].

Примечания

  1. Вентцель Е. С. Теория вероятностей : учебник для вузов. — 10-е изд., стер.. — М.: Высшая школа, 2006. — С. 56—59. — ISBN 5-06-005688-0.
  2. Гмурман В. Е. Теория вероятностей и математическая статистика. — 12-е изд.. — М.: Юрайт, 2015. — С. 52—54. — (Бакалавр. Прикладной курс). — ISBN 978-5-9916-3461-8.
  3. Ширяев А. Н. Вероятность. — 3-е изд., перераб. и доп.. — М.: МЦНМО, 2004. — Т. 1. — С. 47. — ISBN 5-94057-105-0.
  4. 1 2 3 O'Connor J. J., Robertson E. F. Thomas Bayes (англ.). MacTutor History of Mathematics Archive. Дата обращения: 11 августа 2026.
  5. Bayes T., Price R. An Essay towards solving a Problem in the Doctrine of Chances (англ.) // Philosophical Transactions of the Royal Society of London. — 1763. — Vol. 53. — P. 370—418.
  6. 1 2 Stigler S. M. Laplace's 1774 Memoir on Inverse Probability (англ.) // Statistical Science. — 1986. — Vol. 1, no. 3. — P. 359—363. — doi:10.1214/ss/1177013620.
  7. 1 2 Laplace P. S. Mémoire sur la probabilité des causes par les événements (фр.) // Mémoires de l'Académie royale des Sciences de Paris (Savants étrangers). — 1774. — Vol. 6. — P. 621—656.
  8. 1 2 3 Fienberg S. E. When Did Bayesian Inference Become «Bayesian»? (англ.) // Bayesian Analysis. — 2006. — Vol. 1, no. 1. — P. 1—40. — doi:10.1214/06-BA101.
  9. Jeffreys H. Scientific Inference (англ.). — 3rd ed. — Cambridge: Cambridge University Press, 1973. — P. 31. — 272 p. — ISBN 978-0-521-18078-8.
  10. 1 2 McGrayne S. B. The Theory That Would Not Die (англ.). — New Haven: Yale University Press, 2011. — 320 p. — ISBN 978-0-30016-969-0.
  11. Gelman A., Carlin J. B., Stern H. S. et al. Bayesian Data Analysis (англ.). — 3rd ed. — Boca Raton: CRC Press, 2014. — 675 p. — ISBN 978-1-4398-9820-8.
  12. Ширяев А. Н. Вероятность. — 3-е изд., перераб. и доп.. — М.: МЦНМО, 2004. — Т. 1. — С. 136. — ISBN 5-94057-105-0.
  13. Науменко А. П., Кудрявцева И. С., Одинец А. И. Вероятностно-статистические методы принятия решений : Теория, примеры, задачи : учебное пособие. — Омск: Изд-во ОмГТУ, 2018. — С. 27.
  14. Гнеденко Б. В. Курс теории вероятностей : учебник для университетов. — 6-е изд., перераб. и доп.. — М.: Наука. Гл. ред. физ.-мат. лит., 1988. — С. 54-61. — ISBN 5-02-013761-8.
  15. Gelman A., Carlin J. B., Stern H. S. et al. Bayesian Data Analysis (англ.). — 3rd ed. — Boca Raton: CRC Press, 2014. — P. 6—8. — ISBN 978-1-4398-9820-8.
  16. Вентцель Е. С. Теория вероятностей : учебник для вузов. — 10-е изд., стер.. — М.: Высшая школа, 2006. — С. 56—59. — ISBN 5-06-005688-0.
  17. Gigerenzer G. Calculated Risks: How to Know When Numbers Deceive You (англ.). — New York: Simon & Schuster, 2002. — P. 108—109. — ISBN 978-0-7432-5423-6.
  18. Lee P. M. Bayesian Statistics: An Introduction (англ.). — 4th ed. — Chichester: Wiley, 2012. — P. 9—12. — 486 p. — ISBN 978-1-118-33257-3.
  19. Lee P. M. Bayesian Statistics: An Introduction (англ.). — 4th ed. — Chichester: Wiley, 2012. — P. 1—30. — 486 p. — ISBN 978-1-118-33257-3.
  20. Lee P. M. Bayesian Statistics: An Introduction (англ.). — 4th ed. — Chichester: Wiley, 2012. — P. 6—7, 12-17, 140-142. — 486 p. — ISBN 978-1-118-33257-3.

Литература

Ссылки

Дополнительно по теме