Коэффициент Байеса

Коэффицие́нт Ба́йеса (англ. Bayes factor) — метод байесовского статистического вывода, служащий альтернативой классической проверке статистических гипотез[1][2][3].

Байесовское сравнение моделей — это процедура выбора наиболее предпочтительной модели на основе вычисления коэффициентов Байеса. Рассматриваемые модели являются статистическими моделями[4].

Целью коэффициента Байеса является количественная оценка степени поддержки одной модели по сравнению с другой на основе наблюдаемых данных, независимо от того, является ли какая-либо из этих моделей абсолютно «истинной»[5]. В отличие от частотного подхода, байесовское сравнение моделей естественным образом реализует принцип бритвы Оккама, штрафуя модели за избыточную сложность.

Общие сведения
Коэффициент Байеса
Область использования Статистика, Математическая статистика, Байесовский вывод
Дата появления 1935
Автор понятия Гарольд Джеффрис
Ключевые слова Байесовский вывод, коэффициент Байеса, предельное правдоподобие, проверка гипотез, бритва Оккама, парадокс Линдли, JASP
Базовые понятия теорема Байеса, априорная вероятность, предельное правдоподобие, Байесовский вывод, проверка статистических гипотез

История

Математической основой метода служит обратная задача теории вероятностей, поставленная Томасом Байесом (1763) и развитая Пьером-Симоном Лапласом; при равных априорных вероятностях моделей сравнение гипотез по апостериорным вероятностям — как это делал Лаплас — эквивалентно вычислению коэффициента Байеса[6]. Однако явный аппарат для проверки точного «закона» (точечной гипотезы) против размытой альтернативы появился лишь в XX веке.

1919—1939: Ринч, Джеффрис, Холдейн

Ключевой концептуальный шаг — априорное распределение, которое наряду с непрерывной компонентой для альтернатив помещает ненулевую точечную массу вероятности на простую гипотезу («закон»); только при таком априорном данные способны увеличивать вероятность закона — был сделан в серии статей философа Дороти Ринч и математика Гарольда Джеффриса 1919—1923 годов[7][8]. Независимо смесь точечной массы и непрерывной плотности предложил генетик Дж. Б. С. Холдейн в докладе Кембриджскому философскому обществу (опубликован в 1932 году); по историческому анализу Этца и Вагенмейкерса, Холдейн, возможно, вычислил первый коэффициент Байеса ещё до того, как это сделал Джеффрис[9].

Джеффрис развил аппарат в статье 1935 года и монографии «Теория вероятностей» (1939): предложил априорные распределения по умолчанию для задачи проверки гипотез, выписал коэффициенты для ряда стандартных ситуаций и ввёл шкалу интерпретации, которой пользуются до сих пор[10][11].

1940—1950-е: Тьюринг, Гуд и термин

Во время Второй мировой войны Алан Тьюринг независимо применял аналогичные рассуждения в криптоанализе в Блетчли-парке, измеряя свидетельства в «децибанах» — логарифмических единицах «веса доказательства»; по свидетельству И. Дж. Гуда, именно Тьюринг в разговоре 1940 года предложил считать слово «фактор» техническим термином[12][13]. Гуд систематизировал и обнародовал эти идеи после снятия секретности; словосочетание «коэффициент Байеса» (Bayes factor) закрепилось после его статьи 1958 года[14].

1957: парадоксы

В 1957 году Д. Линдли описал парадокс расхождения байесовского и частотного выводов при больших выборках[15], а в комментарии к той же статье М. С. Бартлетт указал на чувствительность коэффициента к ширине априорного распределения (парадокс Бартлетта)[16]. Эти результаты определили главное направление последующей методологической критики метода.

1970—1990-е: методическая разработка и возрождение

На фоне критики p-значений интерес к байесовским мерам свидетельства вырос: Д. Шпигельхальтер и А. Смит систематизировали вычисление коэффициентов для линейных и лог-линейных моделей[17]; Дж. О. Бергер и М. Делампади показали, что p-значения систематически преувеличивают свидетельства против точной гипотезы по сравнению с коэффициентом Байеса[18]. Против чувствительности к априорике были предложены дробные (Э. О’Хэйган, 1995) и внутренние (Бергер и Л. Р. Периччи, 1996) коэффициенты[19][20]. Обзор Р. Касса и А. Рафтери (1995) подытожил теорию, шкалы интерпретации и вычислительные приёмы и стал одной из самых цитируемых работ по теме[21].

2000-е — настоящее время

Распространение методов Монте-Карло с марковскими цепями, мостовой и вложенной выборки сделало вычисление коэффициентов рутинной процедурой. В психологии и социальных науках метод стал одним из символов движения «новой статистики»: байесовский t-тест Раудера с соавторами (2009) с априорным распределением Коши[22] и пакеты JASP и Jamovi сделали коэффициент доступным широкому кругу прикладных исследователей.

undefined

Определение

Коэффициент Байеса представляет собой отношение предельных (маргинальных) правдоподобий двух гипотез (моделей), обычно нулевой и альтернативной[23].

Апостериорная вероятность модели M, задаваемой наблюдаемыми данными D, определяется теоремой Байеса:

Ключевой член, зависящий от данных, , является предельным правдоподобием модели M. Он представляет собой вероятность получения наблюдаемых данных при условии истинности модели M, усреднённую по всем возможным значениям параметров этой модели с учётом их априорного распределения. Корректное вычисление этого члена является основой байесовского сравнения моделей.

В задаче выбора модели, когда необходимо выбрать между двумя моделями M1 и M2, параметризованными векторами параметров и , отношение их правдоподобий задаётся коэффициентом Байеса K:

Если две модели априори одинаково вероятны, то есть , коэффициент Байеса в точности равен отношению их апостериорных вероятностей.

Если вместо интегрирования по априорному распределению в числителе и знаменателе используется значение функции правдоподобия в точке оценки максимального правдоподобия (ОМП) параметра, то тест превращается в классический тест отношения правдоподобия. В отличие от него, байесовский подход не зависит от конкретного набора параметров, так как вычисляется путём интегрирования по всему пространству параметров. Это автоматически и естественным образом включает штраф за избыточное усложнение модели[24], что защищает от переобучения.

Интуиция и «Фактор Оккама»

Способность коэффициента Байеса штрафовать сложные модели часто называют «автоматической реализацией бритвы Оккама». Это явление количественно описывается так называемым фактором Оккама (Ockham factor)[25].

undefined

Простая модель с меньшим числом параметров делает более узкие и конкретные предсказания, концентрируя свою априорную вероятность в небольшой области пространства данных. Если реальные данные попадают в эту область, простая модель получает высокий выигрыш в предельном правдоподобии. Сложная модель с множеством параметров «размазывает» свою априорную вероятность по гораздо более широкому пространству. В результате плотность вероятности (и, следовательно, среднее значение правдоподобия) в любой конкретной точке оказывается ниже, если только дополнительные параметры не дают существенного, оправданного данными прироста в качестве подгонки.

Методы вычисления

Прямое аналитическое вычисление интегралов для предельного правдоподобия возможно лишь в редких случаях, например, при использовании сопряжённых априорных распределений. На практике применяются следующие подходы:

  • Асимптотические приближения. Наиболее тесную связь с коэффициентом Байеса имеет Байесовский информационный критерий (BIC, или критерий Шварца). При выполнении регулярных условий и при стремлении объёма выборки к бесконечности, логарифм коэффициента Байеса аппроксимируется через разность значений BIC двух моделей[21]:
где ,  — число свободных параметров, а  — максимальное значение функции правдоподобия. BIC штрафует за сложность строже, чем критерий Акаике (AIC), при объёме выборки n > 7.
  • Численные методы (MCMC). Для сложных моделей используются методы Монте-Карло для марковских цепей. Прямое использование «гармонического среднего» (harmonic mean estimator) нестабильно и не рекомендуется. Вместо этого применяются более надёжные методы: мостовая выборка (bridge sampling), термодинамическое интегрирование (path sampling / thermodynamic integration) или вложенная выборка (nested sampling)[26].
  • Приближённые байесовские вычисления (ABC). Используются, если функция правдоподобия неизвестна или её вычисление слишком затратно, хотя такая оценка коэффициентов Байеса часто является смещённой[27][28].

Критика и ограничения

Главным аргументом критиков коэффициента Байеса является его чувствительность к выбору априорного распределения. Если сделать априорное распределение параметров слишком «широким» (диффузным) с целью выразить «незнание», маргинальное правдоподобие стремится к нулю. В результате коэффициент Байеса будет несправедливо и сильно штрафовать эту модель, даже если она верно описывает данные. Это явление известно как парадокс Линдли — Бартлетта.

Для решения этой проблемы были разработаны специальные методы:

  • Внутренние коэффициенты Байеса (Intrinsic Bayes factors), предложенные Дж. Бергером и Л. Периччи, которые используют минимальную часть данных для формирования «обученного» априорного распределения, а оставшиеся данные — для вычисления фактора[29].
  • Дробные коэффициенты Байеса (Fractional Bayes factors), предложенные Э. О’Хэйганом, где в качестве априорного распределения используется часть функции правдоподобия, возведённая в дробную степень[30].

Парадокс Линдли

Парадокс Линдли демонстрирует фундаментальное расхождение между байесовским и частотным подходами при больших объёмах данных[31]. При очень большом частотный тест почти всегда отвергает точную нулевую гипотезу (например, ), поскольку даже ничтожно малое отклонение становится «статистически значимым» (p-значение стремится к нулю). В то же время коэффициент Байеса может показывать «убедительную» поддержку нулевой гипотезы. Это происходит потому, что байесовский подход оценивает не вероятность получения экстремальных данных, а среднее правдоподобие по априорному распределению, которое может быть плотно сосредоточено около нуля, делая нулевую гипотезу более правдоподобной, чем любая конкретная альтернатива с широким априорным распределением.

undefined

Интерпретация

Значение K > 1 означает, что данные сильнее поддерживают гипотезу M1, чем M2. Классическая проверка гипотез рассматривает только свидетельства против нулевой гипотезы, тогда как коэффициент Байеса симметрично оценивает поддержку обеих моделей.

undefined

Гарольд Джеффрис предложил следующую шкалу для интерпретации значения K[32]:

K дБ (децибаны) биты Весомость доказательств
< 1 < 0 < 0 Отрицательная (поддерживает M2)
1 … 101/2 0 … 5 0 … 1,6 Едва заслуживает внимания
101/2 … 101 5 … 10 1,6 … 3,3 Значительная
101 … 103/2 10 … 15 3,3 … 5,0 Сильная
103/2 … 102 15 … 20 5,0 … 6,6 Очень сильная
> 102 > 20 > 6,6 Убедительная

Второй столбец даёт веса поддержки в децибанах, третий — эквивалент в битах. Согласно И. Дж. Гуду, люди в повседневной жизни с трудом могут адекватно оценить разницу в степени доверия к гипотезе, соответствующую изменению веса на 1 децибан[33].

Альтернативную шкалу предложили Касс и Рафтери (1995)[21]:

Шкала интерпретации байесовского коэффициента (фактора Байеса)
Весомость доказательств
от 0 до 0,5 от 1 до 3,2 Заслуживает лишь упоминания
от 0,5 до 1 от 3,2 до 10 Положительная (существенная)
от 1 до 2 от 10 до 100 Сильная
> 2 > 100 Очень сильная (решающая)

Байесовские процедуры, включая коэффициенты Байеса, являются согласованными (когерентными), что позволяет рассматривать статистический вывод как частный случай принятия решений в условиях неопределённости с использованием функции потерь (например, логарифмической функции оценки, что приводит к расстоянию Кульбака — Лейблера).

Сама по себе теорема Байеса представляет собой строгое математическое тождество теории вероятностей и не зависит от конкретной интерпретации понятия вероятности. Однако систематическое использование этой теоремы для обновления степени уверенности в истинности гипотез по мере поступления новых данных сформировало самостоятельное методологическое направление. Подробности о философских и методологических основах этого подхода, включая различные интерпретации вероятности (частотную и байесовскую), а также о практических применениях теоремы для оценки параметров, сравнения моделей и проверки гипотез, изложены в статье Байесовский вывод.

Примеры

Пример 1: Биномиальное распределение

Предположим, случайная величина принимает значения «успех» или «неудача». Мы сравниваем модель M1, где вероятность успеха равна q = ½, и модель M2, где значение q неизвестно, и мы принимаем в качестве априорного распределения для q равномерное распределение на отрезке [0, 1].

undefined

Проведено 200 испытаний, получено 115 успехов и 85 неудач. Правдоподобие вычисляется по формуле биномиального распределения: .

Для гипотезы M1:

Для M2 (интегрирование по априорному распределению даёт значение бета-функции):

Коэффициент Байеса . Согласно шкале, это различие «едва заслуживает внимания», хотя выбор слегка склоняется в сторону M1.

При этом классический частотный тест для нулевой гипотезы дал бы двустороннее p-значение около 0,0400, что формально приводит к отклонению нулевой гипотезы на уровне значимости 5 %. Это расхождение частично объясняется тем, что частотный тест оценивает вероятность экстремальных исходов, а не относительную поддержку конкретной альтернативной модели.

Пример 2: Байесовский t-тест

В практике сравнения средних двух групп вместо частотного t-теста Стьюдента используется байесовский t-тест. Нулевая гипотеза утверждает, что размер эффекта равен нулю (). Альтернативная гипотеза предполагает, что размер эффекта подчиняется определённому априорному распределению, например, распределению Коши. Вычисление коэффициента Байеса в этом случае показывает, насколько данные увеличивают шансы в пользу наличия эффекта по сравнению с его отсутствием, при этом автоматически штрафуя модель за введение дополнительного параметра [34].

Современные области применения

  • Психология и социальные науки. В рамках движения «Новая статистика» (New Statistics) коэффициенты Байеса активно продвигаются как замена p-значениям. Программные пакеты с графическим интерфейсом, такие как JASP и JAMOVI, позволяют исследователям вычислять коэффициенты Байеса для t-тестов, дисперсионного анализа и регрессии «в один клик»[35].
  • A/B-тестирование в IT. Технологические компании используют байесовские факторы для мониторинга экспериментов. Это позволяет осуществлять раннюю остановку теста при накоплении убедительных доказательств в пользу одной из версий без проблемы инфляции ошибки первого рода, присущей частотному последовательному анализу.
  • Машинное обучение. Коэффициент Байеса (в форме маргинального правдоподобия, или «evidence») используется для выбора архитектуры нейронных сетей, сравнения ядер в гауссовских процессах и выбора гиперпараметров[36].
  • Биоинформатика. Метод применяется для ранжирования динамической экспрессии генов в качестве более надёжной альтернативы использованию q-значений (FDR)[37].

Примечания

  1. Курт Уилл. Байесовская статистика: Star Wars®, LEGO®, резиновые уточки и многое другое = Bayesian Statistics the Fun Way: Understand Statistics and Probability with Star Wars, LEGO, and Rubber Ducks / пер. с англ. А. Павлова. — СПб.: Питер, 2021. — С. 192—202. — (Библиотека программиста). — ISBN 978-5-4461-1655-3.
  2. Goodman S. N. Toward evidence-based medical statistics. 1: The P value fallacy // Annals of Internal Medicine. — 1999. — Т. 130, вып. 12. — С. 995–1004. — doi:10.7326/0003-4819-130-12-199906150-00008. — PMID 10383371.
  3. Goodman S. N. Toward evidence-based medical statistics. 2: The Bayes factor // Annals of Internal Medicine. — 1999. — Т. 130, вып. 12. — С. 1005–1013. — doi:10.7326/0003-4819-130-12-199906150-00019. — PMID 10383350.
  4. Morey R. D., Romeijn J.-W., Rouder J. N. The philosophy of Bayes factors and the quantification of statistical evidence // Journal of Mathematical Psychology. — 2016. — Т. 72. — С. 6–18. — doi:10.1016/j.jmp.2015.11.001.
  5. Ly A., Verhagen J., Wagenmakers E.-J. Harold Jeffreys’s default Bayes factor hypothesis tests: Explanation, extension, and application in psychology // Journal of Mathematical Psychology. — 2016. — Т. 72. — С. 19–32. — doi:10.1016/j.jmp.2015.06.004.
  6. Dale A. I. A History of Inverse Probability from Thomas Bayes to Karl Pearson. — New York: Springer-Verlag, 1991. — ISBN 978-1-4684-0417-3.
  7. Wrinch D. P., Jeffreys H. On Some Aspects of the Theory of Probability // Philosophical Magazine. — 1919. — Т. 38. — С. 715–731.
  8. Wrinch D. P., Jeffreys H. On Certain Fundamental Principles of Scientific Inquiry // Philosophical Magazine. — 1921. — Т. 42. — С. 369–390.
  9. Etz A., Wagenmakers E.-J. J. B. S. Haldane's contribution to the Bayes factor hypothesis test (англ.) // Statistical Science : журнал. — 2017. — Vol. 32, no. 3. — P. 313—329. — ISSN 0883-4237. — doi:10.1214/16-STS599.
  10. Jeffreys H. Some Tests of Significance, Treated by the Method of Probability // Proceedings of the Cambridge Philosophical Society. — 1935. — Т. 31. — С. 203–222.
  11. Jeffreys H. Theory of Probability. — Oxford: Clarendon Press, 1939.
  12. Good I. J. Probability and the Weighing of Evidence. — London: Charles Griffin, 1950.
  13. Good I. J. Studies in the History of Probability and Statistics. XXXVII A. M. Turing's statistical work in World War II // Biometrika. — 1979. — Т. 66, вып. 2. — С. 393–396. — doi:10.1093/biomet/66.2.393.
  14. Good I. J. Significance Tests in Parallel and in Series // Journal of the American Statistical Association. — 1958. — Т. 53, № 284. — С. 799–813.
  15. Lindley D. V. A statistical paradox // Biometrika. — 1957. — Т. 44, вып. 1–2. — С. 187–192. — doi:10.1093/biomet/44.1-2.187.
  16. Bartlett M. S. A Comment on D. V. Lindley's Statistical Paradox // Biometrika. — 1957. — Т. 44, вып. 3–4. — С. 533–534. — doi:10.1093/biomet/44.3-4.533.
  17. Spiegelhalter D. J., Smith A. F. M. Bayes Factors for Linear and Log-Linear Models // Journal of the Royal Statistical Society. Series B (Methodological). — 1982. — Т. 44, № 3. — С. 377–391.
  18. Berger J. O., Delampady M. Testing Precise Hypotheses // Statistical Science. — 1987. — Т. 2, № 3. — С. 317–352.
  19. O'Hagan A. Fractional Bayes factors for model comparison // Journal of the Royal Statistical Society. Series B (Methodological). — 1995. — Т. 57, № 1. — С. 99–138. — doi:10.1111/j.2517-6161.1995.tb02017.x.
  20. Berger J. O., Pericchi L. R. The intrinsic Bayes factor for model selection and prediction // Journal of the American Statistical Association. — 1996. — Т. 91, № 433. — С. 109–122. — doi:10.1080/01621459.1996.10476668.
  21. 1 2 3 Kass R. E., Raftery A. E. Bayes Factors // Journal of the American Statistical Association. — 1995. — Т. 90, № 430. — С. 773–795. — doi:10.2307/2291091.
  22. Rouder J. N., Speckman P. L., Sun D., Morey R. D., Iverson G. Bayesian t Tests for Accepting and Rejecting the Null Hypothesis // Psychonomic Bulletin & Review. — 2009. — Т. 16, № 2. — С. 225–254.
  23. Good P. I., Hardin J. W. Common Errors in Statistics (and How to Avoid Them). — 4th ed.. — Hoboken: John Wiley & Sons, 2012. — С. 129–131. — ISBN 978-1-118-36011-8.
  24. Kass R. E., Raftery A. E. Bayes Factors // Journal of the American Statistical Association. — 1995. — Т. 90, № 430. — С. 773–795. — doi:10.2307/2291091.
  25. MacKay D. J. C. Information Theory, Inference, and Learning Algorithms. — Cambridge: Cambridge University Press, 2003. — С. 343–348.
  26. Gelman A., Carlin J. B., Stern H. S., Rubin D. B. Bayesian Data Analysis. — 3rd ed.. — Boca Raton: CRC Press, 2014. — С. 180–190. — ISBN 978-1-4398-9820-8.
  27. Toni T., Stumpf M. P. H. Simulation-based model selection for dynamical systems in systems and population biology // Bioinformatics. — 2010. — Т. 26, вып. 1. — С. 104–110. — doi:10.1093/bioinformatics/btp619. — PMID 19880371.
  28. Robert C. P., Cornuet J., Marin J., Pillai N. S. Lack of confidence in approximate Bayesian computation model choice // Proceedings of the National Academy of Sciences. — 2011. — Т. 108, вып. 37. — С. 15112–15117. — doi:10.1073/pnas.1102900108. — PMID 21876135.
  29. Berger J. O., Pericchi L. R. The intrinsic Bayes factor for model selection and prediction // Journal of the American Statistical Association. — 1996. — Т. 91, № 433. — С. 109–122. — doi:10.1080/01621459.1996.10476668.
  30. O'Hagan A. Fractional Bayes factors for model comparison // Journal of the Royal Statistical Society. Series B (Methodological). — 1995. — Т. 57, № 1. — С. 99–138. — doi:10.1111/j.2517-6161.1995.tb02017.x.
  31. Lindley D. V. A statistical paradox // Biometrika. — 1957. — Т. 44, вып. 1–2. — С. 187–192. — doi:10.1093/biomet/44.1-2.187.
  32. Jeffreys H. The Theory of Probability. — 3rd ed.. — Oxford: Oxford University Press, 1961.
  33. Good I. J. Studies in the History of Probability and Statistics. XXXVII A. M. Turing's statistical work in World War II // Biometrika. — 1979. — Т. 66, вып. 2. — С. 393–396. — doi:10.1093/biomet/66.2.393.
  34. Ly A., Verhagen J., Wagenmakers E.-J. Harold Jeffreys’s default Bayes factor hypothesis tests: Explanation, extension, and application in psychology // Journal of Mathematical Psychology. — 2016. — Т. 72. — С. 19–32. — doi:10.1016/j.jmp.2015.06.004.
  35. Ly A., Verhagen J., Wagenmakers E.-J. Harold Jeffreys’s default Bayes factor hypothesis tests: Explanation, extension, and application in psychology // Journal of Mathematical Psychology. — 2016. — Т. 72. — С. 19–32. — doi:10.1016/j.jmp.2015.06.004.
  36. Duda R. O., Hart P. E., Stork D. G. Section 9.6.5 // Pattern Classification. — 2nd ed.. — New York: Wiley, 2000. — С. 487–489. — ISBN 0-471-05669-3.
  37. Hajiramezanali E., Dadaneh S. Z., Figueiredo P. d., Sze S., Zhou Z., Qian X. Differential Expression Analysis of Dynamical Sequencing Count Data with a Gamma Markov Chain. — 2018. — arXiv:1803.02527.

Литература

  • Курт Уилл. Байесовская статистика: Star Wars®, LEGO®, резиновые уточки и многое другое = Bayesian Statistics the Fun Way: Understand Statistics and Probability with Star Wars, LEGO, and Rubber Ducks / пер. с англ. А. Павлова. — СПб.: Питер, 2021. — 304 с. — (Библиотека программиста). — ISBN 978-5-4461-1655-3.
  • Gelman A., Carlin J. B., Stern H. S. et al. Bayesian Data Analysis. — 3rd. — Boca Raton: CRC Press, 2014. — ISBN 978-1-4398-9820-8.
  • Jaynes E. T. Probability Theory: The Logic of Science. — Cambridge: Cambridge University Press, 2003. — ISBN 978-0-511-06589-7.
  • Jeffreys H. Theory of Probability. — 3rd. — Oxford: Clarendon Press, 1961. — ISBN 978-0-1985-1215-8.
  • Lee P. M. Bayesian Statistics: An Introduction. — 4th. — Chichester: Wiley, 2012. — ISBN 978-1-118-33257-3.
  • MacKay D. J. C. Information Theory, Inference, and Learning Algorithms. — Cambridge: Cambridge University Press, 2003. — 628 с. — ISBN 978-0-521-64298-9.
  • Savage L. J. The Foundations of Statistics. — 2nd. — New York: Dover, 1972. — ISBN 0-486-62349-1.

Дополнительно по теме