Выявление аномалий

ИИ-обзор статьи
Выявление аномалий — это область анализа данных, направленная на идентификацию редких объектов или событий, которые существенно отличаются от большинства наблюдений и не соответствуют представлению о нормальном поведении.
Три группы определений аномалий
Определения аномалий делятся на неоднозначные, с эмпирическими порогами и формальные.
Три класса методов выявления аномалий
Методы делятся на контролируемые (требуют размеченных данных), полуконтролируемые (используют только нормальную разметку) и неконтролируемые (не требуют разметки, применяются чаще всего).
Основные категории методов
Безпараметрические методы (гистограммы, ядерные), параметрические (Z-оценка, Тьюки, Граббс), плотностные (kNN, LOF, Isolation Forest), нейросетевые (автоэнкодеры, CNN, SRU) и foundation-модели. Выбор метода зависит от типа данных и задачи.
От ручного мониторинга к адаптивным системам
Обнаружение вторжений эволюционировало от ручного отслеживания системными администраторами до анализа журналов аудита постфактум. В 1990-е годы появились системы реального времени, а затем разработки сосредоточились на адаптивных решениях для крупных сетей.
Необходимость интерпретируемости
В рамках объяснимого ИИ требуется обоснование результатов. Метод SOD выделяет признаки нормальности и отклонения, а COP предоставляет контрфактическое объяснение через вектор ошибок.

Выявление аномалий (англ. anomaly detection) — это подход в анализе данных, заключающийся в идентификации редких объектов, событий или наблюдений, которые существенно отличаются от большинства данных и не соответствуют чётко определённому представлению о нормальном поведении[1]. Подобные примеры могут вызывать подозрение, что они были сгенерированы иным механизмом[2], или выглядеть несогласованными с остальной частью набора данных[3].

Описание

Выявление аномалий находит применение во многих областях, включая кибербезопасность, медицину, компьютерное зрение, статистику, нейронауки, правоохранительные органы и борьбу с финансовым мошенничеством, и это далеко не полный список. Изначально аномалии обнаруживали для их явного отбрасывания с целью улучшения статистического анализа, например, при вычислении среднего значения или стандартного отклонения. Их также исключали для повышения точности предсказательных моделей, таких как линейная регрессия, а в последнее время удаление аномалий улучшает работу алгоритмов машинного обучения. Тем не менее в ряде приложений именно сами аномалии представляют основной интерес и являются наиболее значимыми наблюдениями во всём наборе данных, требуя их идентификации и отделения от шума или нерелевантных выбросов.

Существует три основных класса методов выявления аномалий[1]. Контролируемые методы требуют наличия размеченного набора данных с классами «нормальные» и «аномальные» объекты и подразумевают обучение классификатора. Однако этот подход встречается редко из-за дефицита размеченных данных и несбалансированности классов. Полуконтролируемые методы предполагают наличие разметки только части данных, чаще всего только для «нормальных» примеров; на их основе строится модель нормального поведения, по которой вычисляется вероятность принадлежности новых объектов к нормальным. Неконтролируемые методы не требуют разметки данных и благодаря универсальности и практической применимости используются чаще всего.

Определения

В статистике и информатике предпринимались многочисленные попытки определить понятие аномалии. Наиболее распространённые из них можно разделить на три группы: неоднозначные формулировки, специфические определения с применением эмпирически заданных порогов и формальные.

Неоднозначные определения

  • Выброс — наблюдение, настолько сильно отличающееся от других, что возникает подозрение в иной природе его появления[2].
  • Аномалии — это экземпляры или группы данных, которые очень редко встречаются в наборе данных и чьи признаки существенно отличаются от большинства данных.
  • Выброс — наблюдение (или подмножество наблюдений), кажущееся несогласованным с остальной частью данных[3].
  • Аномалия — точка или группа точек, относительно удалённая от других в многомерном пространстве признаков.
  • Аномалии — это такие структуры в данных, которые не соответствуют устоявшемуся понятию нормального поведения[1].

Формализованные определения

  • Пусть T — наблюдения из одномерного нормального распределения, а O — отдельная точка из T. Тогда z-оценка для O превышает заранее выбранный порог тогда и только тогда, когда O является выбросом.

История

Обнаружение вторжений

Понятие обнаружения вторжений, являющееся ключевым компонентом выявления аномалий, прошло значительную эволюцию. Изначально это был ручной процесс: системные администраторы отслеживали необычную активность, например, вход в систему во время отпуска пользователя или неожиданную печать заданий. Такой подход был нерентабелен и вскоре был вытеснен анализом журналов аудита и системных логов на предмет возможного вредоносного поведения[4].

К концу 1970-х и началу 1980-х годов анализ подобных логов в основном осуществлялся постфактум для расследования инцидентов, поскольку огромный объём данных делал невозможным мониторинг в реальном времени. Развитие цифровых хранилищ позволило анализировать аудиторские логи онлайн с помощью специальных программ, однако из-за высокой ресурсоёмкости они чаще запускались вне пиковых нагрузок[4].

В 1990-е годы появились системы обнаружения вторжений в реальном времени, способные анализировать данные аудита по мере их поступления и оперативно реагировать на атаки, что стало поворотным моментом в переходе к проактивной защите[4].

В дальнейшем внимание исследователей переключилось на создание решений, эффективных для масштабных и разнородных сетей, адаптирующихся к постоянно меняющимся угрозам и динамической информационной инфраструктуре[4].

Применения

Выявление аномалий применяется в огромном числе и разнообразии сфер и является важной частью неконтролируемого машинного обучения. Среди приложений — кибербезопасность, обнаружение вторжений, борьба с мошенничеством, диагностика оборудования, мониторинг состояния систем, анализ событий в сенсорных сетях, выявление нарушений в экосистемах, обнаружение дефектов на изображениях с помощью компьютерного зрения, медицинская диагностика и поддержка правоохранительных органов[5].

Обнаружение вторжений

Идея выявления аномалий для систем обнаружения вторжений (IDS) впервые прозвучала в работе Дороти Деннинг в 1986 году[6]. Для IDS выявление аномалий обычно реализуется через пороги и статистические методы, а также с помощью технологий мягких вычислений и индуктивного обучения[7]. К 1999 году в числе анализируемых характеристик были профили пользователей, рабочих станций, сетей, удалённых хостов, групп пользователей и программ — как по частоте, так и по среднему, дисперсии, ковариациям и стандартному отклонению[8]. Противоположный подходу выявления аномалий в IDS — обнаружение злоупотреблений.

Борьба с мошенничеством в финтехе

Выявление аномалий имеет решающее значение для предотвращения мошенничества в финтех-отрасли[9][10].

Предобработка данных

Предобработка данных с целью удаления аномалий может стать важным этапом анализа, преследующим разные цели. Статистики, такие как среднее и стандартное отклонение, становятся точнее после их удаления, а визуализация — информативнее. В задачах с учителем исключение аномальных данных часто приводит к существенному росту точности моделей[11][12].

Видеонаблюдение

Выявление аномалий становится всё более важным для систем видеонаблюдения в целях повышения безопасности[13]. Современные методы на основе свёрточных нейронных сетей (CNN) и рекуррентных сетей с простыми рекуррентными узлами (SRU) успешно выявляют необычные поведения в видеоданных. Такие модели способны обрабатывать и анализировать большие видеопотоки в реальном времени, распознавая отклонения, которые могут свидетельствовать о потенциальных угрозах безопасности. Особое значение в этой области имеют масштабируемые фреймворки для работы с множеством потоков при ограниченных вычислительных ресурсах[14][15].

Инфраструктура ИТ

В управлении инфраструктурными ИТ-системами выявление аномалий существенно для обеспечения бесперебойной работы и надёжности сервисов[16]. Такими системами управлять сложно из-за большого количества взаимосвязанных компонентов и объёмов данных, поэтому используются методы агрегирования и интерпретации информации[17]. Внедрение библиотек по лучшим практикам (ITIL) позволяет отслеживать и управлять производительностью систем и пользовательским опытом[16]. Вовремя обнаруженные аномалии позволяют выявить и предотвратить возможные ухудшения работы или сбои, обеспечивая стабильную работу бизнеса[16].

Системы Интернета вещей (IoT)

В системах Интернета вещей выявление аномалий критически важно для безопасности и эффективности. Это позволяет обнаруживать неисправности и нарушения в сложных сетях устройств. Методы должны справляться с обработкой потоковых данных в реальном времени, разнообразием типов устройств и требованиями к масштабируемости. Так, Гарк и соавторы[18] предложили многоступенчатую архитектуру с применением пространственного и плотностного кластеризации и локально-чувствительного хэширования для повышения стойкости систем.

Нефтяная промышленность

В нефтяной промышленности выявление аномалий важно для мониторинга критически важных механизмов[19]. Мартí и соавторы применили оригинальный алгоритм сегментации для анализа данных датчиков с целью обнаружения аномалий в реальном времени[19]. Это позволяет оперативно выявлять и устранять отклонения, обеспечивая надёжность и безопасность нефтяных объектов[19].

Мониторинг трубопроводов нефти и газа

В нефтегазовой отрасли выявление аномалий важно не только для обслуживания и безопасности, но и для охраны окружающей среды[20]. Алджамиль и соавторы представили модель на основе машинного обучения для обнаружения малых утечек на трубопроводах, что зачастую не выявляется традиционными методами[20].

Методы

В литературе предложено множество методик выявления аномалий[1]. Эффективность методов зависит от характеристик набора данных: одни лучше выявляют локальные выбросы, другие — глобальные, а при сравнении на разных наборах систематических преимуществ нет[21][22]. Для большинства алгоритмов требуется задание малопонятных заранее параметров, критичных для результата. Ниже приведены некоторые популярные подходы:

Безпараметрические

Также называются частотными или основанными на счёте. Самый простой вариант — построение гистограммы по обучающим или известным нормальным данным: если тестовая точка не попадает ни в один из бинов, она считается аномалией; можно также присваивать «оценку аномальности» в зависимости от высоты бина[1]. Ключ к эффективности — правильно подобрать ширину бинов.

Более сложные методы используют ядерные функции для аппроксимации распределения нормальных данных, а объекты из областей с низкой плотностью считаются аномалиями[23].

Параметрические методы

  • Z-оценка,
  • Критерий диапазона Тьюки,
  • Тест Граббса

Плотностные методы

  • Методы основаны на локальной плотности (например, алгоритм k-ближайших соседей[24][25][26], локальный фактор выброса[27], леса изоляции[28][29] и др[30].)
  • Многомерные методы: SOD[31] (подпространства), COP[32] (корреляционные), методы на основе тензоров[33] для высокоразмерных данных[34]
  • Метод одномодового (one-class) SVM[35]

Нейросетевые методы

  • Репликаторные нейронные сети[36], автоэнкодеры, вариационные автоэнкодеры[37], нейросети LSTM[38]
  • Байесовские сети[36]
  • Скрытые Марковские модели[36]
  • Метод минимальной детерминанты ковариации[39]
  • Глубокое обучение
    • Свёрточные нейронные сети (CNN): Широко применяются для неконтролируемого выявления аномалий, особенно при анализе изображений и видео. Их способность к иерархическому извлечению пространственных признаков позволяет детектировать визуальные аномалии; например, CNN можно обучить на изображениях изделий для обнаружения дефектов в промышленности[40].
    • SRU (Simple Recurrent Units): Для временных рядов SRU, разновидность рекуррентных сетей, позволяют детектировать временные аномалии, выявляя отклонения в динамике В отличие от традиционных RNN, SRU быстрее и более удобны для параллелизации, что особенно ценно для оперативного обнаружения отклонений на финансовых рынках и в обслуживании оборудования.
    • Foundation-модели: С момента появления крупных Foundation-моделей их функции активно используются для сегментации и локализации аномалий, например, через совместное обучение текстовых и визуальных эмбеддингов (CLIP и аналоги)[41], а также с помощью генеративных моделей для выявления аномалий по ошибке реконструкции.

Кластерные методы

  • Кластеризация: выявление выбросов с помощью анализа кластеров[42][43]
  • Отклонения от ассоциативных правил
  • Методы на основе нечеткой логики

Ансамбли

  • Ансамблевые методы: объединение детекторов и фич-бэггинг[44][45], нормализация оценок[46][47], создание ансамблей разнородных моделей[48][49].

Другие методы

Метод HBOS (Histogram-based Outlier Score) применяет гистограммы признаков и предполагает их независимость для быстрой выдачи результата[50].

Выявление аномалий в динамических сетях

В динамических сетях, таких как финансовые системы, социальные сети и транспортная инфраструктура, детектирование аномалий осложняется непрерывным изменением структуры связей и состояний. В отличие от статических графов, здесь нужны адаптивные методы.

Виды аномалий в динамических сетях

  1. Аномалии сообществ
  2. Аномалии сжатия
  3. Аномалии разложения
  4. Аномалии по расстоянию
  5. Аномалии вероятностных моделей

Интерпретируемое выявление аномалий

Многие из перечисленных выше методов выдают только числовую оценку, обычно объясняемую низкой локальной плотностью данных. Однако в рамках объяснимого искусственного интеллекта всё больше требуют методов с чётким и подробным обоснованием результата. Например:

  • Метод Subspace Outlier Degree (SOD)[31] выделяет признаки, по которым пример нормален, и признаки, по которым он отклоняется.
  • Метод Correlation Outlier Probabilities (COP)[32] вычисляет вектор ошибок, показывающий направление смещения примера относительно нормы, что можно интерпретировать как контрфактическое объяснение.

Программное обеспечение

  • ELKI — открытая библиотека на Java для интеллектуального анализа данных, поддерживает разнообразные алгоритмы выявления аномалий и ускоряющие структуры.
  • PyOD — специализированная библиотека Python для выявления аномалий[51].
  • scikit-learn — открытая Python-библиотека, реализующая и алгоритмы неконтролируемого обнаружения аномалий.
  • Wolfram Mathematica содержит функционал неконтролируемого выявления аномалий для различных типов данных[52].

Примечания

  1. 1 2 3 4 5 Chandola, V.; Banerjee, A.; Kumar, V. (2009). “Anomaly detection: A survey”. ACM Computing Surveys. 41 (3): 1—58. DOI:10.1145/1541880.1541882. S2CID 207172599.
  2. 1 2 Hawkins, Douglas M. Identification of Outliers. — Springer, 1980. — ISBN 978-0-412-21900-9.
  3. 1 2 Barnett, Vic. Outliers in statistical data / Vic Barnett, Lewis Lewis. — Wiley, 1978. — ISBN 978-0-471-99599-9.
  4. 1 2 3 4 Kemmerer, R.A.; Vigna, G. (апрель 2002). “Intrusion detection: a brief history and overview”. Computer. 35 (4): supl27—supl30. DOI:10.1109/mc.2002.1012428. ISSN 0018-9162. Проверьте дату в |date= (справка на английском)
  5. Aggarwal, Charu. Outlier Analysis. — Springer Publishing Company, Incorporated, 2017. — ISBN 978-3-319-47577-6.
  6. Denning, D. E. (1987). “An Intrusion-Detection Model” (PDF). IEEE Transactions on Software Engineering. SE-13 (2): 222—232. DOI:10.1109/TSE.1987.232894. S2CID 10028835. Архивировано из оригинала (PDF) 22 июня 2015. Используется устаревший параметр |url-status= (справка)
  7. Teng, H. S. Adaptive real-time anomaly detection using inductively generated sequential patterns // Proceedings. 1990 IEEE Computer Society Symposium on Research in Security and Privacy / H. S. Teng, K. Chen, S. C. Lu. — 1990. — P. 278–284. — ISBN 978-0-8186-2060-7. — doi:10.1109/RISP.1990.63857.
  8. Jones, Anita K.; Sielken, Robert S. (2000). “Computer System Intrusion Detection: A Survey”. Computer Science Technical Report. Department of Computer Science, University of Virginia: 1—25.
  9. Stojanović, Branka; Božić, Josip; Hofer-Schmitz, Katharina; Nahrgang, Kai; Weber, Andreas; Badii, Atta; Sundaram, Maheshkumar; Jordan, Elliot; Runevic, Joel (январь 2021). “Follow the Trail: Machine Learning for Fraud Detection in Fintech Applications”. Sensors [англ.]. 21 (5): 1594. Bibcode:2021Senso..21.1594S. DOI:10.3390/s21051594. ISSN 1424-8220. PMC 7956727. PMID 33668773. Проверьте дату в |date= (справка на английском)
  10. Ahmed, Mohiuddin; Mahmood, Abdun Naser; Islam, Md. Rafiqul (февраль 2016). “A survey of anomaly detection techniques in financial domain”. Future Generation Computer Systems. 55: 278—288. DOI:10.1016/j.future.2015.01.001. ISSN 0167-739X. S2CID 204982937. Проверьте дату в |date= (справка на английском)
  11. Tomek, Ivan (1976). “An Experiment with the Edited Nearest-Neighbor Rule”. IEEE Transactions on Systems, Man, and Cybernetics. 6 (6): 448—452. DOI:10.1109/TSMC.1976.4309523.
  12. Smith, M. R. Improving classification accuracy by identifying and removing instances that should be misclassified // The 2011 International Joint Conference on Neural Networks / M. R. Smith, T. Martinez. — 2011. — P. 2690. — ISBN 978-1-4244-9635-8. — doi:10.1109/IJCNN.2011.6033571.
  13. Zhang, Tan. The Design and Implementation of a Wireless Video Surveillance System // Proceedings of the 21st Annual International Conference on Mobile Computing and Networking / Tan Zhang, Aakanksha Chowdhery, Paramvir (Victor) Bahl … [и др.]. — New York, NY, USA : Association for Computing Machinery, 7 сентября 2015. — P. 426–438. — ISBN 978-1-4503-3619-2. — doi:10.1145/2789168.2790123.
  14. Park, Chaewon. FastAno: Fast Anomaly Detection via Spatio-temporal Patch Transformation // 2022 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) / Chaewon Park, MyeongAh Cho, Minhyeok Lee … [и др.]. — IEEE, 2022. — P. 1908–1918. — ISBN 978-1-6654-0915-5. — doi:10.1109/WACV51458.2022.00197.
  15. Ristea, Nicolae-Cătălin. Self-Distilled Masked Auto-Encoders are Efficient Video Anomaly Detectors // 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) / Nicolae-Cătălin Ristea, Florinel-Alin Croitoru, Radu Tudor Ionescu … [и др.]. — IEEE, 16 июня 2024. — P. 15984–15995. — ISBN 979-8-3503-5300-6. — doi:10.1109/CVPR52733.2024.01513.
  16. 1 2 3 Gow, Richard; Rabhi, Fethi A.; Venugopal, Srikumar (2018). “Anomaly Detection in Complex Real World Application Systems”. IEEE Transactions on Network and Service Management [англ.]. 15 (1): 83—96. Bibcode:2018ITNSM..15...83G. DOI:10.1109/TNSM.2017.2771403. S2CID 3883483.
  17. Herrera, Manuel; Proselkov, Yaniv; Pérez-Hernández, Marco; Kumar Parlikad, Ajith (январь 2021). “Mining Graph-Fourier Transform Time Series for Anomaly Detection of Internet Traffic at Core and Metro Networks”. IEEE Access [англ.]. 9: 8997—9011. Bibcode:2021IEEEA...9.8997H. DOI:10.1109/ACCESS.2021.3050014. ISSN 2169-3536. Проверьте дату в |date= (справка на английском)
  18. Garg, Sahil; Kaur, Kuljeet; Batra, Shalini; Kaddoum, Georges; Kumar, Neeraj; Boukerche, Azzedine (1 марта 2020). “A multi-stage anomaly detection scheme for augmenting the security in IoT-enabled applications”. Future Generation Computer Systems. 104: 105—118. DOI:10.1016/j.future.2019.09.038. ISSN 0167-739X. S2CID 204077191.
  19. 1 2 3 Martí, Luis; Sanchez-Pi, Nayat; Molina, José Manuel; Garcia, Ana Cristina Bicharra (февраль 2015). “Anomaly Detection Based on Sensor Data in Petroleum Industry Applications”. Sensors [англ.]. 15 (2): 2774—2797. Bibcode:2015Senso..15.2774M. DOI:10.3390/s150202774. ISSN 1424-8220. PMC 4367333. PMID 25633599. Проверьте дату в |date= (справка на английском)
  20. 1 2 Aljameel, Sumayh S.; Alomari, Dorieh M.; Alismail, Shatha; Khawaher, Fatimah; Alkhudhair, Aljawharah A.; Aljubran, Fatimah; Alzannan, Razan M. (август 2022). “An Anomaly Detection Model for Oil and Gas Pipelines Using Machine Learning”. Computation [англ.]. 10 (8): 138. DOI:10.3390/computation10080138. ISSN 2079-3197. Проверьте дату в |date= (справка на английском)
  21. Campos, Guilherme O.; Zimek, Arthur; Sander, Jörg; Campello, Ricardo J. G. B.; Micenková, Barbora; Schubert, Erich; Assent, Ira; Houle, Michael E. (2016). “On the evaluation of unsupervised outlier detection: measures, datasets, and an empirical study”. Data Mining and Knowledge Discovery. 30 (4): 891. DOI:10.1007/s10618-015-0444-8. ISSN 1384-5810. S2CID 1952214.
  22. Anomaly detection benchmark data repository. Ludwig-Maximilians-Universität München. Дата обращения: 18 июня 2024. Архивировано 31 марта 2022 года.
  23. Chandola, Varun; Banerjee, Arindam; Kumar, Vipin (30 июля 2009). “Anomaly detection: A survey”. ACM Comput. Surv. 41 (3): 15:1–15:58. DOI:10.1145/1541880.1541882. ISSN 0360-0300.
  24. Knorr, E. M.; Ng, R. T.; Tucakov, V. (2000). “Distance-based outliers: Algorithms and applications”. The VLDB Journal, the International Journal on Very Large Data Bases. 8 (3—4): 237—253. DOI:10.1007/s007780050006. S2CID 11707259.
  25. Ramaswamy, S.; Rastogi, R.; Shim, K. (2000). Efficient algorithms for mining outliers from large data sets. Proceedings of the 2000 ACM SIGMOD international conference on Management of data. p. 427. DOI:10.1145/342009.335437. ISBN 1-58113-217-4.
  26. Angiulli, F.; Pizzuti, C. (2002). Fast Outlier Detection in High Dimensional Spaces. Principles of Data Mining and Knowledge Discovery. Lecture Notes in Computer Science. 2431. p. 15. DOI:10.1007/3-540-45681-3_2. ISBN 978-3-540-44037-6.
  27. Breunig, M. M.; Kriegel, H.-P.; Ng, R. T.; Sander, J. (2000). LOF: Identifying Density-based Local Outliers (PDF). Proceedings of the 2000 ACM SIGMOD International Conference on Management of Data. SIGMOD. pp. 93—104. DOI:10.1145/335191.335388. ISBN 1-58113-217-4.
  28. Liu, Fei Tony. Isolation Forest // 2008 Eighth IEEE International Conference on Data Mining : [англ.] / Fei Tony Liu, Kai Ming Ting, Zhi-Hua Zhou. — декабрь 2008. — P. 413–422. — ISBN 978-0-7695-3502-9. — doi:10.1109/ICDM.2008.17.
  29. Liu, Fei Tony; Ting, Kai Ming; Zhou, Zhi-Hua (март 2012). “Isolation-Based Anomaly Detection”. ACM Transactions on Knowledge Discovery from Data [англ.]. 6 (1): 1—39. DOI:10.1145/2133360.2133363. S2CID 207193045. Проверьте дату в |date= (справка на английском)
  30. Schubert, E.; Zimek, A.; Kriegel, H.-P. (2012). “Local outlier detection reconsidered: A generalized view on locality with applications to spatial, video, and network outlier detection”. Data Mining and Knowledge Discovery. 28: 190—237. DOI:10.1007/s10618-012-0300-z. S2CID 19036098.
  31. 1 2 Kriegel, H. P.; Kröger, P.; Schubert, E.; Zimek, A. (2009). Outlier Detection in Axis-Parallel Subspaces of High Dimensional Data. Advances in Knowledge Discovery and Data Mining. Lecture Notes in Computer Science. 5476. p. 831. DOI:10.1007/978-3-642-01307-2_86. ISBN 978-3-642-01306-5.
  32. 1 2 Kriegel, H. P.; Kroger, P.; Schubert, E.; Zimek, A. (2012). Outlier Detection in Arbitrarily Oriented Subspaces. 2012 IEEE 12th International Conference on Data Mining. p. 379. DOI:10.1109/ICDM.2012.21. ISBN 978-1-4673-4649-8.
  33. Fanaee-T, H.; Gama, J. (2016). “Tensor-based anomaly detection: An interdisciplinary survey”. Knowledge-Based Systems. 98: 130—147. DOI:10.1016/j.knosys.2016.01.027. S2CID 16368060.
  34. Zimek, A.; Schubert, E.; Kriegel, H.-P. (2012). “A survey on unsupervised outlier detection in high-dimensional numerical data”. Statistical Analysis and Data Mining. 5 (5): 363—387. DOI:10.1002/sam.11161. S2CID 6724536.
  35. Schölkopf, B.; Platt, J. C.; Shawe-Taylor, J.; Smola, A. J.; Williamson, R. C. (2001). “Estimating the Support of a High-Dimensional Distribution”. Neural Computation. 13 (7): 1443—71. DOI:10.1162/089976601750264965. PMID 11440593. S2CID 2110475.
  36. 1 2 3 Hawkins, Simon. Outlier Detection Using Replicator Neural Networks // Data Warehousing and Knowledge Discovery / Simon Hawkins, Hongxing He, Graham Williams … [и др.]. — 2002. — Vol. 2454. — P. 170–180. — ISBN 978-3-540-44123-6. — doi:10.1007/3-540-46145-0_17.
  37. An, J.; Cho, S. (2015). “Variational autoencoder based anomaly detection using reconstruction probability” (PDF). Special Lecture on IE. 2 (1): 1—18. SNUDM-TR-2015-03.
  38. Malhotra, Pankaj; Vig, Lovekesh; Shroff, Gautman; Agarwal, Puneet (22–24 апреля 2015). Long Short Term Memory Networks for Anomaly Detection in Time Series. ESANN 2015: 23rd European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning. pp. 89—94. ISBN 978-2-87587-015-5.
  39. Hubert, Mia; Debruyne, Michiel (2010). “Minimum covariance determinant”. WIREs Computational Statistics. 2 (1): 36—43. DOI:10.1002/wics.61. ISSN 1939-0068. S2CID 123086172.
  40. Alzubaidi, Laith; Zhang, Jinglan; Humaidi, Amjad J.; Al-Dujaili, Ayad; Duan, Ye; Al-Shamma, Omran; Santamaría, J.; Fadhel, Mohammed A.; Al-Amidie, Muthana; Farhan, Laith (31 марта 2021). “Review of deep learning: concepts, CNN architectures, challenges, applications, future directions”. Journal of Big Data. 8 (1): 53. DOI:10.1186/s40537-021-00444-8. ISSN 2196-1115. PMC 8010506. PMID 33816053.
  41. Jeong, Jongheon. WinCLIP: Zero-/Few-Shot Anomaly Classification and Segmentation // 2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) / Jongheon Jeong, Yang Zou, Taewan Kim … [и др.]. — IEEE, июнь 2023. — P. 19606–19616. — ISBN 979-8-3503-0129-8. — doi:10.1109/cvpr52729.2023.01878.
  42. He, Z.; Xu, X.; Deng, S. (2003). “Discovering cluster-based local outliers”. Pattern Recognition Letters. 24 (9—10): 1641—1650. Bibcode:2003PaReL..24.1641H. CiteSeerX 10.1.1.20.4242. DOI:10.1016/S0167-8655(03)00003-5.
  43. Campello, R. J. G. B.; Moulavi, D.; Zimek, A.; Sander, J. (2015). “Hierarchical Density Estimates for Data Clustering, Visualization, and Outlier Detection”. ACM Transactions on Knowledge Discovery from Data. 10 (1): 5:1–51. DOI:10.1145/2733381. S2CID 2887636.
  44. Lazarevic, A. Feature bagging for outlier detection // Proceedings of the eleventh ACM SIGKDD international conference on Knowledge discovery in data mining / A. Lazarevic, V. Kumar. — 2005. — P. 157–166. — ISBN 978-1-59593-135-1. — doi:10.1145/1081870.1081891.
  45. Nguyen, H. V.; Ang, H. H.; Gopalkrishnan, V. (2010). Mining Outliers with Ensemble of Heterogeneous Detectors on Random Subspaces. Database Systems for Advanced Applications. Lecture Notes in Computer Science. 5981. p. 368. DOI:10.1007/978-3-642-12026-8_29. ISBN 978-3-642-12025-1.
  46. Kriegel, H. P.; Kröger, P.; Schubert, E.; Zimek, A. (2011). Interpreting and Unifying Outlier Scores. Proceedings of the 2011 SIAM International Conference on Data Mining. pp. 13—24. CiteSeerX 10.1.1.232.2719. DOI:10.1137/1.9781611972818.2. ISBN 978-0-89871-992-5.
  47. Schubert, E.; Wojdanowski, R.; Zimek, A.; Kriegel, H. P. (2012). On Evaluation of Outlier Rankings and Outlier Scores. Proceedings of the 2012 SIAM International Conference on Data Mining. pp. 1047—1058. DOI:10.1137/1.9781611972825.90. ISBN 978-1-61197-232-0.
  48. Zimek, A.; Campello, R. J. G. B.; Sander, J. R. (2014). “Ensembles for unsupervised outlier detection”. ACM SIGKDD Explorations Newsletter. 15: 11—22. DOI:10.1145/2594473.2594476. S2CID 8065347.
  49. Zimek, A.; Campello, R. J. G. B.; Sander, J. R. (2014). Data perturbation for outlier detection ensembles. Proceedings of the 26th International Conference on Scientific and Statistical Database Management. p. 1. DOI:10.1145/2618243.2618257. ISBN 978-1-4503-2722-0.
  50. Goldstein, Markus; Dengel, Andreas Histogram-based Outlier Score (HBOS): A fast Unsupervised Anomaly Detection Algorithm. Personal page of Markus Goldstein (2012). Дата обращения: 18 июня 2024. Архивировано 25 декабря 2024 года.
  51. Zhao, Yue; Nasrullah, Zain; Li, Zheng (2019). “Pyod: A python toolbox for scalable outlier detection” (PDF). Journal of Machine Learning Research. 20. Дата обращения 2024-06-18.
  52. FindAnomalies. Mathematica documentation. Дата обращения: 18 июня 2024. Архивировано 18 мая 2025 года.