Анализ данных для выявления мошенничества

Анализ данных для выявления мошенничества — область, посвящённая применению методов анализа данных для обнаружения мошеннических действий. Борьба с мошенничеством представляет серьёзную проблему для государственных органов и коммерческих организаций, требующую специализированных аналитических подходов. К числу таких методов относятся обнаружение знаний в базах данных, интеллектуальный анализ данных, машинное обучение и статистика. Эти подходы дают эффективные решения в различных сферах электронного мошенничества. Аналогичные аналитические методы используются и в Российской Федерации в банковской сфере, налоговом администрировании, мониторинге госзакупок и социальных выплат для выявления финансового и иного мошенничества, в рамках действующего законодательства о противодействии легализации доходов, коррупции и защите бюджетных средств[1].

Основная причина применения аналитических методов заключается в необходимости противодействия мошенничеству, поскольку многие системы внутреннего контроля имеют существенные уязвимости. Например, традиционные методы, используемые правоохранительными органами для выявления мошенничества в компаниях, зачастую сводятся к обработке косвенных доказательств или жалоб от информаторов. В результате множество случаев мошенничества остаются невыявленными и не приводят к расследованиям. С целью эффективного мониторинга и выявления мошеннических действий организации используют специализированные приёмы анализа данных: интеллектуальный анализ, сопоставление данных, функцию «похожести по звучанию», регрессионный и кластерный анализ, а также анализ разрывов. Методы анализа для выявления мошенничества подразделяются на два основных класса: статистические и методы искусственного интеллекта.

Статистические методы

undefined

Примеры статистических методов анализа данных:

  • Использование методов предварительной обработки данных для выявления, проверки, исправления ошибок и заполнения пропущенных или некорректных данных.
  • Расчёт различных статистических параметров, таких как средние значения, квартили, показатели эффективности, вероятностные распределения и др. Например, могут вычисляться средняя продолжительность звонка, среднее количество звонков за месяц, средние задержки по оплате счетов.
  • Формирование моделей и вероятностных распределений для различных бизнес-процессов по множеству показателей.
  • Построение профилей пользователей.
  • Анализ временных рядов данных, зависящих от времени.
  • Кластеризация и статистическая классификация для поиска закономерностей и связей между группами данных.
  • Сопоставление данных — сравнение двух наборов собранных данных с помощью алгоритмов или программных инструкций с целью удаления дубликатов и выявления связей между записями для нужд маркетинга, безопасности и прочего.
  • Функция «похожести по звучанию» используется для поиска совпадающих по звучанию значений, что позволяет выявлять возможные дубликаты и разные написания вручную введённых данных. Эта функция преобразует сравниваемые строки в четырёхсимвольные коды по системе American Soundex, основанные на первой букве и следующих трёх согласных.
  • Регрессионный анализ позволяет изучать взаимосвязи между двумя и более переменными, строить зависимости между независимыми и зависимыми переменными и делать прогнозы.
  • Анализ разрывов применяется для определения, выполняются ли бизнес-требования, и если нет — какие действия необходимы для их достижения.
  • Алгоритмы сопоставления шаблонов используются для обнаружения аномалий в поведении транзакций или пользователей по сравнению с известными моделями и профилями, а также для уменьшения количества ложных срабатываний, оценки рисков и прогнозирования будущих событий.

Некоторые судебные аудиторы специализируются на судебной аналитике, то есть сборе и анализе электронных данных с целью воссоздания, выявления или аргументации наличия финансового мошенничества. Основные этапы судебной аналитики включают сбор данных, подготовку данных, анализ и отчётность. Например, судебная аналитика может применяться для проверки операций по корпоративной платёжной карте с целью выявления личного использования средств.

Искусственный интеллект

Ключевые методы искусственного интеллекта, применяемые для обнаружения мошенничества, включают:

  • Интеллектуальный анализ данных для классификации, кластеризации и сегментирования информации, выявления ассоциаций и правил, указывающих на интересные (в том числе мошеннические) закономерности.
  • Экспертные системы, реализующие правила выявления мошенничества на основе экспертных знаний.
  • Распознавание образов для автоматического или полуавтоматического обнаружения классов и шаблонов подозрительного поведения.
  • Машинное обучение для автоматического выявления характеристик мошеннических действий.
  • Искусственные нейронные сети для независимого построения моделей классификации, кластеризации, обобщения и прогнозирования, сравниваемых с результатами внутренних аудитов и официальных финансовых отчётов, таких как 10-Q.

Применяются также другие методы, например, анализ связей, байесовские сети, теория принятия решений и сопоставление последовательностей. Актуален и новый подход, называемый «метод системных свойств», применяемый при наличии ранговых данных[2].

Статистический анализ исследовательских данных является наиболее комплексным методом определения наличия фактов подделки данных. Согласно определению Управления по целостности исследований, мошенничество с данными включает фабрикацию, фальсификацию и плагиат.

Машинное обучение и интеллектуальный анализ данных

undefined

Ранние методы анализа данных были ориентированы на извлечение количественных и статистических характеристик. Это способствовало лучшему пониманию процессов, лежащих в основе данных. Однако традиционные методы в основном опирались на квалификацию аналитика и интерпретацию результатов.

Для получения более продвинутых выводов система анализа данных должна обладать значительным объёмом фоновых знаний и возможностью делать выводы на основе этих знаний и поступающих данных. Для этого исследователи обратились к концепциям машинного обучения, где задача формулируется как превращение исходных знаний и примеров во вновь полученные знания.

Когда при интеллектуальном анализе данных удаётся выявить значимые закономерности, данные превращаются в информацию. Если эта информация одновременно нова, обоснована и полезна, её можно рассматривать как знание. Таким образом, говорят об открытии знаний в больших объёмах информации.

Решения на основе машинного обучения и искусственного интеллекта подразделяются на два класса: обучение с учителем и без учителя. Оба метода направлены на выявление необычного поведения аккаунтов, клиентов, поставщиков и прочих объектов с целью формирования индикаторов подозрительных действий, правил или визуальных аномалий.

Результаты таких методов дают лишь вероятность мошенничества. Ни один отдельный статистический анализ не может гарантировать, что определённый объект связан с мошенничеством, однако позволяет с высокой точностью выявлять подозрительные случаи. Поэтому эффективное сотрудничество между моделями машинного обучения и аналитиками-людьми играет ключевую роль в успешных системах обнаружения мошенничества.

Обучение с учителем

undefined

В методах обучения с учителем случайная подвыборка записей вручную маркируется как мошенническая или добросовестная (при необходимости количество мошеннических примеров увеличивается за счёт предварительной выборки). Эти помеченные данные используются для обучения соответствующих алгоритмов. После построения модели она способна классифицировать новые записи на мошеннические и немошеннические.

Широко применялись такие методы, как супервизируемые нейронные сети, нечёткие нейронные сети и их комбинации с экспертными правилами для выявления мошенничества в сетях мобильной связи и финансовых отчётах.

Байесовские нейронные сети реализованы для выявления мошенничества с кредитными картами, в телекоммуникациях, автостраховании и медицинских страховых выплатах[3].

Гибридные системы на основе экспертных и статистических знаний используют серию методов интеллектуального анализа с целью обнаружения мошенничества по подмене абонентов в мобильных сетях. Например, используются алгоритмы обучения правилам для выделения индикаторов мошенничества из больших баз данных клиентских транзакций.

Кахилл и соавторы (2000) разработали метод «подписи мошенничества» для обнаружения подозрительных телефонных звонков, сравнивая вероятность события по индивидуальной и мошеннической подписи, обновляемых по мере поступления информации.

Другой подход — анализ связей, когда известные мошенники соотносятся с другими субъектами с помощью методов связывания записей и социального сетевого анализа.

Однако данный путь позволяет выявлять только те случаи мошенничества, которые уже встречались ранее и были классифицированы человеком. Для обнаружения новых схем требуется применение методов обучения без учителя.

Обучение без учителя

В противоположность, методы без учителя не используют заранее размеченные данные.

Болтон и Хэнд применили «анализ группы равных» и «анализ переломных точек» — методы для анализа расходного поведения по кредитным картам. Анализ группы равных выявляет отдельные объекты, чьё поведение начинает существенно отличаться от привычной для их группы нормы. Анализ переломных точек отслеживает моменты резкой аномалии на уровне счёта. Оба метода используются для выявления мошенничества в расходах по кредитным картам.

Объединение методов с учителем и без используется для обнаружения мошенничества с кредитными картами, например, у Карсилло и соавторов (2019)[4].

Открытые наборы данных

Серьёзным препятствием для валидации методов обнаружения мошенничества является ограниченное количество общедоступных наборов данных[5]. Одним из немногих исключений является датасет по выявлению мошенничества с кредитными картами[6], выложенный группой по машинному обучению ULB.

В России данные для fraud detection, как правило, закрыты и доступны в виде агрегированных отчётов, что усложняет независимую валидацию методов, но это общая проблема многих стран.

Примечания

  1. Данилова Е.П., Портняга Е.Г. Финансовое мошенничество в современном мире. elib.utmn.ru. Дата обращения: 21 мая 2026.
  2. Vani, G. K. (февраль 2018). “How to detect data collection fraud using System properties approach”. Multilogic in Science. VII (SPECIAL ISSUE ICAAASTSD-2018). ISSN 2277-7601. Дата обращения 2019-02-02. Проверьте дату в |date= (справка на английском)
  3. Bhowmik, Rekha Bhowmik 35 методов интеллектуального анализа данных для обнаружения мошенничества. Journal of Digital Forensics, Security and Law. University of Texas at Dallas. Дата обращения: 28 сентября 2017. Архивировано 29 ноября 2017 года.
  4. Carcillo, Fabrizio; Le Borgne, Yann-Aël; Caelen, Olivier; Kessaci, Yacine; Oblé, Frédéric; Bontempi, Gianluca (16 мая 2019). “Combining unsupervised and supervised learning in credit card fraud detection”. Information Sciences [англ.]. 557: 317—331. DOI:10.1016/j.ins.2019.05.042. HDL:2013/ULB-DIPOT:oai:dipot.ulb.ac.be:2013/289125. ISSN 0020-0255. S2CID 181839660.
  5. Le Borgne, Yann-Aël; Bontempi, Gianluca Machine Learning for Credit Card Fraud Detection — Практическое руководство (2021). Дата обращения: 26 апреля 2021.
  6. Credit Card Fraud Detection (англ.). kaggle.com.

Литература

  • Bolton, R., Hand, D. (2002). Statistical Fraud Detection: A Review (With Discussion). Statistical Science, 17(3): 235—255.
  • Bolton, R., Hand, D. (2001). Unsupervised Profiling Methods for Fraud Detection. Credit Scoring and Credit Control VII.
  • Palshikar, G.K. The Hidden Truth — Frauds and Their Control: A Critical Application for Business Intelligence. Intelligent Enterprise, vol. 5, no. 9, 28 мая 2002, с. 46-51.
  • Michalski, R.S., Bratko, I., Kubat, M. (1998). Machine Learning and Data Mining — Methods and Applications. John Wiley & Sons Ltd.
  • Phua, C.; Lee, V.; Smith-Miles, K.; Gayler, R. (2005). A Comprehensive Survey of Data Mining-based Fraud Detection Research. arXiv:1009.6119
  • Green, B.; Choi, J. (1997). Assessing the Risk of Management Fraud through Neural Network Technology. Auditing 16(1): 14-28.
  • Tax, N.; de Vries, K.J.; de Jong, M.; Dosoula, N.; van den Akker, B.; Smith, J.; Thuong, O.; Bernardi, L. Machine Learning for Fraud Detection in E-Commerce: A Research Agenda. Proceedings of the KDD International Workshop on Deployable Machine Learning for Security Defense (ML hat). Springer, Cham, 2021.
  • Estevez, P.; Held, C.; Perez, C. (2006). Subscription fraud prevention in telecommunications using fuzzy rules and neural networks. Expert Systems with Applications 31, 337—344.
  • Fawcett, T. (1997). AI Approaches to Fraud Detection and Risk Management: Papers from the 1997 AAAI Workshop. Technical Report WS-97-07. AAAI Press.
  • Cortes, C.; Pregibon, D. (2001). Signature-Based Methods for Data Streams. Data Mining and Knowledge Discovery 5: 167—182.
  • Dal Pozzolo, A.; Caelen, O.; Le Borgne, Y.; Waterschoot, S.; Bontempi, G. (2014). Learned lessons in credit card fraud detection from a practitioner perspective. Expert systems with applications 41: 10 4915-4928.
  • Bolton, R., Hand, D. (2002). Statistical fraud detection: A review. Statistical Science 17 (3), с. 235—255
  • Al-Khatib, Adnan M. (2012). Electronic Payment Fraud Detection Techniques. World of Computer Science and Information Technology Journal, 2.