Предотвращение утечек информации
Предотвращение утечек информации (англ. Data Loss Prevention, DLP) — программное обеспечение, предназначенное для обнаружения потенциальных случаев нарушения безопасности данных (утечек информации, несанкционированной передачи данных) и предотвращения подобных инцидентов за счёт мониторинга[1], обнаружения и блокировки передачи или манипуляций с чувствительной информацией как в процессе использования (на конечных устройствах), так и при передаче по сети (сетевой трафик), а также при хранении (хранилище данных)[2].
Аналитическое агентство Gartner определяет предотвращение утечек данных как технический контроль, предназначенный для предотвращения потери данных с целью соблюдения нормативных требований, предотвращения непреднамеренного раскрытия информации, минимизации инсайдерских рисков и ограничения избыточного доступа к конфиденциальным данным. Согласно актуальным требованиям Gartner, обязательные функции современных DLP-решений включают обнаружение конфиденциальных данных по нескольким каналам, среди которых в обязательном порядке выделяются облачные среды и генеративный искусственный интеллект (GenAI)[3].
Термины «утрата данных» и «утечка данных» близки по смыслу и нередко используются как синонимы[4]. Случай утраты данных становится случаем утечки данных, если носитель с чувствительной информацией попадает к неавторизованному лицу. Однако утечка возможна и без фактической потери данных источником. Другие обозначения предотвращения утечки информации: обнаружение и предотвращение протечки информации (англ. Information Leak Detection and Prevention, ILDP), предотвращение утечки информации (англ. Information Leak Prevention, ILP), мониторинг и фильтрация содержимого (англ. Content Monitoring and Filtering, CMF), защита и контроль информации (англ. Information Protection and Control, IPC), а также системы предотвращения эксфильтрации данных (англ. Extrusion Prevention System, EPS), в отличие от систем предотвращения вторжений.
Современной смежной категорией решений является управление состоянием безопасности данных (англ. Data Security Posture Management, DSPM). В отличие от классического DLP, который реактивно контролирует перемещение данных в реальном времени и блокирует их на точках выхода, DSPM работает проактивно: обнаруживает и классифицирует данные в состоянии покоя (в облаке, SaaS, гибридных и AI-средах), а также оценивает риски избыточного доступа и неверных конфигураций до возникновения инцидента[5].[6]
На развитие систем защиты данных также влияет ужесточение законодательства и рыночные факторы. Так, прогнозируемый рост российского рынка DLP в 2026 году составляет 40—50 %[7], что в том числе связано с введением оборотных штрафов за утечки данных в размере от 1 до 3 % от годовой выручки (от 25 до 500 млн рублей)[8].
Категории
Технические средства, применяемые для предотвращения утечек информации, можно разделить на несколько категорий: стандартные меры безопасности, интеллектуальные/продвинутые меры, средства управления доступом и шифрованием, а также специализированные DLP-системы; хотя в настоящее время к DLP обычно относят лишь последнюю категорию[9]. Распространённые методы DLP для обнаружения вредоносных или нежелательных действий и автоматической реакции основаны на автоматическом определении и реагировании. Большинство DLP-систем опираются на заданные правила для идентификации и категоризации чувствительной информации, что помогает администраторам сосредоточиться на уязвимых точках. Впоследствии для определённых областей могут устанавливаться дополнительные меры защиты.
Стандартные меры
Стандартные меры безопасности, такие как межсетевые экраны (фаерволы), системы обнаружения вторжений (IDS) и антивирусное программное обеспечение, являются распространёнными продуктами, защищающими компьютеры от внешних и внутренних угроз[10]. Например, фаервол предотвращает доступ посторонних к внутренней сети, а система обнаружения вторжений замечает попытки взлома извне. Атаки изнутри могут быть предотвращены с помощью антивирусных программ, выявляющих троянские программы для передачи конфиденциальных данных, а также за счёт использования тонких клиентов, работающих в архитектуре клиент-сервер, где личные или чувствительные данные не хранятся на клиентском устройстве.
Продвинутые меры
Продвинутые меры используют машинное обучение и алгоритмы с учётом временных закономерностей для выявления аномального доступа к данным (например, к базам данных или поисковым системам), необычных коммуникаций по электронной почте, технологию ловушек для обнаружения сотрудников с вредоносными намерениями, проверки активности пользователя (например, распознавание динамики нажатия клавиш) и мониторинг действий пользователя для выявления аномалий. Для непрерывной верификации пользователей применяются методы поведенческой биометрии, включающие анализ клавиатурной динамики, движений мыши и сенсорных жестов[11]. С целью выявления инсайдеров используются технологии обмана (Deception Technology) и динамические ловушки (Honeytokens), при этом для создания правдоподобных приманок применяется генеративный искусственный интеллект[12][13].
Специализированные DLP-системы
Специализированные системы обнаруживают и предотвращают несанкционированные попытки копирования или отправки чувствительных данных, как преднамеренные, так и непреднамеренные, в основном со стороны сотрудников, имеющих доступ к конфиденциальной информации. Для классификации данных как чувствительных используются такие механизмы, как точное сопоставление данных, отпечаток структурированных данных, статистические методы, сопоставление по правилам и регулярные выражения, специализированные словари, концептуальные определения, ключевые слова и контекстные признаки, такие как источник данных[14]. Для существенного снижения количества ложноположительных срабатываний в DLP-системы интегрируются ИИ-агенты. В частности, применяются технологии агентного DLP (Agentic DLP) на базе LLM-классификации и семантического ИИ (Semantic AI), который анализирует контекст и смысл данных[15].
Типы
Сетевая DLP
Сетевая (данные в движении) технология обычно размещается на выходных точках сети ближе к периметру организации. Она анализирует сетевой трафик для поиска чувствительных данных, передаваемых с нарушением политик информационной безопасности. В работе могут использоваться несколько контрольных точек безопасности, информация с которых анализируется центральным сервером управления[4]. Примеры используемых технологий: межсетевой экран нового поколения (NGFW), система обнаружения вторжений (IDS), применяемые для реализации функций DLP в сети[16]. Однако возможности сетевой DLP могут быть сведены на нет угрозами со стороны высококвалифицированных злоумышленников с использованием методов маскировки данных, таких как шифрование или сжатие[17]. Трансформация сетевого периметра и интеграция DLP в архитектуры SASE и SSE характеризуются переносом контрольных точек в облачные шлюзы. Инспекция трафика выполняется в реальном времени через облачные шлюзы безопасности (SWG) и брокеры безопасного доступа к облаку (CASB), обеспечивая контроль данных независимо от физических границ сети[18][19][20]. В условиях повсеместного внедрения протоколов TLS 1.3 и технологии ECH классическое дешифрование трафика теряет актуальность. Для анализа зашифрованных соединений применяются технологии Encrypted Traffic Analytics (ETA), использующие машинное обучение и поведенческое профилирование для выявления аномалий без расшифровки полезной нагрузки[21][22]. Для предотвращения утечек и обнаружения скрытых каналов передачи данных активно применяется анализ сетевого трафика (NTA). Системы NTA позволяют выявлять аномальные паттерны, указывающие на вывод информации, включая использование таких методов маскировки, как DNS- и ICMP-туннелирование[23][24].
DLP на конечных устройствах
Системы конечных точек (данные в использовании) размещаются на локальных рабочих станциях или серверах конечных пользователей. Подобно сетевым DLP, такие системы позволяют контролировать как внутренние, так и внешние коммуникации, а значит — управлять перемещением информации между группами или типами пользователей (например, «китайская стена»). Они способны контролировать электронную почту и мгновенные сообщения до того, как эти данные попадут в корпоративное хранилище, таким образом, заблокированное сообщение (то есть фактически не отправленное и не подлежащее хранению) не станет предметом поиска при юридических разбирательствах. Преимущество систем DLP конечных устройств — возможность контролировать доступ к физическим носителям (например, мобильным устройствам с поддержкой хранения данных) и, в некоторых случаях, получать доступ к информации до её шифрования. Они также способны определять контекст (источник или автора данных). Некоторые решения позволяют блокировать попытки передачи конфиденциальных данных на уровне приложений с немедленной обратной связью пользователю. Однако такие системы требуют установки на каждое рабочее место в сети (обычно через агент DLP), не работают с мобильными устройствами (например, сотовыми телефонами и КПК) и не эффективны на тех устройствах, где установка невозможна (например, рабочая станция в интернет-кафе)[25]. Современные системы также обеспечивают гранулярный контроль интерфейсов. Для USB-накопителей возможны разрешение, блокировка или режим «только чтение» с настройкой политик по типу и классу устройства, серийному номеру, производителю, статусу шифрования и направлению передачи. Для интерфейса Bluetooth поддерживается разрешение или запрет передачи файлов с контролем направления[26]. Для защиты визуального канала от утечек применяются методы блокировки скриншотов на уровне операционной системы (например, исключение окна из захвата через диспетчер окон рабочего стола) и наложение экранных водяных знаков. Водяные знаки могут быть статическими, динамическими или скрытыми, выступая инструментом атрибуции источника при расследованиях[27].
DLP в облаке
В облачной среде хранится множество критически важных данных по мере перехода организаций к облачным технологиям для ускорения совместной работы виртуальных команд. Данные в облаке также нуждаются в защите от кибератак, случайных утечек и внутренних угроз. DLP для облака обеспечивает мониторинг и аудит, а также управление доступом и контролем использования данных на основе политик. Это повышает прозрачность для всех данных, хранящихся в облаке.
Согласно модели разделения ответственности (Shared Responsibility Model), защита данных и предотвращение их утечек всегда остаются в зоне ответственности клиента, независимо от типа используемого облачного сервиса[28]. Для предотвращения утечек информации в облачных SaaS-приложениях брокеры безопасного доступа в облако (CASB) используют два основных метода интеграции: API-ориентированный и прокси-ориентированный (Forward и Reverse Proxy), которые на практике часто комбинируются[29]. В средах IaaS и PaaS применяется управление состоянием безопасности данных (DSPM), позволяющее обнаруживать «теневые данные» — неконтролируемые копии чувствительной информации[30]. В мультиоблачных инфраструктурах используются решения Cloud-Native DLP, которые интегрируются напрямую через API и обеспечивают применение бесшовных политик безопасности с помощью централизованных консолей управления[31][32].
Идентификация данных
DLP включает методы идентификации конфиденциальной или чувствительной информации. Это не то же самое, что обнаружение данных; идентификация подразумевает определение критериев поиска с помощью DLP-технологий.
Данные классифицируются на структурированные и неструктурированные. Структурированные располагаются в фиксированных полях (например, таблица), неструктурированные — это свободный текст или медиафайлы (текстовые документы, PDF, видео)[33]. По оценкам, доля неструктурированных данных составляет 80—90 %, а структурированных — 10—20 %[34][35].
Современные методы анализа данных в системах предотвращения утечек информации (DLP) классифицируются на:[36]
- детерминированные методы (точное сопоставление данных, цифровые отпечатки документов, регулярные выражения);
- контентные методы (оптическое распознавание символов, ML-классификаторы);
- контекстные методы (анализ атрибутов среды);
- поведенческие методы (аналитика поведения пользователей и сущностей).
Защита от утрат данных (DLP)
Случается, что распространитель данных случайно или намеренно передаёт конфиденциальную информацию одной или нескольким сторонним организациям или использует её самостоятельно на законных основаниях. Позже некоторая часть этих данных может оказаться в несанкционированном месте (например, в интернете или на чужом устройстве). В таком случае распространителю необходимо установить источник утечки.
Технические средства контроля предотвращения утечек информации (DLP) классифицируются в зависимости от состояния защищаемых данных[37][38]:
- Данные в состоянии покоя (Data at rest) — контролируются средствами класса Discovery (Storage DLP), которые сканируют файловые серверы, базы данных и облачные хранилища для поиска и классификации конфиденциальных данных[37].[38]
- Данные в движении (Data in motion) — контролируются средствами Network DLP, осуществляющими мониторинг и инспекцию исходящего сетевого трафика в реальном времени[37].[38]
- Данные в использовании (Data in use) — контролируются средствами Endpoint DLP, которые отслеживают действия пользователей на конечных точках (ПК, ноутбуки, серверы)[37].[38]
Данные в покое
«Данные в покое» — это информация, не находящаяся в движении, то есть хранящаяся в базе данных или на общем накопителе. В бизнесе и государственных организациях такие данные требуют повышенного внимания: чем дольше они не используются, тем выше риск несанкционированного доступа. Для их защиты используются управление доступом, шифрование и политика хранения данных[4]. Для обработки неструктурированных массивов данных современные DLP-системы применяют методы автоматической классификации и маркирования. Среди них — AI-классификация на базе обработки естественного языка (NLP) и машинного обучения, которая сканирует информацию и автоматически присваивает метки чувствительности, а также оптическое распознавание символов (OCR) с использованием искусственного интеллекта для выявления конфиденциальной информации в отсканированных документах и на изображениях[39].
Данные в использовании
«Данные в использовании» — это информация, с которой пользователь работает в данный момент. DLP-системы, защищающие такие данные, осуществляют мониторинг и реагируют на несанкционированные действия[4]. Это могут быть, например, попытки сделать снимок экрана, копирование/вставка, печать или отправка по факсу чувствительных данных. Передача может быть как преднамеренной, так и случайной. При взаимодействии с интерфейсами генеративного искусственного интеллекта (GenAI) применяются специализированные механизмы контроля буфера обмена, позволяющие выборочно блокировать вставку чувствительных данных. Такие решения могут работать как через браузерные плагины, так и на уровне операционной системы, предотвращая утечку информации в веб-версии и десктопные клиенты ИИ-инструментов[40].[41] Для защиты от несанкционированных снимков экрана при работе с ИИ-инструментами используются методы технической блокировки захвата на уровне ОС (включая динамическое скрытие контента), а также наложение статических, динамических и скрытых водяных знаков[42][43].
Данные в движении
«Данные в движении» — информация, передаваемая по сети к получателю. Сети могут быть как внутренние, так и внешние. DLP-системы, защищающие данные в движении, контролируют передачу чувствительной информации по различным каналам связи[4]. Механизмы контроля передачи чувствительных данных применяются и в популярных инструментах совместной работы. В частности, в Microsoft Teams и Slack контролируется загрузка файлов и осуществляется мониторинг чатов с классифицированным содержимым, а в Zoom — загрузка и скачивание файлов, а также демонстрация экрана.
Защита в средах генеративного ИИ
Системы предотвращения утечек данных (AI DLP) предлагают специализированные механизмы для контроля взаимодействия пользователей с генеративным искусственным интеллектом и чат-ботами (такими как ChatGPT и Claude). Контроль промптов включает перехват текстовых вводов, загружаемых файлов и данных из буфера обмена в реальном времени с помощью браузерных расширений, агентов на конечных точках или специализированных прокси-шлюзов. Содержимое запросов инспектируется с использованием машинного обучения, больших языковых моделей и распознавания именованных сущностей. При обнаружении чувствительных данных система может заблокировать запрос, выдать предупреждение или применить автоматическое маскирование, заменяя конфиденциальную информацию на безопасные токены, что позволяет отправить очищенный промпт в нейросеть. Также применяется инспекция ответов ИИ для предотвращения раскрытия внутренних данных самой моделью[44][45][46]. Особое внимание уделяется детекции исходного кода, который разработчики могут копировать в чат-боты для отладки. DLP-системы способны выявлять фрагменты проприетарного кода с внутренними идентификаторами в неструктурированном тексте, а также находить его на отправляемых изображениях с помощью технологий оптического распознавания символов (OCR). При обнаружении кода система предотвращает его несанкционированную передачу, полностью блокируя загрузку или автоматически вырезая фрагменты из контекста запроса[44][47]. Использование несанкционированных ИИ-инструментов сотрудниками формирует концепцию «теневого ИИ» (Shadow AI). Основные риски этого явления включают непреднамеренную утечку исходного кода, коммерческой тайны и персональных данных, а также потерю контроля над информацией, которая может сохраняться на сторонних серверах и использоваться для обучения внешних моделей. Это ведёт к нарушению нормативных требований (таких как GDPR или HIPAA) и расширению поверхности атак через уязвимые браузерные расширения и интеграции[48][49]. Для нейтрализации угроз теневого ИИ применяется непрерывное обнаружение (Shadow AI Discovery) с использованием сетевого мониторинга и аудита конечных точек для выявления всех используемых ИИ-инструментов. Защита обеспечивается через контекстно-ориентированный DLP-контроль в браузере, анализирующий вводимый текст и активность буфера обмена в реальном времени. Системы адаптивно применяют политики безопасности, классифицируют ИИ-инструменты по уровням доступа и предлагают сотрудникам безопасные корпоративные альтернативы, данные из которых не передаются в открытый интернет[48][50].
Нормативные требования
Согласно требованиям ФСТЭК России (Приказ № 117), для ИТ-инфраструктуры и систем защиты информации установлены строгие сроки реагирования и устранения уязвимостей. Устранение критических уязвимостей должно осуществляться в срок до 24 часов, а уязвимостей с высоким уровнем риска — до 7 дней[51].[52]