Деидентификация
Деидентификация (англ. de-identification) — процесс, направленный на предотвращение раскрытия личной идентичности человека. Например, данные, полученные в ходе исследований с участием людей, могут подвергаться деидентификации для сохранения конфиденциальности участников. Биологические данные деидентифицируются в целях соблюдения требований HIPAA, устанавливающих нормы охраны частной жизни пациентов[1].
К деидентификации также относят обработку метаданных или других идентификационных данных — этот процесс называют анонимизацией данных. Наиболее распространённые методы — удаление или маскирование персональных идентификаторов (например, имя), а также подавление или обобщение квази-идентификаторов, таких как дата рождения. Обратная операция, когда на основе деидентифицированных данных удаётся установить личность, называется реидентификацией данных. Успешные случаи реидентификации[2][3][4][5] ставят под сомнение эффективность деидентификации. Систематический обзор четырнадцати различных атак на реидентификацию выявил «высокий уровень успешной реидентификации, что обусловлено преимущественно небольшими исследованиями на данных, деидентифицированных с нарушением действующих стандартов»[6].
Деидентификация является одним из ключевых подходов к обеспечению защиты данных и широко применяется в коммуникациях, мультимедиа, биометрии, больших данных, облачных вычислениях, data mining, интернете, социальных сетях и системах аудио-видео наблюдения[7].
Примеры
При проектировании опросов
При проведении опросов, например, переписи, собирается информация о конкретной группе людей. Для стимулирования участия и защиты приватности респондентов исследователи стараются организовать процесс так, чтобы невозможно было сопоставить индивидуальные ответы участников с опубликованными данными[8].
Перед использованием информации
Когда интернет-магазин хочет узнать предпочтения и покупки своих пользователей, он получает данные клиентов из базы для дальнейшего анализа. Такие данные могут содержать персональные идентификаторы, полученные при регистрации учётной записи. Для соблюдения приватности пользователей сайт должен предварительно обработать записи с помощью методов деидентификации, чтобы не нарушать права клиентов.
Анонимизация
Анонимизация заключается в безвозвратном разрыве связи между набором данных и личностью участника, чтобы исключить возможность последующей реидентификации, даже для исследователей и организаторов работ[9][10]. Деидентификация также может включать сохранение идентифицирующей информации, которая при определённых условиях может быть восстановлена уполномоченной стороной[9][10][11]. В технологическом сообществе существует дискуссия, можно ли считать деидентифицированными данные, которые при необходимости могут быть восстановлены даже доверенной стороной[12].
Технологии
Наиболее распространённые методы деидентификации — маскирование персональных идентификаторов и обобщение квази-идентификаторов. Основным способом маскирования идентификаторов является псевдонимизация, а для обобщения квази-идентификаторов часто применяется k-анонимизация.
Псевдонимизация
Псевдонимизация проводится путем замены реальных имён и других идентификаторов на временные номера или коды. Она скрывает или удаляет персональные идентификаторы, затрудняя идентификацию личности. Этот способ позволяет отслеживать записи одного человека на протяжении времени, даже при их обновлении, однако не даёт полной защиты в ситуации, когда уникальная совокупность атрибутов всё же позволяет раскрыть личность[13].
k-анонимизация
K-анонимизация рассматривает части данных, косвенно позволяющие идентифицировать человека, как квази-идентификаторы (QI) и преобразует их так, чтобы хотя бы для k человек существовала одинаковая комбинация значений этих атрибутов[13]. Обычно значения QI стандартизируются, например, часть исходных данных заменяется диапазонами, а отдельные значения могут сохраняться без изменений. Это препятствует идентификации личности без разрушения структуры всей записи.
Применения
Исследования в сфере деидентификации в основном ведутся для защиты медицинской информации[14]. К примеру, отдельные библиотеки перенимают подходы из медицины для обеспечения приватности читателей[14].
В области больших данных деидентификация широко используется организациями и частными лицами[7]. С развитием социальных медиа, электронной коммерции и больших данных её применение часто требуется для защиты приватности пользователей при сборе информации компаниями и сторонними организациями.
В умных городах деидентификация может требоваться для защиты частной жизни жителей, работников и гостей. При отсутствии строгого регулирования даже деидентификация может быть неэффективна, так как сенсоры способны собирать информацию без согласия[15].
Деидентификация данных
PHI (Protected Health Information) могут присутствовать в разных форматах и требуют специальных средств и техник деидентификации:
Ограничения
В генетических исследованиях передача биологического материала часто сопровождается получением индивидуализированных данных, деидентификация которых крайне затруднительна[17].
Анонимизация генетических данных особенно сложна из‑за большого объёма генотипической информации[17], связи образцов с медицинской историей[18], и появления современных биоинформатических инструментов для data mining[18]. Показано, что по данным из коллективных генетических баз возможно идентифицировать доноров конкретных образцов[19].
Ряд учёных указывает, что обещать абсолютную анонимность участникам генетических исследований нецелесообразно, а необходимо разъяснять им ограничения системы кодированных идентификаторов[10].
Законодательство о деидентификации в США
В мае 2014 года Совет Президента США по науке и технологиям признал деидентификацию «относительно полезным дополнительным средством», но не рекомендовал как основу политики приватности, поскольку «её устойчивость к будущим методам реидентификации сомнительна»[20].
Правило приватности HIPAA допускает использование и передачу медицинских данных без согласия пациента через два механизма деидентификации — метод безопасной гавани и метод экспертного заключения. Метод безопасной гавани основан на удалении определённых идентификаторов (например, имени, телефона, адреса электронной почты и др.), а экспертный метод требует опыта и знания статистических и научных подходов к исключению возможности индивидуальной идентификации[21].
Безопасная гавань
Метод безопасной гавани предусматривает два принципа:
- Удаление или обобщение 18 элементов из данных.
- Отсутствие у оператора знаний, что оставшаяся информация (по отдельности или в совокупности) может быть использована для идентификации личности. Этот подход строг и не зависит от контекста использования данных. Например, все даты формулируются только как год, а почтовые индексы сокращаются до первых трёх цифр.
Экспертное заключение
Метод экспертной оценки опирается на анализ риска идентификации по общепринятым научным стандартам. Специалист с необходимым опытом формирует заключение о том, что вероятность идентификации человека — крайне мала. При этом требуются:
- Доказательство очень низкого риска идентификации по доступной информации.
- Документирование методов анализа и обоснования.
Исследования на данных умерших пациентов
Ключевой нормой по использованию электронных медицинских записей в США выступает правило приватности HIPAA, которое допускает использование данных умерших лиц для научных целей (раздел 164.512(i)(1)(iii)).
Примечания
Литература
- Garfinkel, Simson. De-identification of personal information: recommendation for transitioning the use of cryptographic algorithms and key lengths.
Ссылки
- Simson L. Garfinkel. NISTIR 8053, De-Identification of Personal Information (англ.). NIST (16 декабря 2015). Дата обращения: 3 января 2016.
- Серия обучающих семинаров по стандартам деидентификации в США
- Руководство по методам деидентификации персональных медицинских данных
- Ohm, Paul (2010). “Broken Promises of Privacy: Responding to the Surprising Failure of Anonymization” (PDF). UCLA Law Review [англ.]. 57: 1701—77.
- Padilla-López, José Ramón; Chaaraoui, Alexandros Andre; Flórez-Revuelta, Francisco (июнь 2015). “Visual privacy protection methods: A survey” (PDF). Expert Systems with Applications [англ.]. 42 (9): 4177—4195. DOI:10.1016/j.eswa.2015.01.041. HDL:10045/44523. S2CID 6794899. Проверьте дату в
|date=(справка на английском) - Chaaraoui, Alexandros; Padilla-López, José; Ferrández-Pastor, Francisco; Nieto-Hidalgo, Mario; Flórez-Revuelta, Francisco (20 мая 2014). “A Vision-Based System for Intelligent Monitoring: Human Behaviour Analysis and Privacy by Context”. Sensors [англ.]. 14 (5): 8895—8925. Bibcode:2014Senso..14.8895C. DOI:10.3390/s140508895. PMC 4063058. PMID 24854209.