Деидентификация

Деидентификация (англ. de-identification) — процесс, направленный на предотвращение раскрытия личной идентичности человека. Например, данные, полученные в ходе исследований с участием людей, могут подвергаться деидентификации для сохранения конфиденциальности участников. Биологические данные деидентифицируются в целях соблюдения требований HIPAA, устанавливающих нормы охраны частной жизни пациентов[1].

К деидентификации также относят обработку метаданных или других идентификационных данных — этот процесс называют анонимизацией данных. Наиболее распространённые методы — удаление или маскирование персональных идентификаторов (например, имя), а также подавление или обобщение квази-идентификаторов, таких как дата рождения. Обратная операция, когда на основе деидентифицированных данных удаётся установить личность, называется реидентификацией данных. Успешные случаи реидентификации[2][3][4][5] ставят под сомнение эффективность деидентификации. Систематический обзор четырнадцати различных атак на реидентификацию выявил «высокий уровень успешной реидентификации, что обусловлено преимущественно небольшими исследованиями на данных, деидентифицированных с нарушением действующих стандартов»[6].

Деидентификация является одним из ключевых подходов к обеспечению защиты данных и широко применяется в коммуникациях, мультимедиа, биометрии, больших данных, облачных вычислениях, data mining, интернете, социальных сетях и системах аудио-видео наблюдения[7].

Примеры

При проектировании опросов

При проведении опросов, например, переписи, собирается информация о конкретной группе людей. Для стимулирования участия и защиты приватности респондентов исследователи стараются организовать процесс так, чтобы невозможно было сопоставить индивидуальные ответы участников с опубликованными данными[8].

Перед использованием информации

Когда интернет-магазин хочет узнать предпочтения и покупки своих пользователей, он получает данные клиентов из базы для дальнейшего анализа. Такие данные могут содержать персональные идентификаторы, полученные при регистрации учётной записи. Для соблюдения приватности пользователей сайт должен предварительно обработать записи с помощью методов деидентификации, чтобы не нарушать права клиентов.

Анонимизация

Анонимизация заключается в безвозвратном разрыве связи между набором данных и личностью участника, чтобы исключить возможность последующей реидентификации, даже для исследователей и организаторов работ[9][10]. Деидентификация также может включать сохранение идентифицирующей информации, которая при определённых условиях может быть восстановлена уполномоченной стороной[9][10][11]. В технологическом сообществе существует дискуссия, можно ли считать деидентифицированными данные, которые при необходимости могут быть восстановлены даже доверенной стороной[12].

Технологии

Наиболее распространённые методы деидентификации — маскирование персональных идентификаторов и обобщение квази-идентификаторов. Основным способом маскирования идентификаторов является псевдонимизация, а для обобщения квази-идентификаторов часто применяется k-анонимизация.

Псевдонимизация

Псевдонимизация проводится путем замены реальных имён и других идентификаторов на временные номера или коды. Она скрывает или удаляет персональные идентификаторы, затрудняя идентификацию личности. Этот способ позволяет отслеживать записи одного человека на протяжении времени, даже при их обновлении, однако не даёт полной защиты в ситуации, когда уникальная совокупность атрибутов всё же позволяет раскрыть личность[13].

k-анонимизация

K-анонимизация рассматривает части данных, косвенно позволяющие идентифицировать человека, как квази-идентификаторы (QI) и преобразует их так, чтобы хотя бы для k человек существовала одинаковая комбинация значений этих атрибутов[13]. Обычно значения QI стандартизируются, например, часть исходных данных заменяется диапазонами, а отдельные значения могут сохраняться без изменений. Это препятствует идентификации личности без разрушения структуры всей записи.

Применения

Исследования в сфере деидентификации в основном ведутся для защиты медицинской информации[14]. К примеру, отдельные библиотеки перенимают подходы из медицины для обеспечения приватности читателей[14].

В области больших данных деидентификация широко используется организациями и частными лицами[7]. С развитием социальных медиа, электронной коммерции и больших данных её применение часто требуется для защиты приватности пользователей при сборе информации компаниями и сторонними организациями.

В умных городах деидентификация может требоваться для защиты частной жизни жителей, работников и гостей. При отсутствии строгого регулирования даже деидентификация может быть неэффективна, так как сенсоры способны собирать информацию без согласия[15].

Деидентификация данных

PHI (Protected Health Information) могут присутствовать в разных форматах и требуют специальных средств и техник деидентификации:

  • Для текстовых данных используются правила обработки и методы NLP.
  • Для PDF-файлов — методы текстовой деидентификации с применением OCR и специальных алгоритмов сокрытия PHI[16].
  • Для DICOM необходима очистка метаданных, пиксельной информации и вложенных документов.

Ограничения

В генетических исследованиях передача биологического материала часто сопровождается получением индивидуализированных данных, деидентификация которых крайне затруднительна[17].

Анонимизация генетических данных особенно сложна из‑за большого объёма генотипической информации[17], связи образцов с медицинской историей[18], и появления современных биоинформатических инструментов для data mining[18]. Показано, что по данным из коллективных генетических баз возможно идентифицировать доноров конкретных образцов[19].

Ряд учёных указывает, что обещать абсолютную анонимность участникам генетических исследований нецелесообразно, а необходимо разъяснять им ограничения системы кодированных идентификаторов[10].

Законодательство о деидентификации в США

В мае 2014 года Совет Президента США по науке и технологиям признал деидентификацию «относительно полезным дополнительным средством», но не рекомендовал как основу политики приватности, поскольку «её устойчивость к будущим методам реидентификации сомнительна»[20].

Правило приватности HIPAA допускает использование и передачу медицинских данных без согласия пациента через два механизма деидентификации — метод безопасной гавани и метод экспертного заключения. Метод безопасной гавани основан на удалении определённых идентификаторов (например, имени, телефона, адреса электронной почты и др.), а экспертный метод требует опыта и знания статистических и научных подходов к исключению возможности индивидуальной идентификации[21].

Безопасная гавань

Метод безопасной гавани предусматривает два принципа:

  1. Удаление или обобщение 18 элементов из данных.
  2. Отсутствие у оператора знаний, что оставшаяся информация (по отдельности или в совокупности) может быть использована для идентификации личности. Этот подход строг и не зависит от контекста использования данных. Например, все даты формулируются только как год, а почтовые индексы сокращаются до первых трёх цифр.

Экспертное заключение

Метод экспертной оценки опирается на анализ риска идентификации по общепринятым научным стандартам. Специалист с необходимым опытом формирует заключение о том, что вероятность идентификации человека — крайне мала. При этом требуются:

  1. Доказательство очень низкого риска идентификации по доступной информации.
  2. Документирование методов анализа и обоснования.

Исследования на данных умерших пациентов

Ключевой нормой по использованию электронных медицинских записей в США выступает правило приватности HIPAA, которое допускает использование данных умерших лиц для научных целей (раздел 164.512(i)(1)(iii)).

Примечания

  1. Методы деидентификации персональных медицинских данных (англ.). HHS.gov. Office for Civil Rights (OCR) (7 сентября 2012). Дата обращения: 8 ноября 2020. Архивировано 4 октября 2025 года.
  2. Sweeney, L. (2000). “Simple Demographics Often Identify People Uniquely”. Data Privacy Working Paper. 3.
  3. de Montjoye, Y.-A. (2013). “Unique in the crowd: The privacy bounds of human mobility”. Scientific Reports. 3. Bibcode:2013NatSR...3E1376D. DOI:10.1038/srep01376. PMC 3607247. PMID 23524645.
  4. de Montjoye, Y.-A.; Radaelli, L.; Singh, V. K.; Pentland, A. S. (29 января 2015). “Unique in the shopping mall: On the reidentifiability of credit card metadata”. Science. 347 (6221): 536—539. Bibcode:2015Sci...347..536D. DOI:10.1126/science.1256297. HDL:1721.1/96321. PMID 25635097.
  5. Narayanan, A. (2006), How to break anonymity of the netflix prize dataset, arΧiv:cs/0610105. 
  6. El Emam, Khaled (2011). “A Systematic Review of Re-Identification Attacks on Health Data”. PLOS ONE. 10 (4). Bibcode:2011PLoSO...628071E. DOI:10.1371/journal.pone.0028071. PMC 3229505. PMID 22164229.
  7. 1 2 Ribaric, Slobodan; Ariyaeeinia, Aladdin; Pavesic, Nikola (сентябрь 2016). “De-identification for privacy protection in multimedia content: A survey”. Signal Processing: Image Communication. 47: 131—151. DOI:10.1016/j.image.2016.05.020. HDL:2299/19652. Проверьте дату в |date= (справка на английском)
  8. Bhaskaran, Vivek Опросные исследования: определение, примеры и методы (амер. англ.). QuestionPro (8 июня 2023). Дата обращения: 17 декабря 2023. Архивировано 12 июля 2025 года.
  9. 1 2 Godard, B. A.; Schmidtke, J. R.; Cassiman, J. J.; Aymé, S. G. N. (2003). “Data storage and DNA banking for biomedical research: Informed consent, confidentiality, quality issues, ownership, return of benefits. A professional perspective”. European Journal of Human Genetics. 11: S88—122. DOI:10.1038/sj.ejhg.5201114. PMID 14718939.
  10. 1 2 3 Fullerton, S. M.; Anderson, N. R.; Guzauskas, G.; Freeman, D.; Fryer-Edwards, K. (2010). “Meeting the Governance Challenges of Next-Generation Biorepository Research”. Science Translational Medicine. 2 (15): 15cm3. DOI:10.1126/scitranslmed.3000361. PMC 3038212. PMID 20371468.
  11. McMurry, AJ; Gilbert, CA; Reis, BY; Chueh, HC; Kohane, IS; Mandl, KD (2007). “A self-scaling, distributed information architecture for public health, research, and clinical care”. J Am Med Inform Assoc. 14 (4): 527—33. DOI:10.1197/jamia.M2371. PMC 2244902. PMID 17460129.
  12. Деидентификация данных (англ.). The Abdul Latif Jameel Poverty Action Lab (J-PAL). Дата обращения: 17 декабря 2023. Архивировано 6 сентября 2025 года.
  13. 1 2 Ito, Koichi; Kogure, Jun; Shimoyama, Takeshi; Tsuda, Hiroshi (2016). “De-identification and Encryption Technologies to Protect Personal Information” (PDF). Fujitsu Scientific and Technical Journal. 52 (3): 28—36.
  14. 1 2 Nicholson, S.; Smith, C. A. (2005). “Using lessons from health care to protect the privacy of library users: Guidelines for the de-identification of library data based on HIPAA” (PDF). Proceedings of the American Society for Information Science and Technology. 42: n/a. DOI:10.1002/meet.1450420106.
  15. Coop, Alex. Поручение сложных вопросов приватности третьей стороне — неверный шаг: бывший консультант Sidewalk Labs, IT World Canada. Архивировано 16 июня 2025 года. Дата обращения: 27 июня 2019.
  16. Деидентификация PDF-документов в медицине: обеспечение приватности пациентов и нормативное соответствие (2024). Дата обращения: 12 мая 2024. Архивировано 21 марта 2025 года.
  17. 1 2 McGuire, A. L.; Gibbs, R. A. (2006). “GENETICS: No Longer De-Identified”. Science. 312 (5772): 370—371. DOI:10.1126/science.1125339. PMID 16627725.
  18. 1 2 Thorisson, G. A.; Muilu, J.; Brookes, A. J. (2009). “Genotype–phenotype databases: Challenges and solutions for the post-genomic era”. Nature Reviews Genetics. 10 (1): 9—18. DOI:10.1038/nrg2483. HDL:2381/4584. PMID 19065136. S2CID 5964522.
  19. Homer, N.; Szelinger, S.; Redman, M.; Duggan, D.; Tembe, W.; Muehling, J.; Pearson, J. V.; Stephan, D. A.; Nelson, S. F.; Craig, D. W. (2008). Visscher, Peter M., ed. “Resolving Individuals Contributing Trace Amounts of DNA to Highly Complex Mixtures Using High-Density SNP Genotyping Microarrays”. PLOS Genetics. 4 (8). DOI:10.1371/journal.pgen.1000167. PMC 2516199. PMID 18769715.
  20. PCAST Доклад Президенту «Большие данные и приватность: технологическая перспектива». Office of Science and Technology Policy. Дата обращения: 28 марта 2016. Архивировано 26 августа 2025 года.
  21. De-Identification 201. Privacy Analytics (2015). Дата обращения: 12 мая 2024. Архивировано 30 мая 2015 года.

Литература

  • Garfinkel, Simson. De-identification of personal information: recommendation for transitioning the use of cryptographic algorithms and key lengths.

Ссылки

Категории