Архив Darwin Core

Pause

Архи́в Darwin Core — открытый формат упаковки и передачи наборов данных о биоразнообразии, стандартизированный сообществом «Таксономические базы данных для экологического сообщества» (TDWG)[1]. В формальной записи архив представляет собой совокупность A = ⟨C, E₁, …, Eₙ, M, D⟩, где C — текстовая таблица ядра, E₁, …, Eₙ — таблицы расширений, M — файл meta.xml с описанием структуры таблиц, а D — файл eml.xml с описанием самого набора данных; все элементы помещаются в один ZIP-контейнер[2]. Строки таблиц описаны терминами словаря Darwin Core, выросшего из Дублинского ядра метаданных и названного в честь Чарльза Дарвина по аналогии с Дублинским ядром[1]. Благодаря такой упаковке весь набор — таблицы находок, определений таксонов, измерений и медиафайлы вместе с метаданными — передаётся единым файлом, не требующим специальных серверов или баз данных для чтения[3].

Архив Darwin Core служит предпочтительным форматом публикации данных о находках организмов в инфраструктуре Глобального информационного фонда по биоразнообразию (GBIF) и используется национальными и тематическими узлами биоразнообразия по всему миру[4]. К сентябрю 2026 года доступный через GBIF глобальный индекс превысил 3,8 млрд записей о находках, значительная часть которых поступила в виде архивов Darwin Core[5].

Общие сведения
Что важно знать
Архи́в Darwin Core
Область использования биоинформатика, информатика биоразнообразия, машинное обучение, экологическое моделирование, музейное дело
Дата появления 2009
Место появления международное сообщество Biodiversity Information Standards (TDWG)
Автор понятия рабочая группа TDWG по стандарту Darwin Core
Ключевые слова данные о биоразнообразии, стандарт обмена, звездообразная схема, обучающая выборка, происхождение данных
Базовые понятия Darwin Core, метаданные, стандарт, текстовый файл с разделителями, XML

История

К концу 1990-х годов в биологии накопился массив оцифрованных коллекционных данных, но отдельные музеи, гербарии и исследовательские группы хранили их в несовместимых форматах, а обмен требовал двусторонних договорённостей между учреждениями. Возникшее на этом фоне направление — биоинформатика биоразнообразия — ставило целью сделать первичные данные о находках организмов столь же доступными, как и библиографические записи в библиотечных каталогах, и связать их в единое информационное пространство науки[6].

В 1998 году в США по инициативе рабочей группы ZBIG, объединившей университеты и музеи при поддержке Национального научного фонда, был подготовлен профиль стандарта Z39.50 для обмена данными о биоразнообразии; тогда же на встрече в Университете Канзаса для словаря атрибутов, лежащего в основе этого профиля, было предложено название «Darwin Core» — по аналогии с Дублинским ядром метаданных[1]. Словарь Darwin Core развивался как расширение Дублинского ядра: версии 1.x сопровождали протоколы доступа DiGIR и Z39.50, число терминов выросло с 24 до нескольких десятков, а морские и океанологические проекты уже в 2005 году применяли словарь для публикации данных морских наблюдений[1]. 9 октября 2009 года словарь был ратифицирован как стандарт TDWG в редакции, содержавшей 169 терминов и закреплённой на постоянном адресе в пространстве имён rs.tdwg.org[1].

Формат архива появился как ответ на практическую задачу: протоколы прямого доступа требовали работающего сервера в каждом учреждении, что оказалось непосильным для малых коллекций. Упаковка набора в самодостаточный файл позволяла публиковать данные силами одного системного администратора или даже без него — через сетевые хранилища. Уже в 2010—2011 годах архивы Darwin Core стали штатным форматом новых инфраструктур: портал VertNet, объединивший данные орнитологических, ихтиологических и других зоологических коллекций, строился вокруг пакетов в этом формате[7], а издательская платформа Pensoft приняла архивы как форму приложений данных к таксономическим статьям в журналах ZooKeys и PhytoKeys[4]. Дополнительным толчком послужило движение за публикацию и цитирование наборов данных: практика «дата-пейперов» (описательных статей о наборах данных) придала архивам статус полноценного научного продукта[8].

По мере роста сети GBIF формат занял в ней центральное место. 4 июля 2018 года индекс фонда превысил один миллиард записей о находках; праздничный рубеж был достигнут после подключения крупного французского национального узла, а всего к тому моменту данные поставляли более 1200 организаций из 123 стран[9]. К 25-летию фонда, которое отмечалось в сентябре 2026 года, индекс вырос более чем втрое — до 3,8 млрд записей при участниках из 70 стран и поставщиках более чем из 120 стран[5]. Рост за этот период близок к экспоненциальному: если N₁ и N₂ — объёмы индекса в моменты времени, разделённые интервалом Δt, то время удвоения оценивается как T₂ = Δt · ln 2 / ln(N₂/N₁) ≈ 4,7 года. Сопоставимые объёмы загрузок — сотни миллиардов записей в год — подтверждают, что формат стал одним из основных каналов доставки первичных данных о биоразнообразии в науку[9].

undefined

Состав архива

Архив Darwin Core собирается из простых и общедоступных элементов. Основу составляет текстовая таблица ядра — файл с расширением .txt, разделённый символами табуляции, в котором каждая строка описывает один объект учёта: находку, таксон, событие наблюдения и тому подобное. Первая строка таблицы, как правило, содержит заголовки столбцов. Правила оформления таблиц заданы «Руководством по текстовым версиям Darwin Core»: кодировка UTF-8, разделитель полей — символ табуляции, перевод строки — в качестве разделителя записей; эти соглашения делают архив читаемым на любой вычислительной платформе[10].

Два служебных файла скрепляют архив. Файл meta.xml описывает структуру: он перечисляет файлы таблиц, разделитель полей, кодировку, тип строк каждой таблицы и поля связи, а главное — сопоставляет столбцы каждой таблицы терминам словаря Darwin Core; при наличии таблиц расширений или нестандартных столбцов его присутствие в архиве обязательно[2]. Файл eml.xml содержит метаданные самого набора данных — автора, права, географию и методику сбора — в формате EML, принятом в инфраструктуре GBIF[2]. Формат EML родился в сетевой архитектуре экологических данных и был задуман как универсальный способ описывать научные наборы данных, достаточный для их повторного использования без необходимости обращения к авторам[11].

Собранные файлы упаковываются в один ZIP-контейнер, реже — tar.gz. Если ядро состоит из n строк, а kᵢ — число строк i-й таблицы расширения, то общий объём записей архива оценивается суммой n + Σ kᵢ. Такой состав делает архив самодостаточным файлом: набор целиком — данные, их структура и описание — переносится одним файлом и читается без доступа к исходной базе учреждения[2].

undefined

Термины стандарта

Словарь Darwin Core описывает минимальный набор сведений о находке организма: научное название, место и дату наблюдения или сбора, тип записи, способ её получения, а также идентификаторы, связывающие запись с коллекционным экземпляром или медиафайлом. Термины сгруппированы по классам — «находка», «таксон», «событие», «локация», «определение», «измерение или факт», «медиаобъект», «агент» и другие; каждый термин имеет постоянный адрес в пространстве имён rs.tdwg.org и снабжён определением, комментариями и примерами использования[12]. Ратифицированная в 2009 году редакция словаря включала 169 терминов[1][13].

Словарь вырос из Дублинского ядра: часть его терминов напрямую заимствована оттуда, благодаря чему архивы Darwin Core совместимы с широкой экосистемой библиотечных и архивных метаданных[1]. Элементы Дублинского ядра закреплены международными стандартами: действующий стандарт ISO 15836-1:2017 устанавливает пятнадцать основных элементов, а действующий с 2019 года стандарт ISO 15836-2:2019 — сорок свойств и двадцать классов расширенного словаря терминов; более ранние полные редакции ISO 15836:2003 и ISO 15836:2009 утратили силу[14][15]. Такая преемственность позволила применять к словарю Darwin Core процедуры формальной стандартизации: сам словарь ратифицирован TDWG, а его дублинская часть — международной организацией по стандартизации[14].

Для записи сущностей, отсутствующих в словаре, столбцы таблицы могут пополняться нестандартными терминами, указанными в meta.xml; эта возможность позволяет учреждениям сохранять полноту своих данных, не отказываясь от формата[2]. Практический смысл перечня терминов виден в каждой строке таблицы ядра: одинаковый набор столбцов у архивов разных учреждений — от провинциального гербария до национального музея — делает их данные сопоставимыми и объединяемыми без ручной переработки[12].

undefined

Ядро и расширения

Ядро архива выбирается в зависимости от предметной области: находка — для фактов наблюдения и сбора организмов, таксон — для таксономических баз и определителей, событие — для экологических мониторинговых описаний. Таблицы расширений присоединяются к ядру через ключ — идентификатор строки ядра, повторяющийся в специальном столбце расширения[2]. Классические расширения — identification (определения таксонов, включая исторические и текущие), MeasurementOrFact (измерения и качественные факты), multimedia (изображения, звук, трёхмерные модели) — позволяют описывать одну находку многими связанными записями, не меняя структуру ядра[12].

Расширяемость сыграла роль и в межплатформенном обмене. Издательские и агрегирующие системы научных данных научились принимать архивы как универсальный «конверт»: так, связующее звено между платформами Pensoft, GBIF, Catalogue of Life и Encyclopedia of Life было построено на автоматической передаче архивов Darwin Core, создаваемых из рукописей статей[4]. Сопоставимый подход применён и в проекте VertNet, где пакеты данных рассылаются узлам сети и индексируются локально[7].

undefined

Метаданные и версии

Метаданные набора данных в архиве Darwin Core оформляются по профилю GBIF, построенному на формате EML. В них входят название и аннотация набора, условия лицензирования, состав авторов, географический и таксономический охват, методика сбора, а также библиографические сведения, необходимые для корректного цитирования[2]. Архив поддерживает версионирование: при обновлении данных учреждение публикует новую версию набора, а предыдущие версии остаются доступными и получают собственные идентификаторы. В сочетании с практикой «дата-пейперов» это позволяет ссылаться на данные так же, как на статьи: публикация набора сопровождается присвоением ему постоянного идентификатора и библиографической записи[8]. Тем самым архив включается в современный цикл научной коммуникации, в котором данные рассмاتриваются как полноправный результат, подлежащий публикации, цитированию и рецензированию[16].

undefined

Публикация и инфраструктура

Основным инструментом создания архивов Darwin Core служит Интегрированный инструмент публикации (IPT) — свободное веб-приложение, разработанное в сети GBIF. Оно подключается к источникам данных учреждения, позволяет описать набор с помощью метаданных, сгенерировать архив и опубликовать его в сети, в том числе зарегистрировать в глобальном индексе GBIF[17]. Руководство по инструменту прямо называет архив Darwin Core предпочтительным форматом публикации данных о биоразнообразии[2].

GBIF — межправительственная сеть, объединяющая страны-участницы и организации-поставщики данных в общий индекс данных о биоразнообразии[18]. Узлы сети принимают архивы от учреждений, индексируют их и передают в единый глобальный индекс; загрузки данных для пользователей, в свою очередь, также оформляются в формате архивов Darwin Core — с таблицами находок и исходных записей, служебными файлами meta.xml и eml.xml и сопроводительными файлами прав и цитирования[19].

Формат сосуществует с альтернативами и охватывает не все задачи. Для структур данных, не сводимых к таблицам, сообщество TDWG поддерживает стандарт ABCD — развитую XML-схему, применяемую преимущественно европейскими гербариями; сопоставление двух стандартов показало, что ABCD выигрывает в детальности модели, а архив Darwin Core — в простоте освоения и сопровождения, что и определило его массовость[20]. Для малых учреждений без системных администраторов альтернативой служат централизованные платформы вроде VertNet, берущие на себя и упаковку, и рассылку данных[7].

undefined

Распространение и применение

Архив Darwin Core стал фактическим стандартом обмена в национальных сетях биоразнообразия и в издательской практике. Таксономические статьи в журналах, принимающих приложения данных, сопровождаются архивами, автоматически передаваемыми в агрегаторы; так данные из таксономических работ попадают в глобальный индекс без ручного переноса[4]. Дата-пейперы (data papers) — отдельные публикации о наборах данных — оформляются на основе тех же архивов и дают авторам данных цитируемую публикацию[8]. Масштаб распространения формата виден из статистики инфраструктуры GBIF. Порог в один миллиард записей был перейдён в июле 2018 года; за один лишь предшествующий, 2017 год, пользователям было передано 845 млрд записей[9]. К сентябрю 2026 года индекс достиг 3,8 млрд записей, а сеть объединила участников из 70 стран[5].

Архивы Darwin Core при этом остаются основным способом, которым учреждения малого и среднего размера вносят свои данные в мировую совокупность данных[2][21].

Нормативный статус и стандарты

Словарь Darwin Core — действующий стандарт TDWG: его текущая редакция, перечень терминов и руководства поддерживаются в открытом доступе на официальном сайте стандарта[12]. Формат архива Darwin Core описан «Руководством по текстовым версиям Darwin Core», также поддерживаемым TDWG[10]. Рекомендации по созданию и использованию архивов выпущены также инфраструктурой GBIF в виде руководства для менеджеров данных[2].

Дублинская часть словаря, из которой вырос Darwin Core, стандартизирована независимо: действующий международный стандарт ISO 15836-1:2017 «Набор элементов метаданных Дублинского ядра. Часть 1. Основные элементы» подтверждён в 2022 году, а действующий стандарт ISO 15836-2:2019 устанавливает расширенный словарь свойств и классов[14][15]. Прежние полные редакции ISO 15836:2003 и ISO 15836:2009 утратили силу после выхода частей 1 и 2 стандарта и упоминаются лишь как исторические этапы стандартизации[14]. Российские нормативные правовые акты, посвящённые непосредственно формату архива Darwin Core, отсутствуют; в научно-технической литературе формат упоминается в рамках национальной инфраструктуры биоразнообразия.

Примечания

  1. ↑ 1 2 3 4 5 6 7 Wieczorek J., Bloom D., Guralnick R., Blum S., Döring M., Giovanni R., Wolf T. Darwin Core: An Evolving Community-Developed Biodiversity Data Standard // PLoS ONE. — 2012. — Т. 7, № 1. — С. e29715. — doi:10.1371/journal.pone.0029715.
  2. ↑ 1 2 3 4 5 6 7 8 9 10 Darwin Core Archive — a guide for data managers (англ.). Глобимальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
  3. ↑ Буйволов Ю. А., Иванова Н. В., Шашков М. П. Оцифровка данных Летописей природы и научных биологических коллекций особо охраняемых природных территорий : учеб. пособие. — М.: ФГБУ «Приокско-Террасный государственный природный биосферный заповедник», 2019. — С. 11—13.
  4. ↑ 1 2 3 4 Baker E., Rycroft S., Smith V. S. Linking multiple biodiversity informatics platforms with Darwin Core Archives // Biodiversity Data Journal. — 2014. — Т. 2. — С. e1039. — doi:10.3897/BDJ.2.e1039.
  5. ↑ 1 2 3 GBIF marks 25 years of connecting biodiversity data (англ.). Pensoft. Дата обращения: 23 сентября 2026.
  6. ↑ Bisby F. A. The Quiet Revolution: Biodiversity Informatics and the Internet // Science. — 2000. — Т. 289, № 5488. — С. 2309—2312. — doi:10.1126/science.289.5488.2309.
  7. ↑ 1 2 3 Constable H., Guralnick R., Wieczorek J., Spencer C., Kraft R. VertNet: A New Model for Biodiversity Data Sharing // PLoS Biology. — 2010. — Т. 8, № 11. — С. e1000309. — doi:10.1371/journal.pbio.1000309.
  8. ↑ 1 2 3 Chavan V., Penev L. The data paper: a mechanism to incentivize data publishing in biodiversity science // BMC Bioinformatics. — 2011. — Т. 12, № 15. — С. S2. — doi:10.1186/1471-2105-12-S15-S2.
  9. ↑ 1 2 3 GBIF-mediated record surpasses one billion (англ.). Глобальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
  10. ↑ 1 2 Darwin Core text guidelines (англ.). Таксономические базы данных для экологического сообщества. Дата обращения: 23 сентября 2026.
  11. ↑ Jones M. B., Berkley C., Bojilova J., Schildhauer M. Managing scientific metadata // IEEE Internet Computing. — 2001. — Т. 5, № 5. — С. 59—68. — doi:10.1109/4236.957896.
  12. ↑ 1 2 3 4 Darwin Core quick reference guide (англ.). Таксономические базы данных для экологического сообщества. Дата обращения: 23 сентября 2026.
  13. ↑ Буйволов Ю. А., Иванова Н. В., Шашков М. П. Оцифровка данных Летописей природы и научных биологических коллекций особо охраняемых природных территорий : учеб. пособие. — М.: ФГБУ «Приокско-Террасный государственный природный биосферный заповедник», 2019. — С. 11—13.
  14. ↑ 1 2 3 4 ISO 15836-1:2017. Information and documentation — The Dublin Core metadata element set — Part 1: Core elements (англ.). Международная организация по стандартизации. Дата обращения: 23 сентября 2026.
  15. ↑ 1 2 ISO 15836-2:2019. Information and documentation — The Dublin Core metadata element set — Part 2: DCMI Properties and classes (англ.). Международная организация по стандартизации. Дата обращения: 23 сентября 2026.
  16. ↑ Costello M. J., Michener W. K., Gahegan M., Zhang Z.-Q., Bourne P. E. Biodiversity data should be published, cited, and peer reviewed // Trends in Ecology & Evolution. — 2013. — Т. 28, № 8. — С. 454—461. — doi:10.1016/j.tree.2013.05.002.
  17. ↑ IPT user manual (англ.). Глобальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
  18. ↑ What is GBIF? (англ.). Глобальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
  19. ↑ Download formats (англ.). Глобальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
  20. ↑ Holetschek J., Dröge G., Güntsch A., Berendsohn W. G. The ABCD of primary biodiversity data access // Plant Biosystems. — 2012. — Т. 146, № 4. — С. 771—779. — doi:10.1080/11263504.2012.740085.
  21. ↑ Сохранение биоразнообразия в Арктике. Проблемы, задачи, решения / под ред. А. М. Амирханова, М. А. Жукова, Б. М. Кершенгольца, И. М. Охлопкова, Р. Л. Романенкова, С. А. Сапогина, А. А. Тишкова, Т. В. Устиновой. — М.: Физматкнига, 2023. — С. 67—68. — ISBN 978-5-89155-778-9.

Литература

  • Буйволов Ю. А., Иванова Н. В., Шашков М. П. Оцифровка данных Летописей природы и научных биологических коллекций особо охраняемых природных территорий : учеб. пособие. — М.: ФГБУ «Приокско-Террасный государственный природный биосферный заповедник», 2019. — С. 11—13.
  • Сохранение биоразнообразия в Арктике. Проблемы, задачи, решения / под ред. А. М. Амирханова, М. А. Жукова, Б. М. Кершенгольца, И. М. Охлопкова, Р. Л. Романенкова, С. А. Сапогина, А. А. Тишкова, Т. В. Устиновой. — М.: Физматкнига, 2023. — С. 67—68. — ISBN 978-5-89155-778-9.
  • Bisby F. A. The Quiet Revolution: Biodiversity Informatics and the Internet (англ.) // Science. — 2000. — Vol. 289, no. 5488. — P. 2309—2312. — doi:10.1126/science.289.5488.2309.
  • Chavan V., Penev L. The data paper: a mechanism to incentivize data publishing in biodiversity science (англ.) // BMC Bioinformatics. — 2011. — Vol. 12, no. 15. — P. S2. — doi:10.1186/1471-2105-12-S15-S2.
  • Constable H., Guralnick R., Wieczorek J., Spencer C., Kraft R. VertNet: A New Model for Biodiversity Data Sharing (англ.) // PLoS Biology. — 2010. — Vol. 8, no. 11. — P. e1000309. — doi:10.1371/journal.pbio.1000309.
  • Costello M. J., Michener W. K., Gahegan M., Zhang Z.-Q., Bourne P. E. Biodiversity data should be published, cited, and peer reviewed (англ.) // Trends in Ecology & Evolution. — 2013. — Vol. 28, no. 8. — P. 454—461. — doi:10.1016/j.tree.2013.05.002.
  • Curry G. B., Humphries C. J. Biodiversity Databases: Techniques, Politics and Applications (англ.). — Taylor & Francis, 2006. — 368 p. — ISBN 978-0-415-33290-3.
  • Holetschek J., Dröge G., Güntsch A., Berendsohn W. G. The ABCD of primary biodiversity data access (англ.) // Plant Biosystems. — 2012. — Vol. 146, no. 4. — P. 771—779. — doi:10.1080/11263504.2012.740085.
  • Jones M. B., Berkley C., Bojilova J., Schildhauer M. Managing scientific metadata (англ.) // IEEE Internet Computing. — 2001. — Vol. 5, no. 5. — P. 59—68. — doi:10.1109/4236.957896.
  • Michener W. K., Brunt J. W. Ecological Data: Design, Management and Processing (англ.). — Blackwell Science, 2000. — 298 p. — ISBN 978-0-632-05231-8.
  • Wieczorek J., Bloom D., Guralnick R., Blum S., Döring M., Giovanni R., Wolf T. Darwin Core: An Evolving Community-Developed Biodiversity Data Standard (англ.) // PLoS ONE. — 2012. — Vol. 7, no. 1. — P. e29715. — doi:10.1371/journal.pone.0029715.
  • Wilkinson M. D. и др. The FAIR Guiding Principles for scientific data management and stewardship (англ.) // Scientific Data. — 2016. — Vol. 3. — P. 160018. — doi:10.1038/sdata.2016.18.

Ссылки

Дополнительно по теме

Категории

Pause