Ответ на вопрос
Архив Darwin Core
Архи́в Darwin Core — открытый формат упаковки и передачи наборов данных о биоразнообразии, стандартизированный сообществом «Таксономические базы данных для экологического сообщества» (TDWG)[1]. В формальной записи архив представляет собой совокупность A = ⟨C, E₁, …, Eₙ, M, D⟩, где C — текстовая таблица ядра, E₁, …, Eₙ — таблицы расширений, M — файл meta.xml с описанием структуры таблиц, а D — файл eml.xml с описанием самого набора данных; все элементы помещаются в один ZIP-контейнер[2]. Строки таблиц описаны терминами словаря Darwin Core, выросшего из Дублинского ядра метаданных и названного в честь Чарльза Дарвина по аналогии с Дублинским ядром[1]. Благодаря такой упаковке весь набор — таблицы находок, определений таксонов, измерений и медиафайлы вместе с метаданными — передаётся единым файлом, не требующим специальных серверов или баз данных для чтения[3].
Архив Darwin Core служит предпочтительным форматом публикации данных о находках организмов в инфраструктуре Глобального информационного фонда по биоразнообразию (GBIF) и используется национальными и тематическими узлами биоразнообразия по всему миру[4]. К сентябрю 2026 года доступный через GBIF глобальный индекс превысил 3,8 млрд записей о находках, значительная часть которых поступила в виде архивов Darwin Core[5].
Общие сведения
Что важно знать
| Архи́в Darwin Core | |
|---|---|
| Область использования | биоинформатика, информатика биоразнообразия, машинное обучение, экологическое моделирование, музейное дело |
| Дата появления | 2009 |
| Место появления | международное сообщество Biodiversity Information Standards (TDWG) |
| Автор понятия | рабочая группа TDWG по стандарту Darwin Core |
| Ключевые слова | данные о биоразнообразии, стандарт обмена, звездообразная схема, обучающая выборка, происхождение данных |
| Базовые понятия | Darwin Core, метаданные, стандарт, текстовый файл с разделителями, XML |
История
К концу 1990-х годов в биологии накопился массив оцифрованных коллекционных данных, но отдельные музеи, гербарии и исследовательские группы хранили их в несовместимых форматах, а обмен требовал двусторонних договорённостей между учреждениями. Возникшее на этом фоне направление — биоинформатика биоразнообразия — ставило целью сделать первичные данные о находках организмов столь же доступными, как и библиографические записи в библиотечных каталогах, и связать их в единое информационное пространство науки[6].
В 1998 году в США по инициативе рабочей группы ZBIG, объединившей университеты и музеи при поддержке Национального научного фонда, был подготовлен профиль стандарта Z39.50 для обмена данными о биоразнообразии; тогда же на встрече в Университете Канзаса для словаря атрибутов, лежащего в основе этого профиля, было предложено название «Darwin Core» — по аналогии с Дублинским ядром метаданных[1]. Словарь Darwin Core развивался как расширение Дублинского ядра: версии 1.x сопровождали протоколы доступа DiGIR и Z39.50, число терминов выросло с 24 до нескольких десятков, а морские и океанологические проекты уже в 2005 году применяли словарь для публикации данных морских наблюдений[1]. 9 октября 2009 года словарь был ратифицирован как стандарт TDWG в редакции, содержавшей 169 терминов и закреплённой на постоянном адресе в пространстве имён rs.tdwg.org[1].
Формат архива появился как ответ на практическую задачу: протоколы прямого доступа требовали работающего сервера в каждом учреждении, что оказалось непосильным для малых коллекций. Упаковка набора в самодостаточный файл позволяла публиковать данные силами одного системного администратора или даже без него — через сетевые хранилища. Уже в 2010—2011 годах архивы Darwin Core стали штатным форматом новых инфраструктур: портал VertNet, объединивший данные орнитологических, ихтиологических и других зоологических коллекций, строился вокруг пакетов в этом формате[7], а издательская платформа Pensoft приняла архивы как форму приложений данных к таксономическим статьям в журналах ZooKeys и PhytoKeys[4]. Дополнительным толчком послужило движение за публикацию и цитирование наборов данных: практика «дата-пейперов» (описательных статей о наборах данных) придала архивам статус полноценного научного продукта[8].
По мере роста сети GBIF формат занял в ней центральное место. 4 июля 2018 года индекс фонда превысил один миллиард записей о находках; праздничный рубеж был достигнут после подключения крупного французского национального узла, а всего к тому моменту данные поставляли более 1200 организаций из 123 стран[9]. К 25-летию фонда, которое отмечалось в сентябре 2026 года, индекс вырос более чем втрое — до 3,8 млрд записей при участниках из 70 стран и поставщиках более чем из 120 стран[5]. Рост за этот период близок к экспоненциальному: если N₁ и N₂ — объёмы индекса в моменты времени, разделённые интервалом Δt, то время удвоения оценивается как T₂ = Δt · ln 2 / ln(N₂/N₁) ≈ 4,7 года. Сопоставимые объёмы загрузок — сотни миллиардов записей в год — подтверждают, что формат стал одним из основных каналов доставки первичных данных о биоразнообразии в науку[9].
Состав архива
Архив Darwin Core собирается из простых и общедоступных элементов. Основу составляет текстовая таблица ядра — файл с расширением .txt, разделённый символами табуляции, в котором каждая строка описывает один объект учёта: находку, таксон, событие наблюдения и тому подобное. Первая строка таблицы, как правило, содержит заголовки столбцов. Правила оформления таблиц заданы «Руководством по текстовым версиям Darwin Core»: кодировка UTF-8, разделитель полей — символ табуляции, перевод строки — в качестве разделителя записей; эти соглашения делают архив читаемым на любой вычислительной платформе[10].
Два служебных файла скрепляют архив. Файл meta.xml описывает структуру: он перечисляет файлы таблиц, разделитель полей, кодировку, тип строк каждой таблицы и поля связи, а главное — сопоставляет столбцы каждой таблицы терминам словаря Darwin Core; при наличии таблиц расширений или нестандартных столбцов его присутствие в архиве обязательно[2]. Файл eml.xml содержит метаданные самого набора данных — автора, права, географию и методику сбора — в формате EML, принятом в инфраструктуре GBIF[2]. Формат EML родился в сетевой архитектуре экологических данных и был задуман как универсальный способ описывать научные наборы данных, достаточный для их повторного использования без необходимости обращения к авторам[11].
Собранные файлы упаковываются в один ZIP-контейнер, реже — tar.gz. Если ядро состоит из n строк, а kᵢ — число строк i-й таблицы расширения, то общий объём записей архива оценивается суммой n + Σ kᵢ. Такой состав делает архив самодостаточным файлом: набор целиком — данные, их структура и описание — переносится одним файлом и читается без доступа к исходной базе учреждения[2].
Термины стандарта
Словарь Darwin Core описывает минимальный набор сведений о находке организма: научное название, место и дату наблюдения или сбора, тип записи, способ её получения, а также идентификаторы, связывающие запись с коллекционным экземпляром или медиафайлом. Термины сгруппированы по классам — «находка», «таксон», «событие», «локация», «определение», «измерение или факт», «медиаобъект», «агент» и другие; каждый термин имеет постоянный адрес в пространстве имён rs.tdwg.org и снабжён определением, комментариями и примерами использования[12]. Ратифицированная в 2009 году редакция словаря включала 169 терминов[1][13].
Словарь вырос из Дублинского ядра: часть его терминов напрямую заимствована оттуда, благодаря чему архивы Darwin Core совместимы с широкой экосистемой библиотечных и архивных метаданных[1]. Элементы Дублинского ядра закреплены международными стандартами: действующий стандарт ISO 15836-1:2017 устанавливает пятнадцать основных элементов, а действующий с 2019 года стандарт ISO 15836-2:2019 — сорок свойств и двадцать классов расширенного словаря терминов; более ранние полные редакции ISO 15836:2003 и ISO 15836:2009 утратили силу[14][15]. Такая преемственность позволила применять к словарю Darwin Core процедуры формальной стандартизации: сам словарь ратифицирован TDWG, а его дублинская часть — международной организацией по стандартизации[14].
Для записи сущностей, отсутствующих в словаре, столбцы таблицы могут пополняться нестандартными терминами, указанными в meta.xml; эта возможность позволяет учреждениям сохранять полноту своих данных, не отказываясь от формата[2]. Практический смысл перечня терминов виден в каждой строке таблицы ядра: одинаковый набор столбцов у архивов разных учреждений — от провинциального гербария до национального музея — делает их данные сопоставимыми и объединяемыми без ручной переработки[12].
Ядро и расширения
Ядро архива выбирается в зависимости от предметной области: находка — для фактов наблюдения и сбора организмов, таксон — для таксономических баз и определителей, событие — для экологических мониторинговых описаний. Таблицы расширений присоединяются к ядру через ключ — идентификатор строки ядра, повторяющийся в специальном столбце расширения[2]. Классические расширения — identification (определения таксонов, включая исторические и текущие), MeasurementOrFact (измерения и качественные факты), multimedia (изображения, звук, трёхмерные модели) — позволяют описывать одну находку многими связанными записями, не меняя структуру ядра[12].
Расширяемость сыграла роль и в межплатформенном обмене. Издательские и агрегирующие системы научных данных научились принимать архивы как универсальный «конверт»: так, связующее звено между платформами Pensoft, GBIF, Catalogue of Life и Encyclopedia of Life было построено на автоматической передаче архивов Darwin Core, создаваемых из рукописей статей[4]. Сопоставимый подход применён и в проекте VertNet, где пакеты данных рассылаются узлам сети и индексируются локально[7].
Метаданные и версии
Метаданные набора данных в архиве Darwin Core оформляются по профилю GBIF, построенному на формате EML. В них входят название и аннотация набора, условия лицензирования, состав авторов, географический и таксономический охват, методика сбора, а также библиографические сведения, необходимые для корректного цитирования[2]. Архив поддерживает версионирование: при обновлении данных учреждение публикует новую версию набора, а предыдущие версии остаются доступными и получают собственные идентификаторы. В сочетании с практикой «дата-пейперов» это позволяет ссылаться на данные так же, как на статьи: публикация набора сопровождается присвоением ему постоянного идентификатора и библиографической записи[8]. Тем самым архив включается в современный цикл научной коммуникации, в котором данные рассмاتриваются как полноправный результат, подлежащий публикации, цитированию и рецензированию[16].
Публикация и инфраструктура
Основным инструментом создания архивов Darwin Core служит Интегрированный инструмент публикации (IPT) — свободное веб-приложение, разработанное в сети GBIF. Оно подключается к источникам данных учреждения, позволяет описать набор с помощью метаданных, сгенерировать архив и опубликовать его в сети, в том числе зарегистрировать в глобальном индексе GBIF[17]. Руководство по инструменту прямо называет архив Darwin Core предпочтительным форматом публикации данных о биоразнообразии[2].
GBIF — межправительственная сеть, объединяющая страны-участницы и организации-поставщики данных в общий индекс данных о биоразнообразии[18]. Узлы сети принимают архивы от учреждений, индексируют их и передают в единый глобальный индекс; загрузки данных для пользователей, в свою очередь, также оформляются в формате архивов Darwin Core — с таблицами находок и исходных записей, служебными файлами meta.xml и eml.xml и сопроводительными файлами прав и цитирования[19].
Формат сосуществует с альтернативами и охватывает не все задачи. Для структур данных, не сводимых к таблицам, сообщество TDWG поддерживает стандарт ABCD — развитую XML-схему, применяемую преимущественно европейскими гербариями; сопоставление двух стандартов показало, что ABCD выигрывает в детальности модели, а архив Darwin Core — в простоте освоения и сопровождения, что и определило его массовость[20]. Для малых учреждений без системных администраторов альтернативой служат централизованные платформы вроде VertNet, берущие на себя и упаковку, и рассылку данных[7].
Распространение и применение
Архив Darwin Core стал фактическим стандартом обмена в национальных сетях биоразнообразия и в издательской практике. Таксономические статьи в журналах, принимающих приложения данных, сопровождаются архивами, автоматически передаваемыми в агрегаторы; так данные из таксономических работ попадают в глобальный индекс без ручного переноса[4]. Дата-пейперы (data papers) — отдельные публикации о наборах данных — оформляются на основе тех же архивов и дают авторам данных цитируемую публикацию[8]. Масштаб распространения формата виден из статистики инфраструктуры GBIF. Порог в один миллиард записей был перейдён в июле 2018 года; за один лишь предшествующий, 2017 год, пользователям было передано 845 млрд записей[9]. К сентябрю 2026 года индекс достиг 3,8 млрд записей, а сеть объединила участников из 70 стран[5].
Архивы Darwin Core при этом остаются основным способом, которым учреждения малого и среднего размера вносят свои данные в мировую совокупность данных[2][21].
Нормативный статус и стандарты
Словарь Darwin Core — действующий стандарт TDWG: его текущая редакция, перечень терминов и руководства поддерживаются в открытом доступе на официальном сайте стандарта[12]. Формат архива Darwin Core описан «Руководством по текстовым версиям Darwin Core», также поддерживаемым TDWG[10]. Рекомендации по созданию и использованию архивов выпущены также инфраструктурой GBIF в виде руководства для менеджеров данных[2].
Дублинская часть словаря, из которой вырос Darwin Core, стандартизирована независимо: действующий международный стандарт ISO 15836-1:2017 «Набор элементов метаданных Дублинского ядра. Часть 1. Основные элементы» подтверждён в 2022 году, а действующий стандарт ISO 15836-2:2019 устанавливает расширенный словарь свойств и классов[14][15]. Прежние полные редакции ISO 15836:2003 и ISO 15836:2009 утратили силу после выхода частей 1 и 2 стандарта и упоминаются лишь как исторические этапы стандартизации[14]. Российские нормативные правовые акты, посвящённые непосредственно формату архива Darwin Core, отсутствуют; в научно-технической литературе формат упоминается в рамках национальной инфраструктуры биоразнообразия.
Примечания
- ↑ 1 2 3 4 5 6 7 Wieczorek J., Bloom D., Guralnick R., Blum S., Döring M., Giovanni R., Wolf T. Darwin Core: An Evolving Community-Developed Biodiversity Data Standard // PLoS ONE. — 2012. — Т. 7, № 1. — С. e29715. — doi:10.1371/journal.pone.0029715.
- ↑ 1 2 3 4 5 6 7 8 9 10 Darwin Core Archive — a guide for data managers (англ.). Глобимальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
- ↑ Буйволов Ю. А., Иванова Н. В., Шашков М. П. Оцифровка данных Летописей природы и научных биологических коллекций особо охраняемых природных территорий : учеб. пособие. — М.: ФГБУ «Приокско-Террасный государственный природный биосферный заповедник», 2019. — С. 11—13.
- ↑ 1 2 3 4 Baker E., Rycroft S., Smith V. S. Linking multiple biodiversity informatics platforms with Darwin Core Archives // Biodiversity Data Journal. — 2014. — Т. 2. — С. e1039. — doi:10.3897/BDJ.2.e1039.
- ↑ 1 2 3 GBIF marks 25 years of connecting biodiversity data (англ.). Pensoft. Дата обращения: 23 сентября 2026.
- ↑ Bisby F. A. The Quiet Revolution: Biodiversity Informatics and the Internet // Science. — 2000. — Т. 289, № 5488. — С. 2309—2312. — doi:10.1126/science.289.5488.2309.
- ↑ 1 2 3 Constable H., Guralnick R., Wieczorek J., Spencer C., Kraft R. VertNet: A New Model for Biodiversity Data Sharing // PLoS Biology. — 2010. — Т. 8, № 11. — С. e1000309. — doi:10.1371/journal.pbio.1000309.
- ↑ 1 2 3 Chavan V., Penev L. The data paper: a mechanism to incentivize data publishing in biodiversity science // BMC Bioinformatics. — 2011. — Т. 12, № 15. — С. S2. — doi:10.1186/1471-2105-12-S15-S2.
- ↑ 1 2 3 GBIF-mediated record surpasses one billion (англ.). Глобальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
- ↑ 1 2 Darwin Core text guidelines (англ.). Таксономические базы данных для экологического сообщества. Дата обращения: 23 сентября 2026.
- ↑ Jones M. B., Berkley C., Bojilova J., Schildhauer M. Managing scientific metadata // IEEE Internet Computing. — 2001. — Т. 5, № 5. — С. 59—68. — doi:10.1109/4236.957896.
- ↑ 1 2 3 4 Darwin Core quick reference guide (англ.). Таксономические базы данных для экологического сообщества. Дата обращения: 23 сентября 2026.
- ↑ Буйволов Ю. А., Иванова Н. В., Шашков М. П. Оцифровка данных Летописей природы и научных биологических коллекций особо охраняемых природных территорий : учеб. пособие. — М.: ФГБУ «Приокско-Террасный государственный природный биосферный заповедник», 2019. — С. 11—13.
- ↑ 1 2 3 4 ISO 15836-1:2017. Information and documentation — The Dublin Core metadata element set — Part 1: Core elements (англ.). Международная организация по стандартизации. Дата обращения: 23 сентября 2026.
- ↑ 1 2 ISO 15836-2:2019. Information and documentation — The Dublin Core metadata element set — Part 2: DCMI Properties and classes (англ.). Международная организация по стандартизации. Дата обращения: 23 сентября 2026.
- ↑ Costello M. J., Michener W. K., Gahegan M., Zhang Z.-Q., Bourne P. E. Biodiversity data should be published, cited, and peer reviewed // Trends in Ecology & Evolution. — 2013. — Т. 28, № 8. — С. 454—461. — doi:10.1016/j.tree.2013.05.002.
- ↑ IPT user manual (англ.). Глобальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
- ↑ What is GBIF? (англ.). Глобальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
- ↑ Download formats (англ.). Глобальный информационный фонд по биоразнообразию. Дата обращения: 23 сентября 2026.
- ↑ Holetschek J., Dröge G., Güntsch A., Berendsohn W. G. The ABCD of primary biodiversity data access // Plant Biosystems. — 2012. — Т. 146, № 4. — С. 771—779. — doi:10.1080/11263504.2012.740085.
- ↑ Сохранение биоразнообразия в Арктике. Проблемы, задачи, решения / под ред. А. М. Амирханова, М. А. Жукова, Б. М. Кершенгольца, И. М. Охлопкова, Р. Л. Романенкова, С. А. Сапогина, А. А. Тишкова, Т. В. Устиновой. — М.: Физматкнига, 2023. — С. 67—68. — ISBN 978-5-89155-778-9.
Литература
- Буйволов Ю. А., Иванова Н. В., Шашков М. П. Оцифровка данных Летописей природы и научных биологических коллекций особо охраняемых природных территорий : учеб. пособие. — М.: ФГБУ «Приокско-Террасный государственный природный биосферный заповедник», 2019. — С. 11—13.
- Сохранение биоразнообразия в Арктике. Проблемы, задачи, решения / под ред. А. М. Амирханова, М. А. Жукова, Б. М. Кершенгольца, И. М. Охлопкова, Р. Л. Романенкова, С. А. Сапогина, А. А. Тишкова, Т. В. Устиновой. — М.: Физматкнига, 2023. — С. 67—68. — ISBN 978-5-89155-778-9.
- Bisby F. A. The Quiet Revolution: Biodiversity Informatics and the Internet (англ.) // Science. — 2000. — Vol. 289, no. 5488. — P. 2309—2312. — doi:10.1126/science.289.5488.2309.
- Chavan V., Penev L. The data paper: a mechanism to incentivize data publishing in biodiversity science (англ.) // BMC Bioinformatics. — 2011. — Vol. 12, no. 15. — P. S2. — doi:10.1186/1471-2105-12-S15-S2.
- Constable H., Guralnick R., Wieczorek J., Spencer C., Kraft R. VertNet: A New Model for Biodiversity Data Sharing (англ.) // PLoS Biology. — 2010. — Vol. 8, no. 11. — P. e1000309. — doi:10.1371/journal.pbio.1000309.
- Costello M. J., Michener W. K., Gahegan M., Zhang Z.-Q., Bourne P. E. Biodiversity data should be published, cited, and peer reviewed (англ.) // Trends in Ecology & Evolution. — 2013. — Vol. 28, no. 8. — P. 454—461. — doi:10.1016/j.tree.2013.05.002.
- Curry G. B., Humphries C. J. Biodiversity Databases: Techniques, Politics and Applications (англ.). — Taylor & Francis, 2006. — 368 p. — ISBN 978-0-415-33290-3.
- Holetschek J., Dröge G., Güntsch A., Berendsohn W. G. The ABCD of primary biodiversity data access (англ.) // Plant Biosystems. — 2012. — Vol. 146, no. 4. — P. 771—779. — doi:10.1080/11263504.2012.740085.
- Jones M. B., Berkley C., Bojilova J., Schildhauer M. Managing scientific metadata (англ.) // IEEE Internet Computing. — 2001. — Vol. 5, no. 5. — P. 59—68. — doi:10.1109/4236.957896.
- Michener W. K., Brunt J. W. Ecological Data: Design, Management and Processing (англ.). — Blackwell Science, 2000. — 298 p. — ISBN 978-0-632-05231-8.
- Wieczorek J., Bloom D., Guralnick R., Blum S., Döring M., Giovanni R., Wolf T. Darwin Core: An Evolving Community-Developed Biodiversity Data Standard (англ.) // PLoS ONE. — 2012. — Vol. 7, no. 1. — P. e29715. — doi:10.1371/journal.pone.0029715.
- Wilkinson M. D. и др. The FAIR Guiding Principles for scientific data management and stewardship (англ.) // Scientific Data. — 2016. — Vol. 3. — P. 160018. — doi:10.1038/sdata.2016.18.
Ссылки
- Darwin Core quick reference guide (англ.)
- Darwin Core Archive — a guide for data managers (англ.)
- What is GBIF? (англ.)