Архив Darwin Core
Архив Darwin Core — стандарт описания данных в области биоразнообразия, использующий термины Darwin Core для создания единого, автономного набора данных о встречаемости видов, контрольных списках, результатах учёта или материалах проб. Фактически это набор текстовых файлов (CSV) с простым дескриптором (meta.xml), описывающим структуру организации данных. Формат определён в руководстве по текстовому представлению Darwin Core[1]. Является рекомендуемым форматом для публикации данных в сети GBIF (Global Biodiversity Information Facility).
Darwin Core
Стандарт[2] используется для обработки большинства записей о находках образцов и наблюдениях в сети GBIF[3]. Первоначально стандарт Darwin Core был разработан для облегчения поиска, извлечения и интеграции информации о современных биологических образцах, их пространственно-временной встречаемости и сопряжённых доказательствах, хранящихся в физических или цифровых коллекциях.
В настоящее время стандарт Darwin Core охватывает более широкий круг задач и предоставляет устойчивую стандартную систему для обмена информацией о биологическом разнообразии. Как глоссарий терминов, Darwin Core ставит целью создание стабильных семантических определений, максимально применимых в различных контекстах. Стандарт может использоваться как для классических задач обмена данными, так и в качестве основы для построения более сложных форматов обмена информацией при сохранении совместимости за счёт единого набора терминов.
Формат архива
Основная идея архива заключается в логической организации файлов данных по принципу «звезды»: один основной файл данных окружён произвольным количеством так называемых расширений. Каждая запись расширения (или строка файла расширения) ссылается на запись в основном файле; таким образом для каждой основной записи может существовать от нуля до многих связанных расширений, что обеспечивает более эффективную передачу данных по сравнению с размещением всей информации в одной таблице, где могли бы быть многочисленные пустые ячейки.
Информация о рекомендуемых расширениях описана в соответствующих подразделах и подробно документируется в реестре GBIF, в котором перечисляются все доступные расширения.
Передача целых наборов данных, в отличие от пакетных веб-сервисов типа DiGIR и TAPIR, существенно упрощает и ускоряет обмен информацией. Например, получения 260 000 записей через TAPIR требует около девяти часов и 1 300 HTTP-запросов для передачи 500 МБ XML-данных; тот же набор данных, закодированный как DwC-A и заархивированный, занимает всего 3 МБ. Поэтому GBIF настоятельно рекомендует использовать архивирование в формате ZIP или GZIP при генерации DwC-A.
Для основного файла архива требуются стабильные идентификаторы записей, тогда как для расширений они не обязательны. При обмене данными важно обеспечить наличие локальных идентификаторов для записей. Рекомендуется использовать идентификаторы, сохраняющиеся во времени и не переиспользуемые после удаления записи. При возможности следует предоставлять глобально уникальные идентификаторы.
Дескриптор архива
Раздел в стадии заполнения.
Метаданные набора данных
Архив Darwin Core должен содержать файл с метаданными, описывающими весь набор данных. Наиболее часто применяется формат Экологического метаязыка описания метаданных (EML), однако также используются и простые файлы Dublin Core.
Примечания
- ↑ Darwin Core Text Guidelines (англ.). TDWG. Дата обращения: 18 июня 2024.
- ↑ Wieczorek, John; D. Bloom; R. Guralnick; S. Blum; M. Döring; R. De Giovanni; T. Robertson; D. Vieglais (2012). “Darwin Core: An Evolving Community-developed Biodiversity Data Standard”. PLoS ONE [англ.]. 7 (1): e29715. DOI:10.1371/journal.pone.0029715. PMC 3253084. PMID 22238640.
|access-date=требует|url=(справка) - ↑ Darwin Core Archives – How-to Guide (англ.). GitHub. Дата обращения: 18 июня 2024.
Литература
- Wieczorek J., Bloom D., Guralnick R. и др. Darwin Core: An Evolving Community-developed Biodiversity Data Standard // PLoS ONE. 2012. Vol. 7, No. 1. e29715. DOI: 10.1371/journal.pone.0029715.