Классификация кодирования информации

Классификация кодирования информации (англ. Information Coding Classification, ICC) — система классификации практически всех известных, около 6500, областей знаний. Она охватывает и такие области, которые обычно не представлены в литературных источниках. Благодаря этому Классификация кодирования информации выходит за пределы традиционных систем библиотечной классификации, таких как Регебсбургская объединённая классификация, Десятичная классификация Дьюи, Универсальная десятичная классификация и Библиотечная классификация Конгресса США, и может служить универсальной системой для классификации литературы или других информационных ресурсов по областям знаний[1].

Структура

В методическом плане Классификация кодирования информации отличается от упомянутых выше библиотечных классификаций по трём направлениям:

  • В своих основных классах она исходит не из научных дисциплин, а из девяти онтических уровней развития, называемых слоями бытия.
  • Система выделяет для классификации девять категорий на каждом иерархическом уровне, что даёт возможность кодирования с помощью десятичных чисел.
  • Места для областей знаний определены планом элементных позиций так, что первая иерархическая ступень структурируется по девяти слоям бытия (объектные области как содержательные категории), а вторая — по девяти функционально ориентированным формальным категориям. Возможные третья и четвёртая ступени подчинённых областей знаний, так же как пятая и шестая, упорядочиваются по тем же содержательным и формальным категориям. Это позволяет с помощью цифр кода для определённой области знаний всегда обращаться к тем же категориям, что усиливает мнемотехнические качества системы, а также учитывает позиционирование интер- и трансдисциплинарности.

Первые две иерархические ступени могут служить «верхней онтологией» для онтологий и иных приложений.

Первые три иерархических уровня Классификации кодирования информации были опубликованы в 2014 году на немецком и английском языках в издании Wissensorganisation. Entwicklung, Aufgabe, Anwendung, Zukunft[2]. Также существуют французские эквиваленты для этих уровней.

Ответственность за поддержание и развитие системы возложена на Немецкое отделение Международного общества по организации знаний (ISKO) e. V.

Историческое развитие

В конце 1970 года Ингетраут Дальберг получила предложение о написании диссертации от профессора Алвина Димера (Дюссельдорф) на тему «Универсальная классификационная система знаний: её онтологические, научно-теоретические и информационно-теоретические основы». Димер указал, что для такой системы необходима онтологическая основа (связанная с многообразием бытия), а также то, что система должна удовлетворять требованиям научной теории. Третье требование, подчёркивавшееся ещё в индийской колонной классификации, нуждалось в дополнительных пояснениях. В результате на основе диссертации в 1974 году появилась книга Grundlagen universaler Wissensordnung[3], где были объяснены ключевые термины, а также рассмотрено, что означает «универсальность» применительно к «знанию», включая области товаров, ремёсел, статистики, патентов, права, коммуникации, обществ, языков, мест, времён и др.

Ещё во время работы над диссертацией началась работа над новой универсальной системой, включавшей сбор наименований областей знаний из всех доступных справочных источников, при поддержке Немецкого общества по документации (DGD, 1971–1972), под названием «Система областей знаний». Были также проанализированы все каталоги лекций университетов и технических вузов Германии (1975). После того, как к каждому наименованию удалось подобрать определения из специализированных словарей и энциклопедий, выяснилось, что из 12 500 найденных терминов половина оказалась синонимами (проект DFG «Logstruktur», 1976–1978).

В упомянутом выше труде[3] были сформулированы 30 тезисов, которые впоследствии легли в основу 12 принципов новой системы. Они касаются не только теоретических основ, но и структуры и упорядочения собранного массива областей знаний. В 1974 году существовавшая на тот момент версия была использована при составлении библиографии литературы по классификации для журнала «International Classification». В 1977 году система была достаточно разработана, чтобы быть представленной на семинаре в Бангалоре (Индия)[4]. Первая публикация о Классификации кодирования информации вышла только в 1982 году[1], позднее она была напечатана и дополнена в Knowledge Organization[5] с трёхуровневой иерархией, однако она впоследствии устарела.

Принципы Классификации кодирования информации

В деталях 12 принципов изложены в книге Wissensorganisation. Entwicklung, Aufgabe, Anwendung, Zukunft[2] и статье Information Coding Classification. Geschichtliches, Prinzipien, Inhaltliches[6]. Здесь они кратко приводятся по темам:

  • Принцип 1: Понятийно-теоретические основы. Содержанием Классификации кодирования информации служат понятия, понимаемые как единицы знания. Как формируется понятие? Откуда возникают признаки/элементы знания? Как формируются связи между понятиями?
  • Принцип 2: Четыре типа связей между понятиями и их применение. Это отношения абстракции (род-вид), партиционирования (часть-целое), комплементарности и функциональные отношения.
  • Принцип 3: Использование десятичных чисел в качестве нотации (кодирования) — универсального языка.
  • Принцип 4: Девять слоёв бытия Классификации кодирования информации. Они сгруппированы по три в рамках неживой, живой и произведённой сущности:
    1. Форма и структура
    2. Энергия и материя
    3. Космос и Земля
    4. Биологическое бытие и жизнь
    5. Человеческое бытие и жизнь
    6. Социальное бытие и жизнь
    7. Материальные продукты — экономика и техника
    8. Интеллектуальные продукты — знания и информация
    9. Духовные продукты — культура и гуманитарные науки
  • Принцип 5: Деление областей знаний по девяти категориям, восходящим к аристотелевским формам. В системе они реализованы через универсальный план элементных позиций:
    1. Общее, теории, принципы (аксиоматические и структурные аспекты)
    2. Объекты: предметы, виды, части, свойства (аспект объекта)
    3. Деятельность: методы, процессы, активности (аспект активности)
    4. Особые свойства или проявления области знания
    5. Аспект личности или другое проявление области знания
    6. Социальный аспект или другое проявление области знания
    7. Внешние воздействия на область (инструментальный аспект)
    8. Применение методов в другой области (ресурсный аспект)
    9. Информация о области и синтетические социальные задачи (актуализационный аспект)
    Такой план был назван систематификатором, поскольку определяет систематику подчинённых понятий. Он был применён — хотя и не всегда последовательно — при построении системы[7][8].
  • Принцип 6: Слойная модель областей знаний, сформулированная в принципе 4, базируется на «теории интегративных уровней»: каждый слой интегрирован в следующий и одновременно служит его предпосылкой.
  • Принцип 7: Возможность комбинирования областей знаний (интер- и трансдисциплинарность) определяется планом элементных позиций[9].
  • Принцип 8: Верхний, нулевой уровень всей системы определяет категории как общие структурные понятия, чьи подразделения также могут анализироваться классификационно (ещё в доработке).
  • Принципы 9 и 10 касаются возможности сочетания кодов Классификации кодирования информации с такими по пространству и времени (разработка продолжается).
  • Принцип 11: Мнемотехника системы обеспечивается постоянством кодов для определённых позиций системы, а также 3×3 содержательными и формальными категориями.
  • Принцип 12: Предусмотренные системой возможности комбинаций (см. пункты 1, 8 и 9) обеспечивают её самоорганизацию в духе современной научной эволюции.

Классификация кодирования информации в матричной форме

Первые две ступени системы можно представить в виде следующей матрицы:

undefined

Первая иерархическая ступень — это девять содержательных категорий, показанных в первом столбце (коды 1–9).

На втором иерархическом уровне отдельные содержательные категории далее подразделяются по девяти функциональным формальным категориям, расположенным в верхней строке (коды 01–09; некоторые исключения описаны в принципе 7).

Исследования, связанные с Классификацией кодирования информации

Автоматическая классификация с использованием системы

В рамках попыток классификации веб-документов, над которыми работал в том числе Йенс Хартман (университет Карлсруэ), штатом Вальтера Коха (университет Грац) в 2010 году в институте «Angewandte Informationstechnik Forschungsgesellschaft mbh» (AIT) была проведена проверка применения Классификации кодирования информации для автоматической классификации метаданных примерно 350 000 документов. Работы были возможны благодаря данным, собранным в европейском проекте EuropeanaLocal[10]. Для исследования использовалась трёхуровневая иерархия системы с примерно 5000 терминами. Как следовало из отчёта аналитика Кристиана Мака[11], «степень классификации» достигла около 50 %, что Кох оценил как хороший результат для урезанного варианта системы. Для более высокой точности понадобилось бы 1–2 года. Одним из итогов работы стал реестр терминов с их кодами (указателями).

Data Linking с использованием Классификации кодирования информации

По результатам исследований итальянской группы (Тренто) о «пересмотре иерархии доменов Wordnet», использовавшей коды Десятичной классификации Дьюи, Эрнесто Уильям Де Лука и соавторы показали, что использование кодов Классификации кодирования информации обеспечивает более лаконичные результаты и описали это в работах Including Knowledge Domains from the ICC into the Multilingual Lexical Linked Data Cloud (LLD)[12] и «Die Multilingual Lexical Linked Data Cloud: Eine mögliche Zugangsoptimierung?»[13]. LLD использует метамодель, охватывающую все ресурсы с возможностью повторного поиска и навигации по данным с различных аспектов. Таким образом, работа по тысячам областей знаний (в Классификации кодирования информации) интегрируется с Multilingual Lexical Linked Data Cloud на основе RDF/OWL-репрезентации EuroWordNet и других лексических ресурсов (MultiWordNet, MEMODATA и базой данных Hamburg Metapher DB).

Семантическое структурирование Web с помощью ICC

В октябре 2013 года информатик Херманн Бензе заметил потенциал использования кодов Классификации кодирования информации для структурирования семантической паутины. Он предложил два подхода для наглядного отображения областей знаний и их подструктуры[14]. Включение третьего уровня находится в стадии разработки.

Применения Классификации кодирования информации

  1. Возможность крупного деления документов, особенно библиографий и справочников.
  2. Классификация персоналий по областям знаний[15].
  3. Помощь при составлении статистики по областям знаний — например, в университетской статистике, статистике академий, научных институтов, профессоров, преподавателей и т.д.
  4. В книгоиздательской отрасли публикации могут снабжаться кодами соответствующих областей знаний как первичной классификацией.
  5. Классификация кодирования информации может выступать нормативной системой для самых разных отраслей, особенно индустрии, управления знаниями, инжиниринга знаний.
  6. С помощью определений возможно создание лексикона всех областей знаний, который мог бы служить основой для аналогичных лексиконов на других языках[16].
  7. Система может служить основой для сопоставлений научных областей на европейском или мировом уровне.
  8. Подходит в качестве инструмента — «switching system» — для согласования различных универсальных классификаций в информационных науках[17].
  9. Также применима в качестве «подвесной системы» для частных классификаций, в том числе терминологических систем понятий.
  10. Первые три уровня и соответствующие пояснения могут использоваться в старшей школе для ознакомления учащихся с системой знаний и их взаимосвязями.
  11. По аналогии с Unified Medical Language System (UMLS) для медицины Классификация кодирования информации могла бы стать основой многоязыковой «Единая система областей знаний», обеспечивающей глобальное понимание структуры знаний.
  12. Алфавитный указатель ~5000 понятийных наименований на первых трёх уровнях может использоваться для разнообразных сопоставлений, например, сравнения с указателями для UDC и DDC, чтобы получить обзор по всем трём классификациям.

Примечания

  1. 1 2 Ingetraut Dahlberg (1982). “ICC – Information Coding Classification. Principles, structure and application possibilities”. International Classification. 2: 98—103.
  2. 1 2 Ingetraut Dahlberg. Wissensorganisation. Entwicklung, Aufgabe, Anwendung, Zukunft / Deutsche Sektion der Internationalen Gesellschaft für Wissensorganisation e. V. [ISKO]. — Würzburg : Ergon Verlag, 2014. — Vol. 3. — P. 82–100. — ISBN 978-3-95650-065-7.
  3. 1 2 Ingetraut Dahlberg. Grundlagen universaler Wissensordnung. Probleme und Möglichkeiten eines universalen Klassifikationssystems des Wissens. / Deutsche Gesellschaft für Dokumentation e. V.. — Pullach bei München : Verlag Dokumentation, 1974. — ISBN 3-11-141267-9.
  4. Ingetraut Dahlberg. Ontical Structures and Universal Classification / Sarada Ranganathan Endowment for Library Science. — Bangalore, 1978.
  5. International Classification and Indexing Bibliography (ICIB 1): Classification systems and thesauri 1950–1982 / Ingetraut Dahlberg. — Франкфурт : INDEKS Verlag, 1982.
  6. Ingetraut Dahlberg (2010). Marlies Ockenfeld, ed. “Information Coding Classification. Geschichtliches, Prinzipien, Inhaltliches”. Information, Wissenschaft & Praxis. De Gruyter. 61 (8): 449—454. ISSN 1619-4292.
  7. Пример его использования приведён в структуре литературы по классификации.
  8. Упрощённая схема с пояснением приведена в Ingetraut Dahlberg. Wissensorganisation. Entwicklung, Aufgabe, Anwendung, Zukunft / Deutsche Sektion der Internationalen Gesellschaft für Wissensorganisation e. V. [ISKO]. — Würzburg : Ergon Verlag, 2014. — Vol. 3. — P. 71. — ISBN 978-3-95650-065-7.
  9. Примеры приведены в Ingetraut Dahlberg. Wissensorganisation. Entwicklung, Aufgabe, Anwendung, Zukunft / Deutsche Sektion der Internationalen Gesellschaft für Wissensorganisation e. V. [ISKO]. — Würzburg : Ergon Verlag, 2014. — Vol. 3. — P. 103–104. — ISBN 978-3-95650-065-7.
  10. EuropeanaLocal. Дата обращения: 12 июня 2024.
  11. Christian Mak. Kategorisierung des Datenbestandes der EuropeanaLocal-Österreich anhand der ICC. — Graz, 2011.
  12. Ernesto William DeLuca et al. Including Knowledge Domains from the ICC into the Multilingual Lexical Linked Data Cloud. — Краков, Польша, 2014. — P. 258–365.
  13. Ernesto William DeLuca; et al. (2014). “Die Multilingual Lexical Linked Data Cloud: Eine mögliche Zugangsoptimierung?”. Information, Wissenschaft & Praxis. De Gruyter. 65 (4—5): 279—287. ISSN 1619-4292.
  14. Графическое отображение областей знаний первых двух уровней можно найти по адресу Ontology4
  15. Who’s Who in Classification and Indexing / Ingetraut Dahlberg. — Франкфурт : INDEKS Verlag, 1983.
  16. Ingetraut Dahlberg (2012). “A systematic new lexicon of all knowledge fields based on the Information Coding Classification”. Knowledge Organisation. 39 (2): 142—150.
  17. Ingetraut Dahlberg. Library catalogs and the Internet. Switching for future subject access. / Green, R.. — Франкфурт : INDEKS Verlag, 1996. — P. 155–165.