Лемматизация

Лемматизация (чеш. Lemmatizace) — это определение леммы (основной словоформы) для флексивной формы слова. Лемматизатор — это инструмент (например, компьютерная программа), который сопоставляет конкретной форме слова его основной вид, так называемую лемму[1].

Дополнительной функцией лемматизатора являются сведения о грамматических категориях (например, существительных и глагольных) для данной словоформы[2]. Например, для формы «barvě» лемматизатор возвращает лемму «barva», а также дополнительную информацию: имя существительное, женский род, единственное число, 3./6. падеж.

Лемматизация, например, используется для поиска в полнотекстовых базах данных. Для полнотекстового поиска также применяются схожие по структуре данные, используемые для автоматической проверки орфографии (например, словари для hunspell)[3].

Использование лемматизации

  1. Полнотекстовый поиск: например, для введённой фразы «sběrný dvůr» (сборный двор) также будут найдены документы, содержащие эти слова в других падежах и числах (sběrné dvory, umístění sběrných dvorů)[4].
  2. Корпусная лингвистика: сведения из морфологического анализатора используются при разметке корпусов[5]. Лемматизацию использует программа QUITA (Quantitative Index Text Analyzer), способная анализировать большие тексты, например, оценивать богатство словарного запаса и другие лингвистические показатели[6].
  3. Другим инструментом, использующим лемматизацию, является латентный семантический анализ (LSA). «Латентный семантический анализ — это техника, которая отображает документы и запросы в пространство латентных семантических измерений, при этом слова, которые семантически схожи (по степени совместной встречаемости в документах), проецируются в одни и те же измерения, а различающиеся слова — в разные»[7]. LSA для каждого слова создаёт отдельное измерение, так что документы могут находиться в сотнях тысяч измерений. Лемматизация здесь полезна для сведения количества слов к минимуму, переводя все слова к базовой форме. Это предотвращает создание раздельных измерений для одной и той же лексемы в различных формах. «Благодаря этому высокую семантическую схожесть могут иметь даже документы (или запросы и документы), не содержащие общих слов»[7].

Проблемы лемматизации

Некоторые слова являются многозначными (например, в чешском: ženu, stát, tancích), и если лемматизатор не учитывает или не может учесть контекст, то он не способен выбрать нужное значение. Например, «Jeden z nejhodnotnějších zdrojů o maďarských tancích» («Один из самых ценных источников о венгерских танках») может быть обработан так: «Jeden/есть z hodnotný zdroj o maďarský tank/танец».

Сложностью также является обработка словосочетаний, то есть попытки выделить леммы там, где это невозможно; например, вежливая просьба Dovolíte? («Вы позволите?») не встречается ни в одном из зарегистрированных значений слова dovolit, кроме того, это могут быть фразеологизмы (например, nechat na holičkách — бросить в беде), либо идиомы (например, z někoho si vystřelit — подшутить над кем-то)[1].

Доступные лемматизаторы для чешского языка

Неполный перечень по данным бакалаврской работы «Лемматизация чешского языка»[6]:

Чешские лемматизаторы

Зарубежные лемматизаторы

Другие инструменты

  • QUITA[19] (Quantitative Index Text Analyzer)
  • RDRPOSTagger[20] (Ripple Down Rules Part-Of-Speech Tagger — теггер, основанный на Ripple Down Rules)

Примечания

  1. 1 2 Словарь понятий (чеш.). Чешский национальный корпус. Český národní korpus. Дата обращения: 17 июня 2024. Архивировано 11 июля 2025 года.
  2. Русинова, Зденка. Морфологический анализ // Новый энциклопедический словарь чешского языка : [чеш.] / Зденка Русинова, Петкевич, Владимир. — Прага : Nakladatelství Lidové noviny, 2017. — ISBN 978-80-7422-480-5.
  3. Elasticsearch: Ищем красиво по-чешски (и также по-словацки) (чеш.). Zdroják.cz. Zdroják.cz (4 сентября 2013). Дата обращения: 17 июня 2024. Архивировано 16 августа 2021 года.
  4. Чешский лемматизатор: зачем и главное как? (чеш.). ComputerWorld.cz. Дата обращения: 17 июня 2024. Архивировано 18 июня 2021 года.
  5. Морфологический анализатор чешского языка (чеш.). Masarykova univerzita, Fakulta informatiky. Дата обращения: 17 июня 2024.
  6. 1 2 Лемматизация чешского языка (чеш.). Masarykova univerzita, Fakulta informatiky. Дата обращения: 17 июня 2024.
  7. 1 2 Семантический анализ текстов (чеш.). SBlog.cz. Дата обращения: 17 июня 2024. Архивировано 4 мая 2016 года.
  8. Ajka (чеш.). Масариков университет. Дата обращения: 17 июня 2024. Архивировано 14 октября 2022 года.
  9. Majka (чеш.). Масариков университет. Дата обращения: 17 июня 2024. Архивировано 8 августа 2025 года.
  10. Morče (чеш.). Карлов университет, Институт формальной и прикладной лингвистики. Дата обращения: 17 июня 2024. Архивировано 5 мая 2025 года.
  11. MorphoDiTa (чеш.). Карлов университет, Институт формальной и прикладной лингвистики. Дата обращения: 17 июня 2024. Архивировано 4 июня 2025 года.
  12. Czech HMM tagger (чеш.). Карлов университет. Дата обращения: 17 июня 2024. Архивировано 12 февраля 2018 года.
  13. Czech "Free" Morphology (чеш.). Карлов университет. Дата обращения: 17 июня 2024. Архивировано 12 февраля 2018 года.
  14. Morfo (чеш.). Карлов университет. Дата обращения: 17 июня 2024. Архивировано 26 февраля 2024 года.
  15. Cistern (англ.). LMU München. Дата обращения: 17 июня 2024.
  16. Lemming (англ.). LMU München. Дата обращения: 17 июня 2024. Архивировано 19 сентября 2016 года.
  17. Marmot (англ.). LMU München. Дата обращения: 17 июня 2024. Архивировано 4 августа 2025 года.
  18. LemmaGen (англ.). IJS. Дата обращения: 17 июня 2024. Архивировано 6 июня 2017 года.
  19. QUITA (англ.). RAM-Verlag. Дата обращения: 17 июня 2024. Архивировано 25 июня 2025 года.
  20. RDRPOSTagger (англ.). SourceForge. Дата обращения: 17 июня 2024.

Литература

  • BYDŽOVSKÝ, Dominik. Lemmatizace češtiny. 2017. Бакалаврская работа. Факультет информатики и управления Университета Градец-Кралове. Руководитель: Мгр. Иржи Хавигер, Ph.D.