Лемматизация
Лемматизация (чеш. Lemmatizace) — это определение леммы (основной словоформы) для флексивной формы слова. Лемматизатор — это инструмент (например, компьютерная программа), который сопоставляет конкретной форме слова его основной вид, так называемую лемму[1].
Дополнительной функцией лемматизатора являются сведения о грамматических категориях (например, существительных и глагольных) для данной словоформы[2]. Например, для формы «barvě» лемматизатор возвращает лемму «barva», а также дополнительную информацию: имя существительное, женский род, единственное число, 3./6. падеж.
Лемматизация, например, используется для поиска в полнотекстовых базах данных. Для полнотекстового поиска также применяются схожие по структуре данные, используемые для автоматической проверки орфографии (например, словари для hunspell)[3].
Использование лемматизации
- Полнотекстовый поиск: например, для введённой фразы «sběrný dvůr» (сборный двор) также будут найдены документы, содержащие эти слова в других падежах и числах (sběrné dvory, umístění sběrných dvorů)[4].
- Корпусная лингвистика: сведения из морфологического анализатора используются при разметке корпусов[5]. Лемматизацию использует программа QUITA (Quantitative Index Text Analyzer), способная анализировать большие тексты, например, оценивать богатство словарного запаса и другие лингвистические показатели[6].
- Другим инструментом, использующим лемматизацию, является латентный семантический анализ (LSA). «Латентный семантический анализ — это техника, которая отображает документы и запросы в пространство латентных семантических измерений, при этом слова, которые семантически схожи (по степени совместной встречаемости в документах), проецируются в одни и те же измерения, а различающиеся слова — в разные»[7]. LSA для каждого слова создаёт отдельное измерение, так что документы могут находиться в сотнях тысяч измерений. Лемматизация здесь полезна для сведения количества слов к минимуму, переводя все слова к базовой форме. Это предотвращает создание раздельных измерений для одной и той же лексемы в различных формах. «Благодаря этому высокую семантическую схожесть могут иметь даже документы (или запросы и документы), не содержащие общих слов»[7].
Проблемы лемматизации
Некоторые слова являются многозначными (например, в чешском: ženu, stát, tancích), и если лемматизатор не учитывает или не может учесть контекст, то он не способен выбрать нужное значение. Например, «Jeden z nejhodnotnějších zdrojů o maďarských tancích» («Один из самых ценных источников о венгерских танках») может быть обработан так: «Jeden/есть z hodnotný zdroj o maďarský tank/танец».
Сложностью также является обработка словосочетаний, то есть попытки выделить леммы там, где это невозможно; например, вежливая просьба Dovolíte? («Вы позволите?») не встречается ни в одном из зарегистрированных значений слова dovolit, кроме того, это могут быть фразеологизмы (например, nechat na holičkách — бросить в беде), либо идиомы (например, z někoho si vystřelit — подшутить над кем-то)[1].
Доступные лемматизаторы для чешского языка
Неполный перечень по данным бакалаврской работы «Лемматизация чешского языка»[6]:
Чешские лемматизаторы
Примечания
Литература
- BYDŽOVSKÝ, Dominik. Lemmatizace češtiny. 2017. Бакалаврская работа. Факультет информатики и управления Университета Градец-Кралове. Руководитель: Мгр. Иржи Хавигер, Ph.D.