FMLLR

Максимально вероятная линейная регрессия в пространстве признаков (англ. Feature space Maximum Likelihood Linear Regression, FMLLR) — глобальное преобразование признаков, традиционно применяемое с целью адаптации к конкретному говорящему. Метод FMLLR осуществляет преобразование акустических признаков в адаптированные к говорящему признаки посредством операции умножения на матрицу преобразования. В ряде публикаций FMLLR также называют ограниченной максимально вероятной линейной регрессией (англ. Constrained Maximum Likelihood Linear Regression, CMLLR).

Обзор

Преобразования FMLLR обучаются по принципу максимального правдоподобия на данных для адаптации. Существуют различные способы оценки преобразований, однако в FMLLR рассматривается только метод максимального правдоподобия (МП-оценивание). Преобразование FMLLR обучается на выбранном наборе данных для адаптации так, чтобы максимизировать вероятность этих данных при текущем наборе моделей.

Данная техника широко применяется для адаптации к говорящему в системах на основе скрытых марковских моделей (СММ) для распознавания речи[1][2]. Позднейшие исследования[3] показывают, что FMLLR предоставляет эффективные акустические признаки и для гибридных моделей распознавания речи на основе глубоких нейронных сетей и СММ (DNN/HMM)[4].

К преимуществам метода FMLLR относятся:

  • Процесс адаптации может выполняться на этапе предварительной обработки и не зависит от обучения и декодирования системы автоматического распознавания речи — АСР.
  • Данный вид адаптированных признаков может применяться в глубоких нейронных сетях (ГНС) как замена традиционно используемому мел-спектрограмме в сквозных моделях распознавания речи.
  • Адаптация по говорящему с помощью FMLLR обычно приводит к существенному приросту производительности моделей АСР, часто превосходя другие методы преобразований или признаков, такие как MFCC (мел-частотные кепстральные коэффициенты) и FBANK (коэффициенты фильтровых банков).
  • Признаки FMLLR реализуются эффективно с помощью речевых инструментов, например Kaldi.

Основная проблема и недостаток FMLLR:

  • При недостаточном объёме данных для адаптации матрицы преобразования склонны к переобучению на имеющихся данных.

Вычисление преобразования FMLLR

Преобразование признаков FMLLR можно легко вычислить с помощью открытого речевого инструментария Kaldi. Скрипт Kaldi реализует стандартную схему оценки, описанную в приложении B оригинальной статьи[1], в частности, в разделе B.1 «Прямой метод по строкам».

В формулировке Kaldi FMLLR — это аффинное преобразование признаков вида , которое можно записать как , где — это акустический признак с добавленной 1. Отметим, что в некоторых работах встречается иной порядок: .

Достаточной статистикой при этом является:

где — обратная ковариационная матрица.

А для , где — размерность признакового пространства:

Для подробного обзора и описания методов оценки FMLLR см. оригинальную статью “Maximum likelihood linear transformations for HMM-based speech recognition”[1].

Следует отметить, что скрипт Kaldi, осуществляющий преобразование признаков по FMLLR, отличается от методики[1] использованием столбца матрицы, обратной к кофакторной строке. Иными словами, множитель детерминанта игнорируется, поскольку он не влияет на результат преобразования и может привести к численным переполнениям или «исчезновению точности».

Сравнение с другими признаками и преобразованиями

Экспериментальные результаты показывают, что использование признаков FMLLR в распознавании речи обеспечивает устойчивое превосходство над другими акустическими признаками на различных общепринятых тестовых наборах (TIMIT, LibriSpeech и др).

В частности, признаки FMLLR превосходят MFCC и FBANK за счёт процедур адаптации к говорящему[3].

В работе[3] приведены значения процента ошибок по фонемам (PER, %) для тестового набора TIMIT на различных нейронных архитектурах:

Результаты PER, полученные с помощью PyTorch-Kaldi[3]
Модель / Признаки MFCC FBANK FMLLR
MLP 18.2 18.7 16.7
RNN 17.7 17.2 15.9
LSTM 15.1 14.3 14.5
GRU 16.0 15.2 14.9
Li-GRU 15.3 14.9 14.2

Как видно, признаки FMLLR превосходят MFCC и FBANK независимо от архитектуры модели.

Здесь MLP (многослойный перцептрон) выступает в роли базовой модели, а RNN, LSTM и GRU — наиболее распространённые рекуррентные архитектуры.

Li-GRU[5] использует одну управляющую функцию и, по сравнению с обычной GRU, позволяет сократить объём вычислений на 33 %, а также эффективно решает проблему «затухающего градиента» в рекуррентных моделях.

Лучшие показатели достигаются на признаках FMLLR с моделью Li-GRU.

Примечания

  1. 1 2 3 4 M.J.F. Gales (1998-04). “Maximum likelihood linear transformations for HMM-based speech recognition”. Computer Speech & Language [англ.]. 12 (2): 75—98. DOI:10.1006/csla.1998.0043. Дата обращения 2024-06-12. Проверьте дату в |date= (справка на английском); |access-date= требует |url= (справка)
  2. Rapid Feature Space Speaker Adaptation for Multi-Stream HMM-Based Audio-Visual Speech Recognition (англ.). IEEE Xplore. IEEE (2005). Дата обращения: 12 июня 2024. Архивировано 30 ноября 2024 года.
  3. 1 2 3 4 Mirco Ravanelli;Titouan Parcollet;Yoshua Bengio. The PyTorch-Kaldi Speech Recognition Toolkit (англ.). arXiv (18 ноября 2018). Дата обращения: 12 июня 2024. Архивировано 8 марта 2022 года.
  4. Li, Longfei. Hybrid Deep Neural Network--Hidden Markov Model (DNN-HMM) Based Speech Emotion Recognition // 2013 Humaine Association Conference on Affective Computing and Intelligent Interaction : [англ.] / Longfei Li, Yong Zhao, Dongmei Jiang … [et al.]. — IEEE, сентябрь 2013. — P. 312–317. — ISBN 978-0-7695-5048-0. — doi:10.1109/acii.2013.58.
  5. Ravanelli, Mirco; Brakel, Philemon; Omologo, Maurizio; Bengio, Yoshua (20 августа 2017). “Improving Speech Recognition by Revising Gated Recurrent Units”. Interspeech 2017 [англ.]. ISCA: 1308—1312. DOI:10.21437/interspeech.2017-775. Архивировано из оригинала 2022-01-22. Дата обращения 2024-06-12. Используется устаревший параметр |url-status= (справка)