Распознавание эмоций в диалоге
Распознавание эмоций в диалоге (англ. Emotion recognition in conversation, ERC) — это подраздел области распознавание эмоций, посвящённый извлечению человеческих эмоций из бесед или диалогов, в которых участвуют два и более собеседника[1]. Датасеты для этой области обычно получают из социальных платформ, предоставляющих большое количество свободных образцов, и часто включают мультимодальные данные (например, различные комбинации текстовой, визуальной и акустической информации)[2]. Само- и межличностные влияния играют критическую роль[3] в идентификации базовых эмоций, таких как страх, гнев, радость, удивление и др. Чем более детализированы метки эмоций, тем сложнее корректно определить эмоцию. ERC ставит ряд задач[1], таких как моделирование контекста диалога, состояния собеседника, наличие сарказма в беседе, смена эмоций в последовательных репликах одного и того же собеседника, а также проблемы мультиязычности, кросс-культурной адаптации, интерпретируемости моделей и моделирования долгосрочной динамики эмоций[4].
Современные исследования в области распознавания эмоций демонстрируют смену парадигмы: фокус смещается с дискриминативного распознавания по ограниченному набору базовых меток на генеративное понимание эмоций и распознавание с открытым словарём (OV-MER). В контексте ERC это означает переход от анализа индивидуальных проявлений к сложным сценариям диалогического взаимодействия с использованием мультимодальных больших языковых моделей[5][6].
Задача
Задача ERC заключается в обнаружении эмоций, выражаемых участниками в каждой реплике диалога. ERC опирается на три основных
— контекст беседы, психическое состояние собеседников и их намерения[1].
На практике психическое состояние и намерения говорящего моделируются с помощью интеграции внешних баз знаний здравого смысла (например, COMET и ATOMIC). Намерения извлекаются как контекстные признаки из этих баз и интегрируются в модели с помощью графовых трансформеров и механизмов динамического внимания[7][8].
Формально задача распознавания эмоций в диалоге определяется следующим образом. Обучающий набор данных представляется как . Каждый диалог состоит из последовательности высказываний , где каждое высказывание является последовательностью токенов. Каждому высказыванию соответствует идентификатор говорящего , что позволяет отслеживать изменение настроения конкретного участника беседы. Контекст включает в себя исторические высказывания и может содержать вспомогательную информацию о говорящих. Цель задачи — обучить предиктор , который на основе входных данных предсказывает для каждого высказывания метку эмоции из пространства возможных эмоций [9][10].
Датасеты
IEMOCAP[11], SEMAINE[12], DailyDialogue[13], и MELD[14] — четыре наиболее часто используемых датасета в ERC. Среди них MELD включает многопользовательские диалоги. Датасет IEMOCAP, считающийся одним из наиболее сложных для распознавания эмоций, использовался для тестирования отечественной технологии CA-SER[15][16]. Для обучения системы MASAI применяются российские наборы данных, включая многомодальную базу RAMAS и специализированную базу по выражению агрессии[17].
Методы
Подходы к ERC включают методы без учителя, полубеспечиваемые и с учителем[18]. К популярным методам с учителем относят использование или объединение заранее заданных признаков, рекуррентные нейронные сети[19] (например, DialogueRNN[20]), графовые свёрточные сети (например, DialogueGCN[21]), а также иерархичные сети памяти с вниманием[22]. Большинство современных методов ERC базируются на технологиях глубокого обучения, опираясь на латентное моделирование состояния собеседника. Для эффективного разделения близких эмоциональных классов (например, «гнева» и «отвращения») применяются методы контрастивного обучения, проецирующие признаки в латентное пространство, где примеры одной эмоции сближаются, а разных — отдаляются[23][24]. В качестве эффективной альтернативы для обработки длинных диалогов используются модели пространства состояний (например, Mamba)[25].
Мультимодальное слияние
Для интеграции различных типов данных применяются несколько основных подходов к слиянию. Раннее слияние объединяет признаки разных модальностей на начальном этапе. Позднее слияние подразумевает независимую обработку каждой модальности отдельными моделями с последующим объединением их решений на финальном этапе. Гибридное слияние комбинирует ранний и поздний подходы[26]. Среди современных методов активно используются трансформеры с кросс-модальным вниманием, которые динамически оценивают важность каждой модальности и эффективно моделируют сложные зависимости между текстом, аудио и видео[26]. Мультимодальные подходы обладают рядом преимуществ, включая повышение точности за счёт объединения взаимодополняющей информации, а также устойчивость к шуму и потере данных, что позволяет системе сохранять надёжность распознавания даже при отсутствии или искажении одной из модальностей[26].
Моделирование контекста и зависимостей
В системах распознавания эмоций в диалоге применяются методы моделирования внутриличностной и межличностной зависимостей. Внутриличностная зависимость (эмоциональная инерция) учитывает индивидуальную динамику состояния говорящего. Для её моделирования используются выделенные рекуррентные сети для каждого участника, графовые сети для сохранения временной непрерывности эмоций, а также контрастивное выравнивание с учётом черт личности. Межличностная зависимость отражает взаимовлияние собеседников и моделируется через разделение контекста окружения, графовые сети взаимодействия для передачи эмоций между участниками, а также интеграцию знаний здравого смысла[27]..
Для балансировки локального и глобального контекста применяются механизмы иерархического внимания и скользящих окон. Иерархическое внимание реализуется через многоуровневые архитектуры, объединяющие внутримодальное и межмодальное внимание для захвата долгосрочных зависимостей. Скользящие окна (в том числе асимметричные) используются для ограничения локального контекста при построении графов, что позволяет эффективно выделять краткосрочные эмоциональные сигналы[28]..
Для интерпретации скрытых эмоций и понимания причинно-следственных связей в модели интегрируются базы знаний здравого смысла (такие как ATOMIC, ConceptNet и COMET). Внешние знания помогают связывать поверхностные языковые сигналы с неявными эмоциями, предсказывать намерения говорящего и возможные реакции слушателей. Интеграция этих данных осуществляется через графовые структуры, большие языковые модели и специализированные механизмы внимания, фильтрующие информацию для снижения уровня шума[29].[30][31].
Распознавание причины эмоции в диалоге
В последнее время выделяется новая задача — распознавание причины эмоции в диалоге[32]. Решения этой задачи основаны на механизмах вопросно-ответных систем с использованием языковых моделей. RECCON[32] — один из ключевых датасетов для этой задачи. Для распознавания эмоций в диалогах активно применяются алгоритмы причинно-следственного вывода (Causal Inference), контрфактуального анализа и структурные каузальные модели (SCM), позволяющие выявлять причинно-следственные связи при генерации эмоций[33]. В рамках обеспечения интерпретируемости (Explainable AI) используются графовые модели с механизмами внимания. Например, сеть ECGN (Emotional Contagion Graph Network) объясняет связи между высказываниями-стимулами и эмоциональным откликом через построение гетерогенного графа «эмоционального заражения» и вычисление весов внимания[34].
Применение
Современные сферы применения распознавания эмоций в диалоге (ERC) включают автоматический анализ мнений, обеспечение эмоциональной осведомлённости диалоговых агентов и анализ эмоций в сфере поддержки клиентов. Отдельно выделяется применение ERC в мониторинге психического здоровья и терапевтических практиках[35]. В частности, для ранней диагностики депрессии, тревожности и расстройств, связанных со стрессом, используются высокоточные ЭЭГ-алгоритмы (с точностью до 99,99 %)[36][37].