Компьютерный аудиционный анализ

Компьютерный аудиционный анализ — направление исследований, посвящённое разработке алгоритмов и систем для интерпретации аудиосигналов с помощью машин[1][2]. Поскольку понятие того, что означает «слышать» для машины, довольно широкое и неоднозначное, компьютерный аудиционный анализ объединяет ряд дисциплин, которые изначально решали специфические задачи или были ориентированы на конкретные применения. Инженер Парис Смарагдис в интервью журналу Technology Review отмечает, что подобные системы включают «программное обеспечение, использующее звук для локализации людей в помещении, мониторинга оборудования для предупреждения о поломках либо активации дорожных камер при происшествиях»[3].

Вдохновлённый моделями слуха человека, компьютерный аудиционный анализ затрагивает вопросы представления, трансдукции, группировки, использования музыкальных знаний и общей звуковой семантики с целью реализации интеллектуальных операций над аудиосигналами и музыкальными сигналами компьютером. Для этого применяются методы из областей обработки сигналов, аудиторного моделирования, музыкального восприятия и когнитивных наук, распознавание образов и машинное обучение, а также методы классического искусственного интеллекта для представления музыкальных знаний[4][5].

Применения

Подобно тому как компьютерное зрение отличается от обработки изображений, компьютерный аудиционный анализ рассматривает не столько обработку, сколько осмысленное понимание аудиосигналов. В отличие от области автоматического понимания речи, акцент делается на анализ произвольных аудиосигналов, в том числе природных звуков и музыкальных записей.

Области применения компьютерного аудиционного анализа включают поиск звуков, распознавание жанров музыки, акустический мониторинг, транскрипцию музыки, слежение по партитуре, анализ аудиотекстуры, импровизацию, распознавание эмоций по аудиосигналу и др.

Родственные дисциплины

Компьютерный аудиционный анализ пересекается со следующими дисциплинами:

  • Извлечение информации из музыки: методы поиска и анализа сходства между музыкальными сигналами.
  • Аудиторный сценический анализ: понимание и описание источников и событий в аудио.
  • Вычислительная музикология и математическая теория музыки: применение алгоритмов, опирающихся на музыкальные знания, для анализа музыкальных данных.
  • Компьютерная музыка: применение вычислительной техники в творческих музыкальных задачах.
  • Машинное музицирование: интерактивные музыкальные системы, управляемые анализом звука.

Области исследования

Поскольку аудиосигналы распознаются человеческой системой «ухо — мозг», эту сложную перцептивную систему необходимо в определённом смысле смоделировать программно для реализации «машинного прослушивания». Иначе говоря, для сопоставимого с человеческим уровня анализа компьютер должен «слышать» и «понимать» аудиосодержимое. Такой анализ требует объединения задач из электротехники (спектральный анализ, фильтрация и аудиотрансформации), искусственного интеллекта (машинное обучение и классификация звуков)[6], психоакустику (восприятие звука), когнитивные науки (нейронаука и искусственный интеллект)[7], акустику (физика звукообразования) и музыку (гармония, ритм, тембр). Кроме того, любые аудиотрансформации — такие как сдвиг высоты тона, растяжение времени или фильтрация — должны быть перцептивно и музыкально осмысленными. Для этого требуются понимание спектральных моделей, вычисление характеристик высокого уровня и анализ/синтез звука. Структурирование и кодирование аудиоконтента (звука и метаданных) выгодно с применением эффективных схем сжатия, отбрасывающих неслышимую информацию[8]. Вычислительные модели музыкального и аудиовосприятия могут привести к более содержательному представлению, более интуитивной цифровой обработке и генерации звука в музыкальных пользовательских интерфейсах.

Исследования в области компьютерного аудиционного анализа условно разбиваются на следующие подзадачи:

  1. Представление: сигнальное и символьное. Анализ времени-частоты, нотационных и спектральных моделей, включая синтез паттернов и аудиотекстуры.
  2. Извлечение признаков: дескрипторы звука, сегментация, детектирование атак (onset), определение высоты и огибающей, хрома и аудиотрансформационные модели.
  3. Структуры музыкальных знаний: анализ тональности, ритма и гармоний.
  4. Сходство звуков: методы сравнения, идентификации, обнаружения новизны, сегментации и кластеризации.
  5. Моделирование последовательностей: сопоставление и выравнивание сигналов и ното-графических последовательностей.
  6. Сепарация источников: группировка одновременных звуков, например, определение нескольких высот тона, кластеризация в частотно-временной области.
  7. Аудиторная когниция: моделирование эмоций, ожиданий, узнаваемости, аудиторных сюрпризов и анализа музыкальной структуры.
  8. Мультимодальный анализ: поиск соответствий между текстовыми, визуальными и аудиосигналами.

Вопросы представления

Компьютерный аудиционный анализ работает с аудиосигналами, которые могут быть представлены разными способами: от прямого кодирования цифрового звука в несколько каналов до символических инструкций для синтеза. Обычно аудиосигналы хранятся как аналоговые либо цифровые данные. Цифровая запись может представлять собой отсчёты волновой формы или параметры компрессии звука. Особенность музыкальных сигналов заключается в их полирепрезентативности: например, используются графические партитуры и последовательности исполнительских действий в формате MIDI.

Поскольку аудиосигналы часто содержат несколько источников, в отличие от речевых сигналов (для которых эффективны специализированные модели, например, модель источник—фильтр), сложно построить универсальное параметрическое представление для произвольного аудио. Как правило, такие представления строятся на использовании банков фильтров или синусоидальных моделей, которые могут увеличивать размер представления для захвата внутренней структуры звука. Для аудиционного анализа также важны текстовые описания контента (аннотации, отзывы), а также визуальные данные при наличии аудиовизуального материала.

Признаки

Описывать содержимое сложных аудиосигналов возможно только после извлечения информативных признаков, отражающих отдельные аспекты сигнала. Признаки бывают сигнальными и математическими (энергия, спектральная форма), статистическими (детектирование изменений, событий), а также специальными, лучше согласованными с восприятием музыкальных сигналов или особенностями слуховой системы, такими как логарифмический рост чувствительности (полоса пропускания) на частоте, либо инвариантность по октаве (хрома).

Поскольку параметрические модели требуют описания множества свободных параметров, признаки позволяют компактно выразить основные характеристики сложной структуры аудиосигнала.

Музыкальные знания

Определение музыкальных структур возможно на основе музыкальных знаний и методов машинного обучения. Например, выявление тональности по распределению частот, соответствующих нотам, определение структуры ритма по распределению атак, анализ гармоний по энергетическим характеристикам в диапазонах частот.

Сходство звука и моделирование последовательностей

Сравнивать звуки можно через сравнение признаков, с учётом или без учёта временной структуры. В ряде случаев критерий похожести формируется как близость признаков, в других — важно учитывать динамику, для чего применяется динамическое временное выравнивание (DTW), компенсирующее различия во временной структуре событий. Выделение повторов или схожих подпоследовательностей важно при решении задач текстурного синтеза и импровизации.

Сепарация источников

Одной из фундаментальных особенностей аудиосигналов является наличие нескольких одновременно звучащих источников (инструменты, речь, шумы, голоса животных). Идентификация и выделение отдельных источников остаются сложной нерешённой задачей. На практике применяются разные методы: использование корреляции между каналами в многоканальных записях; специальные техники спектрального анализа для стереосигналов; обучение и кластеризация признаков даже в монозаписи, например, отслеживание гармонически связанных частичных для множественного определения высоты тона. В некоторых случаях прибегают к поиску наименее сложных представлений данных, раскрывающих внутреннюю структуру без явной разметки по объектам, например, описанию аудиосцен набором тоновых паттернов, их траекторий и акустических контуров (аккордов, многоголосия)[9].

Аудиторная когниция

Прослушивание музыки и звуков — зачастую нецелевая деятельность. Люди получают удовольствие от прослушивания по слабо изученным причинам, связанным с эмоциями, ожиданиями и их оправданием или нарушением (музыка и эмоции). Животные реагируют на опасность и неожиданные изменения в звуке. Это требует, чтобы компьютерный анализ аудио включал адаптацию к изменяющейся акустической обстановке и мониторинг структуры событий: анализ повторяемости, самоподобие аудиосигнала, предсказание динамики признаков.

Мультимодальный анализ

Для описания музыки используются текстовые данные (нотации, рецензии), реакции пользователя (эмоциональные отклики, психофизиологические измерения), визуальная информация (для аудиовизуальных данных). Компьютерный аудиционный анализ стремится выявлять связи между этими представлениями для более полного понимания звукового материала.

Примечания

  1. Machine Audition: Principles, Algorithms and Systems : [англ.]. — IGI Global, 2011. — ISBN 9781615209194.
  2. Machine Audition: Principles, Algorithms and Systems (англ.). Дата обращения: 20 июня 2024.
  3. Paris Smaragdis taught computers how to play more life-like music (англ.). MIT Technology Review. Дата обращения: 20 июня 2024.
  4. Tanguiane (Tangian), Andranick. Artificial Perception and Music Recognition : [англ.]. — Berlin-Heidelberg : Springer, 1993. — Vol. 746. — ISBN 978-3-540-57394-4.
  5. Tanguiane (Tangian), Andranick (1994). “A principle of correlativity of perception and its application to music recognition”. Music Perception [англ.]. 11 (4): 465—502. DOI:10.2307/40285634. JSTOR 40285634.
  6. Kelly, Daniel; Caulfield, Brian (февраль 2015). “Pervasive Sound Sensing: A Weakly Supervised Training Approach”. IEEE Transactions on Cybernetics [англ.]. 46 (1): 123—135. DOI:10.1109/TCYB.2015.2396291. HDL:10197/6853. PMID 25675471. S2CID 16042016. Дата обращения 2024-06-20. Проверьте дату в |date= (справка на английском)
  7. Purwins, Hendrik (2008). “Computational models of music perception and cognition I: The perceptual and cognitive processing chain”. Physics of Life Reviews [англ.]. 5 (3): 151—168. Дата обращения 2024-06-20.
  8. Machine Listening Course Webpage at MIT (англ.). Дата обращения: 20 июня 2024.
  9. Tanguiane (Tangian), Andranick (1995). “Towards axiomatization of music perception”. Journal of New Music Research [англ.]. 24 (3): 247—281. DOI:10.1080/09298219508570685.