Генерация аудио

Генерация аудио — направление генеративного искусственного интеллекта, связанное с созданием звукового сигнала с помощью вычислительных моделей. В зависимости от задачи результатом генерации может быть речь, музыка, звуковой эффект, фоновая акустическая сцена или иной тип аудиоданных. В научной литературе генерация аудио рассматривается как часть более широкой области обработки аудиосигналов методами глубокого обучения, где синтез и преобразование звука изучаются наряду с распознаванием речи, поиском музыкальной информации и детектированием звуков окружающей среды[1].

История

Переход к нейросетевым методам

Компьютерный синтез звука развивался задолго до появления нейросетевых моделей, однако современный этап связан с распространением глубокого обучения. В синтезе речи этот переход выразился в движении от конкатенативных и статистических параметрических систем к нейросетевым архитектурам, способным создавать более естественную и выразительную речь. Одной из первых нейросетевых моделей, работавших непосредственно со звуковой волной, стала WaveNet, представленная лабораторией DeepMind в 2016 году. Модель предсказывала отсчёты сигнала авторегрессионно и позволила существенно приблизить синтетическую речь к естественной[2].

Дискретные представления и текстовое управление

В начале 2020-х годов сложился подход, при котором аудио описывается как последовательность дискретных токенов, а генерация сводится к задаче языкового моделирования. Такой принцип реализован в модели AudioLM, продолжающей звуковую последовательность на уровне токенов[3].

В 2023 году на конференциях ICLR и ICML были представлены модели генерации звука по текстовому описанию, реализующие два разных подхода: авторегрессионный трансформер над дискретными токенами в AudioGen[4] и латентную диффузию в AudioLDM[5].

Коммерциализация и правовое урегулирование

С конца 2023 года генерация музыки вышла за пределы исследовательских лабораторий: публичные сервисы сделали синтез песен с вокалом доступным массовому пользователю, что вызвало серию судебных разбирательств с правообладателями[6].

К 2026 году сложились новые отраслевые правила обучения моделей. Практика обучения на масштабных неразмеченных массивах аудио из открытых источников стала для коммерческих проектов практически невозможной: лейблы начали продавать доступ к каталогам на условиях запрета генерации «голосов-клонов», обязательных выплат и возможности удаления данных из наборов по требованию. Разработчики внедрили системы сравнения выходного сигнала с защищёнными произведениями, блокирующие или изменяющие генерацию при превышении порога сходства, а платформы потребовали от дистрибьюторов маркировать музыку, созданную полностью или частично нейросетями[6].

Представление аудиоданных

Аудиосигнал может представляться в разных формах: как исходная звуковая волна, как спектральное представление — спектрограмма или мел-спектрограмма — либо как последовательность дискретных единиц, получаемых нейросетевыми кодеками и токенизаторами[1]. Выбор представления определяет архитектуру модели, вычислительную сложность, качество звучания и возможности управления результатом. Работа с исходной волной позволяет моделировать сигнал напрямую, но требует обработки очень длинных последовательностей отсчётов. Спектральные представления сокращают размерность задачи и широко применяются в синтезе речи, музыки и звуковых эффектов. Дискретизация аудио в токены открывает возможность применять методы языкового моделирования, при которых звук предсказывается поэлементно[7].

undefined

Основные подходы

К основным генеративным подходам относятся авторегрессионные модели, генеративно-состязательные сети, вариационные автокодировщики, трансформеры и диффузионные модели[1][8]. Архитектуры применяются как самостоятельно, так и в составе многоступенчатых систем, где одна модель формирует промежуточное представление, а другая преобразует его в звуковой сигнал; отдельную роль в таких системах играют автокодировщики, выполняющие функцию кодека между сигналом и скрытым представлением. Авторегрессионные модели формируют аудио последовательно, предсказывая следующий элемент по предыдущим — этот принцип использован в WaveNet[9] на уровне отсчётов сигнала и в AudioGen на уровне дискретных токенов. Трансформеры позволяют моделировать протяжённые временные зависимости и применяются в продолжении аудио, генерации музыки и синтезе речи[7]. Диффузионные модели используются для синтеза аудио по текстовому описанию, причём в AudioLDM диффузионный процесс развёрнут в латентном пространстве, а согласование с текстом обеспечивается общими эмбеддингами текста и звука[5].

Основные направления

Синтез речи

Синтез речи (англ. text-to-speech, TTS) — наиболее разработанное направление. Современные системы преобразуют текст в речевой сигнал с управлением тембром, интонацией, эмоциональной окраской и стилем произнесения[10]. Такие системы применяются в голосовых помощниках, озвучивании текстов, дубляже, образовательных сервисах и интерфейсах, требующих естественной устной коммуникации[10].

Генерация музыки

Генерация музыки возможна на символическом уровне, например в формате MIDI, либо непосредственно на уровне аудиосигнала. В обзорах различают задачи создания мелодии, аккомпанемента, полифонии, многодорожечной композиции и фрагментов с заданными стилевыми характеристиками[11]. В современных работах рассматриваются разные типы представлений — MIDI, спектрограммы, исходные аудиосигналы — и разные архитектуры: генеративно-состязательные сети, рекуррентные сети, вариационные автокодировщики, трансформеры и диффузионные модели[8].

Генерация звуковых эффектов и акустических сцен

Отдельное направление связано с созданием неречевых и немузыкальных звуков: шумов, коротких эффектов, событий окружающей среды и фоновых акустических сцен. Такие системы генерируют звук по текстовому описанию, в котором задаются источник звука, среда, длительность или характер события[4][5].

Оценка качества

Оценка качества генерации аудио остается сложной задачей, поскольку для многих генеративных задач не существует единственного правильного результата. Качество оценивают по естественности, реалистичности, соответствию текстовому описанию, музыкальной связности, отсутствию артефактов и субъективному восприятию слушателя[12]. На практике применяют комбинацию объективных метрик и слуховых тестов. В работах по генерации звука по тексту используются расстояние Фреше между распределениями аудиопризнаков (FAD), расстояние Кульбака — Лейблера между предсказаниями классификатора событий, а также субъективные оценки, в которых слушатели отдельно оценивают общее качество записи и её соответствие текстовому описанию. Сопоставление систем между собой затруднено тем, что разные исследования опираются на несовпадающие наборы данных, метрики и условия экспериментов[12].

Применение

Генерация аудио применяется в голосовых интерфейсах, озвучивании текстов, производстве музыки, создании звуковых эффектов для игр и аудиовизуальных произведений, прототипировании саунд-дизайна и разработке интерактивных медиасистем[1][10]. В музыкальной сфере генеративные модели используются как инструмент композиции, аранжировки, создания черновых идей и исследования новых форм взаимодействия человека и машины.

Российская практика

Речевые технологии — наиболее зрелое направление генерации аудио в России. Платформа SaluteSpeech, разработанная SberDevices, обеспечивает синтез и распознавание речи с поддержкой языка разметки SSML для настройки паузации и ударений; в 2022 году бесплатный публичный доступ к ней был открыт для физических лиц с лимитом 100 минут распознавания и 200 тысяч символов синтеза в месяц[13].

В 2023 году было выпущено настольное приложение SaluteSpeech App для Windows и macOS с семью голосами на русском и английском языках[14]. Технология применяется в медиа: синтезированный голос используется для озвучивания текстовых материалов проектов РБК Тренды и РБК Life, где рядом со статьями размещена кнопка воспроизведения аудиоверсии[15].

Генерация музыки

В октябре 2025 года российская компания Robotext.io запустила облачный сервис RoboMix на основе собственной модели с 3,5 млрд параметров, генерирующей текст, мелодию, аранжировку и вокальное исполнение менее чем за минуту. В июле 2026 года музыкальный сервис «Звук» встроил генерацию музыки непосредственно в стриминговую платформу: инструмент «Сингл» создаёт по текстовому описанию на русском или английском языке композицию вместе с текстом, названием и обложкой. Функция позиционируется как первое подобное решение на российском рынке и предназначена исключительно для личного некоммерческого использования[16].

Правовое регулирование в России

В сентябре 2024 года в Государственную думу был внесён законопроект, дополняющий часть первую Гражданского кодекса РФ статьёй 152.3 «Охрана голоса гражданина». Документ, подготовленный группой сенаторов и депутатов, устанавливает охрану голоса как объекта личных неимущественных прав по аналогии с изображением гражданина — в том числе в случаях имитации голоса и синтеза речи в режиме реального времени[17]. По законопроекту обнародование и использование голоса, включая воссозданный специальными технологиями, допускается только с согласия гражданина; после его смерти — с согласия детей и супруга, а при их отсутствии — родителей. Согласие не требуется, если использование осуществляется в государственных, общественных или иных публичных интересах, если запись производилась за плату либо была сделана в местах, открытых для свободного посещения, и на публичных мероприятиях, кроме случаев, когда голос является основным объектом использования. Записи, обнародованные с нарушением требований, по решению суда изымаются из оборота и уничтожаются без компенсации[17]. Одновременно была внесена инициатива о поправках в Уголовный кодекс, закрепляющих ответственность за использование сфальсифицированных изображения или голоса при совершении преступлений[18].

Ограничения и риски

Технические ограничения генерации аудио связаны с высокой размерностью звукового сигнала, необходимостью моделировать длинные временные зависимости, сложностью получения качественно размеченных наборов данных и высокой вычислительной стоимостью генерации длинных аудиофрагментов[1][5].

Помимо технических проблем, в исследованиях обсуждаются этические и правовые риски. В систематическом обзоре по этическим последствиям генеративных аудиомоделей отмечается, что такие системы могут быть связаны с рисками мошенничества, создания аудиодипфейков и нарушения авторских прав[19]. Для систем генерации речи отдельно выделяются риски имитации голоса реальных людей, подрыва доверия к публичной информации и использования синтетической речи в социально вредных сценариях[20].

Примечания

  1. 1 2 3 4 5 Purwins H.; Li B.; Virtanen T.; Schlüter J.; Chang S.-Y.; Sainath T. Deep Learning for Audio Signal Processing (англ.) // IEEE Journal on Selected Topics in Signal Processing. — 2019. — Vol. 13, no. 2. — P. 206—219. — ISSN 1932-4553. — doi:10.1109/JSTSP.2019.2908700.
  2. van den Oord A.; Dieleman S.; Zen H.; Simonyan K.; Vinyals O.; Graves A.; Kalchbrenner N.; Senior A.; Kavukcuoglu K. WaveNet: A Generative Model for Raw Audio (англ.) // arXiv preprint arXiv:1609.03499. — 2016.
  3. Borsos Z.; Marinier R.; Vincent D.; Kharitonov E.; Pietquin O.; Sharifi M.; Roblek D.; Teboul O.; Grangier D.; Tagliasacchi M.; Zeghidour N. AudioLM: a Language Modeling Approach to Audio Generation (англ.) // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2023. — Vol. 31. — P. 2523—2533. — doi:10.1109/TASLP.2023.3288409.
  4. 1 2 Kreuk F.; Synnaeve G.; Polyak A.; Singer U.; Défossez A.; Copet J.; Parikh D.; Taigman Y.; Adi Y. AudioGen: Textually Guided Audio Generation (англ.) // Proceedings of the 11th International Conference on Learning Representations (ICLR). — 2023.
  5. 1 2 3 4 Liu H.; Chen Z.; Yuan Y.; Mei X.; Liu X.; Mandic D.; Wang W.; Plumbley M. D. AudioLDM: Text-to-Audio Generation with Latent Diffusion Models (англ.) // Proceedings of the 40th International Conference on Machine Learning. — 2023. — Vol. 202. — P. 21450—21474.
  6. 1 2 Нейросети для генерации музыки и новые правила 2026. Дата обращения: 28 июля 2026.
  7. 1 2 AudioLM: a Language Modeling Approach to Audio Generation (англ.). Google Research (6 октября 2022). Дата обращения: 26 апреля 2026.
  8. 1 2 Mitra R.; Zualkernan I. Music Generation Using Deep Learning and Generative AI: A Systematic Review (англ.) // IEEE Access. — 2025. — Vol. 13. — P. 18079—18106. — ISSN 2169-3536. — doi:10.1109/ACCESS.2025.3531798.
  9. WaveNet (англ.). Google DeepMind. Дата обращения: 26 апреля 2026.
  10. 1 2 3 Barakat H.; Turk O.; Demiroglu C. Deep learning-based expressive speech synthesis: a systematic review of approaches, challenges, and resources (англ.) // EURASIP Journal on Audio, Speech, and Music Processing. — 2024. — Vol. 2024, no. 11. — doi:10.1186/s13636-024-00329-7.
  11. Civit M.; Civit-Masot J.; Cuadrado F.; Escalona M. J. A systematic review of artificial intelligence-based music generation: Scope, applications, and future trends (англ.) // Expert Systems with Applications. — 2022. — Vol. 209. — doi:10.1016/j.eswa.2022.118190.
  12. 1 2 Vinay A.; Lerch A. Evaluating Generative Audio Systems and Their Metrics (англ.) // Proceedings of the 23rd International Society for Music Information Retrieval Conference (ISMIR). — 2022. — P. 858—865.
  13. SberDevices открыл бесплатный публичный доступ к платформе синтеза речи SaluteSpeech. Rusbase (28 ноября 2022). Дата обращения: 28 июля 2026.
  14. «Сбер» выпустил приложение SaluteSpeech App для синтеза и распознавания речи в аудио. vc.ru (15 ноября 2023). Дата обращения: 28 июля 2026.
  15. Речевые технологии SaluteSpeech озвучили новости РБК. Sber Developers. Дата обращения: 28 июля 2026.
  16. Музыкальный сервис «Звук» запустил функцию создания музыки с помощью ИИ. Ведомости (16 июля 2026). Дата обращения: 28 июля 2026.
  17. 1 2 В ГД внесли законопроект об охране голоса человека при его синтезе с помощью ИИ. ТАСС (16 сентября 2024). Дата обращения: 28 июля 2026.
  18. Россиян предложили защитить от голосовых дипфейков. РБК (16 сентября 2024). Дата обращения: 28 июля 2026.
  19. Barnett J. The Ethical Implications of Generative Audio Models: A Systematic Literature Review (англ.) // Proceedings of the 2023 AAAI/ACM Conference on AI, Ethics, and Society. — 2023. — doi:10.1145/3600211.3604686.
  20. Hutiri W.; Papakyriakopoulos O.; Xiang A. Not My Voice! A Taxonomy of Ethical and Safety Harms of Speech Generators (англ.) // Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency. — 2024. — doi:10.1145/3630106.3658911.
© Правообладателем данного материала является АНО «Интернет-энциклопедия «РУВИКИ».
Использование данного материала на других сайтах возможно только с согласия АНО «Интернет-энциклопедия «РУВИКИ».