Коллапс моды

ИИ-обзор статьи
Коллапс моды — это сбой в работе генеративных моделей, при котором они теряют разнообразие и начинают генерировать лишь ограниченное подмножество вариантов из обучающей выборки, игнорируя остальные.
Отличие от переобучения и меморизации
Коллапс моды отличается от переобучения и недообучения. Модель может запоминать всю обучающую выборку без коллапса моды, но при коллапсе не способна воспроизвести значительную часть данных.
Проклятие рекурсии в обучении
При рекурсивном обучении на синтетических данных модель отдаёт предпочтение популярным паттернам, постепенно теряя информацию о редких событиях. Это приводит к необратимой деградации и коллапсу моды.
Причины и методы борьбы с коллапсом моды в GAN
В GAN коллапс моды возникает из-за дисбаланса между генератором и дискриминатором, осцилляций и нестабильных функций потерь. Для борьбы применяют mini-batch discrimination, Wasserstein GAN, двухшкальное обновление и другие методы.
Дообучение и RLHF как источники коллапса
При дообучении модели фокусируются на целевой задаче, теряя разнообразие генерации из-за переобучения. Обучение с подкреплением по человеческой обратной связи также снижает разнообразие ответов, гомогенизируя стили и мнения.
Стратегии предотвращения коллапса моды
Для предотвращения коллапса моды применяются Human-in-the-Loop, отслеживание происхождения данных и водяные знаки для маркировки синтетического контента. Эксперты фильтруют данные, а метаданные и водяные знаки помогают отделять реальные данные от синтетических, сохраняя разнообразие и связь с реальным распределением.

Коллапс моды (англ. mode collapse) — это сбой в работе генеративной модели, впервые описанный при изучении генеративно-состязательных сетей (GAN). Является ситуацией, когда модель генерирует существенно менее разнообразные данные, чем ожидается, фактически «схлопываясь» до генерации лишь немногих мод распределения и игнорируя остальные. Это явление препятствует основной цели генеративных моделей — адекватно отражать всё разнообразие обучающей выборки[1].

Обычно коллапс моды может возникать либо на стадии обучения модели, либо при последующей донастройке (finetuning).

К 2026 году термин стал применяться и к большим языковым моделям (LLM), охватывая как системную деградацию из-за обучения на синтетических данных, так и динамический сбой при авторегрессионной генерации длинных текстов[2].[3]

Коллапс моды снижает практическую полезность генеративных моделей, например:

  • при синтезе изображений (множество одинаковых или очень похожих картинок);
  • в задачах увеличения обучающей выборки (ограниченное разнообразие синтетических данных);
  • в научном моделировании (проблемы с охватом всех возможных сценариев).

Отличие от других явлений

Коллапс моды отличается от переобучения, при котором модель излишне фокусируется на особенностях обучающей выборки, не умея при этом обобщаться на новые данные, и от недообучения, когда модель не улавливает даже базовых закономерностей.

Меморизация — это процесс, при котором модель дословно воспроизводит фрагменты из обучающей выборки. Если переобучение означает общую потерю способности к обобщению на новых данных, то меморизация является конкретным механизмом запоминания[4]. Меморизацию часто путают с коллапсом моды, однако модель может запоминать всю обучающую выборку и при этом не испытывать коллапса моды. Если же у модели выраженный коллапс моды, то она, наоборот, оказывается не способна воспроизвести значительную часть исходных данных.

Коллапс модели

Коллапс модели — частный механизм возникновения коллапса моды. Это дегенеративный процесс, возникающий при рекурсивном обучении новых поколений искусственного интеллекта на синтетических данных[5]. Например, если генеративная модель 2 обучается в основном на выходных данных модели 1, затем новая модель 3 — на выходах модели 2 и так далее, то каждая следующая модель, как правило, всё сильнее страдает от коллапса моды. Однако существуют и другие причины коллапса моды.

Феномен был формализован в исследовании 2023 года «Проклятие рекурсии» (англ. The Curse of Recursion)[6] группой учёных при участии Ильи Шумайлова, а в июле 2024 года эта работа была опубликована в журнале Nature[7].

Механизм процесса заключается в том, что при обучении на сгенерированных данных модель начинает отдавать предпочтение наиболее популярным паттернам. При этом она постепенно теряет информацию о редких событиях («хвостах» распределения). Такое рекурсивное обучение приводит к необратимой деградации качества генерируемого контента и потере разнообразия[6][7][8].

В генеративно-состязательных сетях

Коллапс моды во время обучения впервые был подробно изучен на примере генеративно-состязательных сетей (GAN). Его причиной чаще всего становятся дисбалансы в динамике взаимодействия между генератором и дискриминатором. В первом описании GAN этот эффект назывался также «Helvetica scenario» («сценарий Гельветики») — этот термин был введён Яном Гудфеллоу в оригинальной статье 2014 года[1][9][10].

Обучение GAN моделируется как минимаксная игра, целью которой является поиск равновесия Нэша. Коллапс моды возникает из-за нестабильности обучения, связанной с исчезающими или осциллирующими градиентами, когда генератор находит локальный минимум, успешно обманывающий текущий дискриминатор[11][12].

Наиболее частые причины коллапса моды в GAN[13]:

  • Если дискриминатор учится слишком медленно, генератор может воспользоваться его слабостями, выдавая ограниченный набор вариантов, успешно обманывающих дискриминатор.
  • Стандартные функции потерь GAN (например дивергенция Йенсена — Шеннона) могут быть излишне «мягкими» для генераций одинаковых выходов.
  • Адверсариальное обучение порой вызывает осцилляции, при которых генератор и дискриминатор не сходятся к устойчивому равновесию, а попеременно «играют в камень-ножницы-бумага»: генератор генерирует только «камень», дискриминатор учится это отличать — тогда генератор переключается на «ножницы» и так далее; всё обучение модель находится в коллапсе моды, просто моды сменяются от итерации к итерации.

Для борьбы с коллапсом моды в GAN предложено несколько специализированных стратегий:

  • Двухшкальное обновление параметров (two time-scale update rule)[14];
  • Mini-batch discrimination[15] — позволяет дискриминатору оценивать целые мини-батчи, стимулируя разнообразие;
  • Unrolled GAN[16] — оптимизация генератора с учётом предполагаемых будущих изменений дискриминатора;
  • Wasserstein GAN применяет расстояние Эрдема — Мовзера, обеспечивая более стабильные градиенты[17]
  • Использование больших и хорошо сбалансированных обучающих выборок[18];
  • Регуляризация градиентным штрафом и спектральной нормализацией[19].

Коллапс моды при дообучении

Большие языковые модели обычно обучаются в два этапа. На первом этапе (pretraining, предварительное обучение) модель обучается на большом корпусе текстов, чтобы воспроизводить примеры из этого корпуса. На втором этапе (finetuning, дообучение) модель специализировано донастраивают на небольшом наборе целевых данных для выполнения конкретной задачи — например, создают чат-бот, дообучив заранее обученную трансформерную модель на небольшом корпусе диалогов.

Коллапс моды может возникать при дообучении: модель, фокусируясь на выполнении целевой задачи, теряет способность генерировать иные типы текстов или ограничивается малым их подмножеством. Предполагается, что существует определённый компромисс между качеством выполнения задачи и разнообразием выходных данных: большее дообучение повышает средний результат по целевой задаче, но уменьшает разнообразие текстов. Меньшее дообучение — обратно[20]. Похожий компромисс наблюдается и при генерации изображений[21] и в генерации текста на основе GAN[22].

Чрезмерное дообучение (over-finetuning) может приводить к «поглупению» модели и катастрофическому забыванию, при котором утрачиваются знания, полученные на этапе предварительного обучения[23].

Схожие эффекты могут возникать и при обучении с подкреплением по человеческой обратной связи (RLHF), например из-за взлома наградной модели или других подобных механизмов[24][25]. Кроме того, этот метод значительно снижает разнообразие генерируемых ответов, приводя к гомогенизации стилей и мнений из-за усреднения под предпочтения оценщиков[26].

Методы предотвращения

Для предотвращения деградации генеративных моделей и борьбы с коллапсом моды применяются общие стратегии управления данными и процессом обучения. Одним из ключевых подходов является интеграция человека в цикл обучения (Human-in-the-Loop, HITL). Этот метод позволяет экспертам фильтровать данные, отбраковывать повторяющиеся результаты и обеспечивать высокое качество обучающей выборки[27][28][29].

Важным элементом предотвращения коллапса является отслеживание происхождения данных (data provenance)[8][30]. Эта стратегия позволяет контролировать состав обучающих наборов и надежно отделять реальные, созданные человеком данные от синтетического контента, сгенерированного искусственным интеллектом. Для маркировки происхождения применяются метаданные и водяные знаки (watermarking) — внедрение незаметных маркеров непосредственно в сгенерированный контент[30]. Сохранение доступа к первоначальным высококачественным данным и активная фильтрация синтетического контента не позволяют ошибкам накапливаться при рекурсивном обучении, обеспечивая модели связь с реальным распределением данных.

Примечания

  1. 1 2 Goodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua (2014). “Generative Adversarial Nets”. Advances in Neural Information Processing Systems [англ.]. Curran Associates, Inc. 27. Архивировано из оригинала 2024-01-01. Дата обращения 2024-06-14. Используется устаревший параметр |url-status= (справка)
  2. Recursive Feedback Loops and the Erosion of Linguistic Diversity in LLMs. arXiv (5 ноября 2025). Дата обращения: 28 мая 2026.
  3. Addressing Dynamic Failure in Autoregressive Text Generation. arXiv (4 мая 2026). Дата обращения: 28 мая 2026.
  4. Memorization vs Generalization in LLMs. OpenReview (2025). Дата обращения: 28 мая 2026.
  5. Коллапс модели. Ultralytics. Дата обращения: 28 мая 2026.
  6. 1 2 The Curse of Recursion: Training on Generated Data Makes Models Forget. arXiv (27 мая 2023). Дата обращения: 28 мая 2026.
  7. 1 2 AI models collapse when trained on recursively generated data. The University of Edinburgh (24 июля 2024). Дата обращения: 28 мая 2026.
  8. 1 2 What is AI model collapse? IBM. Дата обращения: 28 мая 2026.
  9. Kossale, Youssef. Mode Collapse in Generative Adversarial Networks: An Overview // 2022 8th International Conference on Optimization and Applications (ICOA) : [англ.] / Youssef Kossale, Mohammed Airaj, Aziz Darouichi. — IEEE, 6 октября 2022. — P. 1–6. — ISBN 978-1-6654-7681-2. — doi:10.1109/ICOA55659.2022.9934291.
  10. Risk Management with GAN. Natixis. Дата обращения: 28 мая 2026.
  11. Games of GAN. University of Arizona. Дата обращения: 28 мая 2026.
  12. GAN Training Problems. Google Developers. Дата обращения: 28 мая 2026.
  13. Lucic, Mario; Kurach, Karol; Michalski, Marcin; Gelly, Sylvain; Bousquet, Olivier (2018). “Are GANs Created Equal? A Large-Scale Study”. Advances in Neural Information Processing Systems [англ.]. Curran Associates, Inc. 31. Дата обращения 2026-05-28.
  14. Heusel, Martin; Ramsauer, Hubert; Unterthiner, Thomas; Nessler, Bernhard; Hochreiter, Sepp GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium (англ.). arXiv (2017). Дата обращения: 28 мая 2026. Архивировано 1 января 2024 года.
  15. Salimans, Tim; Goodfellow, Ian; Zaremba, Wojciech; Cheung, Vicki; Radford, Alec; Chen, Xi; Chen, Xi (2016). “Improved Techniques for Training GANs”. Advances in Neural Information Processing Systems [англ.]. Curran Associates, Inc. 29. Дата обращения 2026-05-28.;
  16. Metz, Luke; Poole, Ben; Pfau, David; Sohl-Dickstein, Jascha Unrolled Generative Adversarial Networks (англ.). arXiv (2016). Дата обращения: 28 мая 2026. Архивировано 1 января 2024 года.
  17. Gulrajani, Ishaan; Ahmed, Faruk; Arjovsky, Martin; Dumoulin, Vincent; Courville, Aaron C (2017). “Improved Training of Wasserstein GANs”. Advances in Neural Information Processing Systems [англ.]. Curran Associates, Inc. 30. Дата обращения 2026-05-28.;
  18. Brock, Andrew; Donahue, Jeff; Simonyan, Karen Large Scale GAN Training for High Fidelity Natural Image Synthesis (англ.). arXiv (2018). Дата обращения: 28 мая 2026. Архивировано 1 января 2024 года.
  19. Miyato, Takeru; Kataoka, Toshiki; Koyama, Masanori; Yoshida, Yuichi Spectral Normalization for Generative Adversarial Networks (англ.). arXiv (2018). Дата обращения: 28 мая 2026. Архивировано 1 января 2024 года.
  20. Zhang, Hugh; Duckworth, Daniel; Ippolito, Daphne; Neelakantan, Arvind Trading off Diversity and Quality in Natural Language Generation (англ.). arXiv (2020). Дата обращения: 28 мая 2026. Архивировано 1 января 2024 года.
  21. Astolfi, Pietro; Careil, Marlene; Hall, Melissa; Mañas, Oscar; Muckley, Matthew Consistency-diversity-realism Pareto fronts of conditional image generative models (англ.). arXiv (2024). Дата обращения: 28 мая 2026. Архивировано 4 сентября 2025 года.
  22. Caccia, Massimo; Caccia, Lucas; Fedus, William; Larochelle, Hugo; Pineau, Joelle Language GANs Falling Short (англ.). arXiv (2018). Дата обращения: 28 мая 2026. Архивировано 6 сентября 2025 года.
  23. Continuous Fine-Tuning of Large Language Models Causes Catastrophic Forgetting. arXiv (26 января 2026). Дата обращения: 28 мая 2026.
  24. Wen, Jiaxin; Zhong, Ruiqi; Khan, Akbir; Perez, Ethan; Steinhardt Language Models Learn to Mislead Humans via RLHF (англ.). arXiv (2024). Дата обращения: 28 мая 2026. Архивировано 11 октября 2025 года.
  25. Casper, Stephen; Davies, Xander; Shi, Claudia; Scheurer, Jérémy Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback (англ.). arXiv (2023). Дата обращения: 28 мая 2026. Архивировано 1 октября 2025 года.
  26. Understanding the Effects of RLHF on LLM Generalisation and Diversity. NeurIPS (2023). Дата обращения: 28 мая 2026.
  27. What is Model Collapse and Why It's a 2025 Concern. Humans in the Loop. Дата обращения: 28 мая 2026.
  28. Human-in-the-Loop: как человек помогает машинному обучению. Хабр. Дата обращения: 28 мая 2026.
  29. Top Human-in-the-Loop AI Service Providers 2026. Tinkogroup. Дата обращения: 28 мая 2026.
  30. 1 2 Preventing Model Collapse. cseweb.ucsd.edu. Дата обращения: 28 мая 2026.