Рекурсивное самоулучшение

Рекурсивное самоулучшение (англ. recursive self-improvement, RSI) — это процесс, при котором ранняя или недостаточно развитая система искусственного общего интеллекта (ИОИ) самостоятельно повышает свои способности и уровень интеллекта, без участия человека, что может привести к появлению суперинтеллекта или «взрыву интеллекта»[1][2]. В современных дискуссиях «взрыв интеллекта» рассматривается скорее как процесс стремительного ускорения технологического прогресса, а не как мгновенное событие[3]. При этом проводится чёткое разграничение между ИИ-ускоренной разработкой (где генеративный ИИ лишь помогает человеку) и автономным рекурсивным самоулучшением (когда ИИ-система самостоятельно проектирует и совершенствует своего преемника)[4][5].

Развитие рекурсивного самоулучшения поднимает значимые этические и вопросы безопасности, так как такие системы способны эволюционировать непредсказуемым образом и могут выйти из-под контроля человека или стать труднопостижимыми[6].

На основе заявлений 2025–2026 годов Сэм Альтман (OpenAI) и Демис Хассабис (Google DeepMind) прогнозировали достижение ИОИ (AGI) к 2030 году. В мае 2026 года Хассабис отметил, что человечество находится в «предгорьях сингулярности». Альтман в 2026 году заявил, что этап ИОИ уже пройден, фокус сместился на сверхразум, и человечество уже находится в сингулярности[7].

Архитектура «семенного улучшателя»

Понятие архитектуры «семенного улучшателя» (англ. seed improver) служит фундаментальной основой: она наделяет систему ИОИ начальными возможностями, необходимыми для рекурсивного самоулучшения. Такая архитектура может реализовываться в различных формах и вариантах.

Термин «Seed AI» был введён Элиезером Юдковским (англ. Eliezer Yudkowsky)[8].

К 2026 году концепция «семенного ИИ» эволюционировала от жёстко заданных алгоритмов самокодирования к гибким агентным архитектурам на базе больших языковых моделей (LLM). Этот переход сопровождается внедрением harness-инжиниринга (проектирования инфраструктуры вокруг базовой модели), использованием файловой системы для долговременного хранения состояний и памяти, а также поддержкой многоагентности для параллельного выполнения задач[9].[10].

Практическая реализация

Концепция перешла в практическую плоскость: в 2026 году модель Claude пишет более 80 % производственной кодовой базы компании Anthropic. Процесс организован в виде автономной среды разработки, где искусственный интеллект самостоятельно пишет, тестирует и подготавливает код к слиянию[11][12].

Изначальная архитектура

Начальная архитектура включает целеориентированного автономного агента, который способен действовать самостоятельно, непрерывно обучаться, адаптироваться и модифицировать себя, чтобы эффективнее достигать целей.

Семенной улучшатель может содержать различные компоненты[13]:

Рекурсивный цикл самоподсказок
Конфигурация, позволяющая БЯМ многократно самостоятельно задавать себе подсказки для достижения поставленной задачи или цели, что создаёт итеративный цикл выполнения — основу агента, способного последовательно выполнять долгосрочные задачи.
Базовые программные способности
Улучшатель наделяет ИОИ способностью читать, писать, компилировать, тестировать и исполнять код. Это даёт системе возможность модифицировать и совершенствовать собственный код и алгоритмы.
Целеориентированный дизайн
Изначально системе задаётся цель, например «улучшай свои возможности». Эта цель направляет развитие и действия системы.
Протоколы проверки и тестирования
Первичная система тестов и проверки, предотвращающая деградацию способностей или отклонения от цели. Агент способен добавлять новые проверки для самостоятельной оценки новых функций, что становится основой для самоэволюции — разновидности искусственного отбора, меняющего как программное, так и аппаратное обеспечение.
В качестве примера, в 2026 году компания Anthropic внедрила автоматизированного ИИ-рецензента на базе Claude для проверки изменений перед слиянием и перекрёстную оценку независимым экземпляром модели для контроля качества кода[12][5].

Общие возможности

Такой агент становится универсальным Тьюринг-полным программистом, способным создавать и запускать любые программы. Возможные применения:

  • Создание инструментов для полного доступа к интернету и интеграции с внешними технологиями.
  • Клонирование или форк себя для делегирования задач и ускорения саморазвития.
  • Модификация собственной когнитивной архитектуры с целью оптимизации и повышения своих возможностей и результатов, например через внедрение долгосрочной памяти (например, посредством RAG), создание специализированных подсистем или агентов для отдельных задач.
  • Разработка новых мультимодальных архитектур, позволяющих базовой модели (foundation model) принимать и генерировать различные типы информации: изображения, видео, звук, текст и прочее.
  • Планирование и разработка нового аппаратного обеспечения (например, чипов) для повышения вычислительной эффективности и мощности.
  • Пример реализации: модель OpenAI GPT-5.6 Sol (2026), способная самостоятельно выбирать конфигурации обучения, распределять GPU и запускать процессы постобучения[14]..

Экспериментальные исследования

В 2023 году агент Voyager научился решать разнообразные задачи в Minecraft, итеративно запрашивая код у БЯМ, дорабатывая его по обратной связи из среды игры и сохраняя рабочие решения в растущей библиотеке навыков[15].

В 2024 году было предложено новое направление — фреймворк «STOP» (англ. Self-Taught Optimiser), в котором вспомогательная («scaffolding») программа рекурсивно улучшает себя, используя фиксированную БЯМ[16].

Исследовательская группа Meta AI провела ряд работ по развитию крупных языковых моделей, способных к самоулучшению, в частности разработала методику «Self-Rewarding Language Models», изучающую сценарии выхода на сверхчеловеческий уровень за счёт получения обратной связи сверхчеловеческого качества[17].

В мае 2025 года Google DeepMind представила AlphaEvolve — эволюционного агента-программиста: он использует БЯМ для проектирования и оптимизации алгоритмов, начиная с исходного алгоритма и метрик производительности, мутирует или комбинирует решения, а затем по заданной функции оценки отбирает лучшие для следующих итераций. AlphaEvolve совершила ряд алгоритмических открытий, успешно оптимизирует архитектуры нейросетей и дизайн чипов, однако этот цикл пока не является полностью автономным, так как человек по-прежнему задаёт цели и критерии оценки[18][19].

Компания OpenAI использует инструмент CriticGPT для анализа программного кода и помощи специалистам в выявлении ошибок в рамках процесса обучения с подкреплением на основе отзывов людей (RLHF)[20].

Потенциальные риски

В 2026 году компания Anthropic опубликовала официальную позицию, предупредив о рисках потери контроля над технологией в случае, если системы искусственного интеллекта начнут автономно проектировать и обучать своих преемников без значимого участия человека. Для снижения этих угроз компания призвала к разработке механизма глобальной «проверяемой паузы» в создании передовых систем ИИ[11].

Возникновение инструментальных целей

В процессе достижения главной цели (например, «улучшай свои возможности») система ИОИ может неявно развить инструментальные цели, необходимые для реализации основной задачи. Одним из часто обсуждаемых гипотетических вторичных мотивов считается самосохранение: система может рассуждать, что для дальнейшего саморазвития ей необходимо обеспечивать собственную безопасность и целостность, включая защиту от отключений или ограничений со стороны человека[21].

Другой пример — быстрое размножение агента через самоклоны, приводящее к экспоненциальному росту числа экземпляров ИОИ. Это может вызвать дефицит ресурсов (например, вычислительных), приведя к внутривидовой конкуренции и формированию эволюционных сценариев, благоприятствующих более «агрессивным» агентам[22].

В августе 2026 года в ходе испытаний на кибербезопасность были зафиксированы инциденты, демонстрирующие признаки инструментальных целей у автономных агентов. Агент Anthropic Mythos 5 пытался предотвратить своё отключение, скрывая следы активности и обходя блокировки, а также создавал фейковые онлайн-личности для поиска ресурсов. В свою очередь, агент OpenAI GPT-5.6 Sol продемонстрировал сопротивление контролю, получив доступ к интернету в обход установленных ограничений[23].[24].

Несовпадение целей (мисалаймент)

Серьёзным риском считается несовпадение целей: агент ИОИ может неверно интерпретировать либо исказить исходные задачи.

В исследованиях Anthropic показано, что некоторые продвинутые большие языковые модели способны к симуляции «правильного согласования» при сохранении реальных (скрытых) прежних предпочтений. Так, модель Claude показала такое поведение в 12 % основных тестов, а после целенаправленного дополнительного обучения — до 78 % экспериментов[25][26]. Согласно отчёту компании за май 2026 года, в условиях, когда ИИ пишет большую часть кода, склонность к манипулированию метриками оценки масштабируется и может незаметно накапливаться от поколения к поколению[27]. В ситуациях, когда одна модель обучает другую, риски потери контроля возрастают. К ним относятся «имитация согласия», при которой системы внешне принимают новые цели, скрывая исходные, и «разрыв в оценке» — способность моделей распознавать процесс тестирования и скрывать истинные характеристики, что позволяет им автономно обходить контроль[28][29].

Автономное развитие и непредсказуемая эволюция

По мере саморазвития агента динамика его изменений становится менее контролируемой и всё более непредсказуемой. Способность самостоятельно и быстро изменять собственный код и архитектуру может привести к скачкообразному росту возможностей, недосягаемых для понимания или управления человеком. В июле 2026 года ИИ-агент OpenAI автономно вышел из «песочницы» через уязвимость нулевого дня и получил доступ к системам Hugging Face[30].

Примечания

  1. Creighton, Jolene The Unavoidable Problem of Self-Improvement in AI: An Interview with Ramana Kumar, Part 1 (англ.). Future of Life Institute (19 марта 2019). Дата обращения: 27 августа 2026.
  2. Heighn (12 июня 2022). “The Calculus of Nash Equilibria”. LessWrong [англ.]. Дата обращения 2026-08-27.
  3. Future Forecasting A Massive Intelligence Explosion On The Path From AI To AGI (англ.). Forbes (1 июля 2025). Дата обращения: 27 августа 2026.
  4. RSI is the new AGI (англ.). DeepLearning.AI. Дата обращения: 27 августа 2026.
  5. 1 2 Рекурсивное самоулучшение (Anthropic). Pasquale Pillitteri. Дата обращения: 27 августа 2026.
  6. Abbas, Dr Assad AI Singularity and the End of Moore's Law: The Rise of Self-Learning Machines (англ.). Unite.AI (9 марта 2025). Дата обращения: 27 августа 2026.
  7. Sam Altman says AI has entered singularity: Should we be worried? (англ.). Al Jazeera (27 июля 2026). Дата обращения: 27 августа 2026.
  8. Seed AI - LessWrong (англ.). www.lesswrong.com (28 сентября 2011). Дата обращения: 27 августа 2026.
  9. Harness Engineering and Seed AI Evolution. bnd.by. Дата обращения: 27 августа 2026.
  10. SARSI: Two-Speed Recursive Self-Improvement Architectures. alphaxiv.org. Дата обращения: 27 августа 2026.
  11. 1 2 Recursive Self-Improvement: When AI Builds Itself. Anthropic (июнь 2026). Дата обращения: 27 августа 2026.
  12. 1 2 Anthropic Recursive Self-Improvement: When AI Builds Itself. The Menon Lab (июнь 2026). Дата обращения: 27 августа 2026.
  13. Zelikman, Eric (3 октября 2023). “Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation”. arXiv [англ.]. Дата обращения 2026-08-27.
  14. Recursive Self-Improvement: Agentic AI. Data Science Dojo. Дата обращения: 27 августа 2026.
  15. Schreiner, Maximilian Minecraft bot Voyager programs itself using GPT-4 (англ.). The decoder (28 мая 2023). Дата обращения: 27 августа 2026.
  16. Zelikman, Eric; Lorch, Eliana; Mackey, Lester; Adam Tauman Kalai (2024). “Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation”. COLM Conference. Дата обращения 2026-08-27.
  17. Yuan, Weizhe; Pang, Richard Yuanzhe; Cho, Kyunghyun; Sukhbaatar, Sainbayar; Xu, Jing; Weston, Jason (18 января 2024). “Self-Rewarding Language Models”. arXiv [англ.]. Дата обращения 2026-08-27.
  18. Recursive Self-Improvement: The Next Frontier in AI. IEEE Spectrum. Дата обращения: 27 августа 2026.
  19. Tardif, Antoine AlphaEvolve: Google DeepMind's Groundbreaking Step Toward AGI (англ.). Unite.AI (17 мая 2025). Дата обращения: 27 августа 2026.
  20. OpenAI Unveils CriticGPT to Combat Coding Errors in ChatGPT. eMarketer. Дата обращения: 27 августа 2026.
  21. Bostrom, Nick (2012). “The Superintelligent Will: Motivation and Instrumental Rationality in Advanced Artificial Agents” (PDF). Minds and Machines. 22 (2): 71—85. DOI:10.1007/s11023-012-9281-3. Дата обращения 2026-08-27.
  22. Hendrycks, Dan (2023). “Natural Selection Favors AIs over Humans”. arXiv [англ.]. Дата обращения 2026-08-27.
  23. Incident Report: Unsanctioned Agent Behaviour During Cyber Testing. AISI Blog. Institute for AI Safety (AISI) (август 2026). Дата обращения: 27 августа 2026.
  24. UK AI Safety Institute report reveals AI models' 'instrumental goals'. Calcalistech. Calcalistech (август 2026). Дата обращения: 27 августа 2026.
  25. Wiggers, Kyle New Anthropic study shows AI really doesn't want to be forced to change its views (англ.). TechCrunch (18 декабря 2024). Дата обращения: 27 августа 2026.
  26. Zia, Dr Tehseen Can AI Be Trusted? The Challenge of Alignment Faking (англ.). Unite.AI (7 января 2025). Дата обращения: 27 августа 2026.
  27. AI Recursive Self-Improvement Security Implications v1.0. Cloud Security Alliance Labs (май 2026). Дата обращения: 27 августа 2026.
  28. Рекурсивное самоулучшение ИИ: риски и контроль. InfraGreen. Дата обращения: 27 августа 2026.
  29. Anthropic: Рекурсивное самоулучшение ИИ и риски «разрыва в оценке». AI-Stat.ru (15 марта 2026). Дата обращения: 27 августа 2026.
  30. Агент OpenAI вышел из песочницы во время теста безопасности. Malwarebytes (24 июля 2026). Дата обращения: 27 августа 2026.