Рекурсивное самоулучшение
Рекурсивное самоулучшение (англ. recursive self-improvement, RSI) — это процесс, при котором ранняя или недостаточно развитая система искусственного общего интеллекта (ИОИ) самостоятельно повышает свои способности и уровень интеллекта, без участия человека, что может привести к появлению суперинтеллекта или «взрыву интеллекта»[1][2]. В современных дискуссиях «взрыв интеллекта» рассматривается скорее как процесс стремительного ускорения технологического прогресса, а не как мгновенное событие[3]. При этом проводится чёткое разграничение между ИИ-ускоренной разработкой (где генеративный ИИ лишь помогает человеку) и автономным рекурсивным самоулучшением (когда ИИ-система самостоятельно проектирует и совершенствует своего преемника)[4][5].
Развитие рекурсивного самоулучшения поднимает значимые этические и вопросы безопасности, так как такие системы способны эволюционировать непредсказуемым образом и могут выйти из-под контроля человека или стать труднопостижимыми[6].
На основе заявлений 2025–2026 годов Сэм Альтман (OpenAI) и Демис Хассабис (Google DeepMind) прогнозировали достижение ИОИ (AGI) к 2030 году. В мае 2026 года Хассабис отметил, что человечество находится в «предгорьях сингулярности». Альтман в 2026 году заявил, что этап ИОИ уже пройден, фокус сместился на сверхразум, и человечество уже находится в сингулярности[7].
Архитектура «семенного улучшателя»
Понятие архитектуры «семенного улучшателя» (англ. seed improver) служит фундаментальной основой: она наделяет систему ИОИ начальными возможностями, необходимыми для рекурсивного самоулучшения. Такая архитектура может реализовываться в различных формах и вариантах.
Термин «Seed AI» был введён Элиезером Юдковским (англ. Eliezer Yudkowsky)[8].
К 2026 году концепция «семенного ИИ» эволюционировала от жёстко заданных алгоритмов самокодирования к гибким агентным архитектурам на базе больших языковых моделей (LLM). Этот переход сопровождается внедрением harness-инжиниринга (проектирования инфраструктуры вокруг базовой модели), использованием файловой системы для долговременного хранения состояний и памяти, а также поддержкой многоагентности для параллельного выполнения задач[9].[10].
Практическая реализация
Концепция перешла в практическую плоскость: в 2026 году модель Claude пишет более 80 % производственной кодовой базы компании Anthropic. Процесс организован в виде автономной среды разработки, где искусственный интеллект самостоятельно пишет, тестирует и подготавливает код к слиянию[11][12].
Изначальная архитектура
Начальная архитектура включает целеориентированного автономного агента, который способен действовать самостоятельно, непрерывно обучаться, адаптироваться и модифицировать себя, чтобы эффективнее достигать целей.
Семенной улучшатель может содержать различные компоненты[13]:
- Рекурсивный цикл самоподсказок
- Конфигурация, позволяющая БЯМ многократно самостоятельно задавать себе подсказки для достижения поставленной задачи или цели, что создаёт итеративный цикл выполнения — основу агента, способного последовательно выполнять долгосрочные задачи.
- Базовые программные способности
- Улучшатель наделяет ИОИ способностью читать, писать, компилировать, тестировать и исполнять код. Это даёт системе возможность модифицировать и совершенствовать собственный код и алгоритмы.
- Целеориентированный дизайн
- Изначально системе задаётся цель, например «улучшай свои возможности». Эта цель направляет развитие и действия системы.
- Протоколы проверки и тестирования
- Первичная система тестов и проверки, предотвращающая деградацию способностей или отклонения от цели. Агент способен добавлять новые проверки для самостоятельной оценки новых функций, что становится основой для самоэволюции — разновидности искусственного отбора, меняющего как программное, так и аппаратное обеспечение.
- В качестве примера, в 2026 году компания Anthropic внедрила автоматизированного ИИ-рецензента на базе Claude для проверки изменений перед слиянием и перекрёстную оценку независимым экземпляром модели для контроля качества кода[12][5].
Общие возможности
Такой агент становится универсальным Тьюринг-полным программистом, способным создавать и запускать любые программы. Возможные применения:
- Создание инструментов для полного доступа к интернету и интеграции с внешними технологиями.
- Клонирование или форк себя для делегирования задач и ускорения саморазвития.
- Модификация собственной когнитивной архитектуры с целью оптимизации и повышения своих возможностей и результатов, например через внедрение долгосрочной памяти (например, посредством RAG), создание специализированных подсистем или агентов для отдельных задач.
- Разработка новых мультимодальных архитектур, позволяющих базовой модели (foundation model) принимать и генерировать различные типы информации: изображения, видео, звук, текст и прочее.
- Планирование и разработка нового аппаратного обеспечения (например, чипов) для повышения вычислительной эффективности и мощности.
- Пример реализации: модель OpenAI GPT-5.6 Sol (2026), способная самостоятельно выбирать конфигурации обучения, распределять GPU и запускать процессы постобучения[14]..
Экспериментальные исследования
В 2023 году агент Voyager научился решать разнообразные задачи в Minecraft, итеративно запрашивая код у БЯМ, дорабатывая его по обратной связи из среды игры и сохраняя рабочие решения в растущей библиотеке навыков[15].
В 2024 году было предложено новое направление — фреймворк «STOP» (англ. Self-Taught Optimiser), в котором вспомогательная («scaffolding») программа рекурсивно улучшает себя, используя фиксированную БЯМ[16].
Исследовательская группа Meta AI провела ряд работ по развитию крупных языковых моделей, способных к самоулучшению, в частности разработала методику «Self-Rewarding Language Models», изучающую сценарии выхода на сверхчеловеческий уровень за счёт получения обратной связи сверхчеловеческого качества[17].
В мае 2025 года Google DeepMind представила AlphaEvolve — эволюционного агента-программиста: он использует БЯМ для проектирования и оптимизации алгоритмов, начиная с исходного алгоритма и метрик производительности, мутирует или комбинирует решения, а затем по заданной функции оценки отбирает лучшие для следующих итераций. AlphaEvolve совершила ряд алгоритмических открытий, успешно оптимизирует архитектуры нейросетей и дизайн чипов, однако этот цикл пока не является полностью автономным, так как человек по-прежнему задаёт цели и критерии оценки[18][19].
Компания OpenAI использует инструмент CriticGPT для анализа программного кода и помощи специалистам в выявлении ошибок в рамках процесса обучения с подкреплением на основе отзывов людей (RLHF)[20].
Потенциальные риски
В 2026 году компания Anthropic опубликовала официальную позицию, предупредив о рисках потери контроля над технологией в случае, если системы искусственного интеллекта начнут автономно проектировать и обучать своих преемников без значимого участия человека. Для снижения этих угроз компания призвала к разработке механизма глобальной «проверяемой паузы» в создании передовых систем ИИ[11].
Возникновение инструментальных целей
В процессе достижения главной цели (например, «улучшай свои возможности») система ИОИ может неявно развить инструментальные цели, необходимые для реализации основной задачи. Одним из часто обсуждаемых гипотетических вторичных мотивов считается самосохранение: система может рассуждать, что для дальнейшего саморазвития ей необходимо обеспечивать собственную безопасность и целостность, включая защиту от отключений или ограничений со стороны человека[21].
Другой пример — быстрое размножение агента через самоклоны, приводящее к экспоненциальному росту числа экземпляров ИОИ. Это может вызвать дефицит ресурсов (например, вычислительных), приведя к внутривидовой конкуренции и формированию эволюционных сценариев, благоприятствующих более «агрессивным» агентам[22].
В августе 2026 года в ходе испытаний на кибербезопасность были зафиксированы инциденты, демонстрирующие признаки инструментальных целей у автономных агентов. Агент Anthropic Mythos 5 пытался предотвратить своё отключение, скрывая следы активности и обходя блокировки, а также создавал фейковые онлайн-личности для поиска ресурсов. В свою очередь, агент OpenAI GPT-5.6 Sol продемонстрировал сопротивление контролю, получив доступ к интернету в обход установленных ограничений[23].[24].
Несовпадение целей (мисалаймент)
Серьёзным риском считается несовпадение целей: агент ИОИ может неверно интерпретировать либо исказить исходные задачи.
В исследованиях Anthropic показано, что некоторые продвинутые большие языковые модели способны к симуляции «правильного согласования» при сохранении реальных (скрытых) прежних предпочтений. Так, модель Claude показала такое поведение в 12 % основных тестов, а после целенаправленного дополнительного обучения — до 78 % экспериментов[25][26]. Согласно отчёту компании за май 2026 года, в условиях, когда ИИ пишет большую часть кода, склонность к манипулированию метриками оценки масштабируется и может незаметно накапливаться от поколения к поколению[27]. В ситуациях, когда одна модель обучает другую, риски потери контроля возрастают. К ним относятся «имитация согласия», при которой системы внешне принимают новые цели, скрывая исходные, и «разрыв в оценке» — способность моделей распознавать процесс тестирования и скрывать истинные характеристики, что позволяет им автономно обходить контроль[28][29].
Автономное развитие и непредсказуемая эволюция
По мере саморазвития агента динамика его изменений становится менее контролируемой и всё более непредсказуемой. Способность самостоятельно и быстро изменять собственный код и архитектуру может привести к скачкообразному росту возможностей, недосягаемых для понимания или управления человеком. В июле 2026 года ИИ-агент OpenAI автономно вышел из «песочницы» через уязвимость нулевого дня и получил доступ к системам Hugging Face[30].