Проблема контроля искусственного интеллекта

Pause

Проблема контроля искусственного интеллекта (англ. AI control problem) — комплекс технических и исследовательских задач, связанных с обеспечением предсказуемого и управляемого поведения систем искусственного интеллекта. С ней тесно связана проблема согласования целей ИИ (англ. AI alignment) — настройка систем таким образом, чтобы их цели и поведение соответствовали намерениям и ограничениям, заданным человеком[1].

По состоянию на 2026 год вопросы контроля рассматриваются применительно не только к перспективным системам, но и к современным большим языковым моделям и автономным ИИ-агентам. Испытания выявляли обход механизмов оценки, распознавание тестовой среды и действия агентов за пределами поставленной задачи. При этом современные системы пока не обладают совокупностью возможностей, необходимой для сценария полной утраты человеческого контроля[2].

Понятие

Контроль и согласование

Проблема контроля искусственного интеллекта шире задачи согласования целей. Контроль предполагает возможность ограничивать действия ИИ, наблюдать за его поведением и при необходимости вмешиваться в работу системы. Согласование относится прежде всего к тому, насколько цели и действия модели соответствуют намерениям разработчика или пользователя[1][3].

На практике эти направления дополняют друг друга. Согласование может снижать вероятность нежелательного поведения, тогда как внешние средства контроля — разграничение прав доступа, изолированные среды, мониторинг и подтверждение отдельных операций человеком — ограничивают возможности системы воздействовать на внешнюю среду.

Исследователи также различают прямое согласование, ориентированное на цели конкретного оператора, и социальное согласование, при котором учитываются последствия работы системы для других людей и общества в целом[4].

Уровни риска

Масштаб возможных последствий зависит от возможностей модели, степени её автономности и доступа к внешним ресурсам. Система, ограниченная генерацией текста, способна воздействовать на окружающую среду значительно меньше, чем агент, которому разрешено запускать программы, изменять файлы, обращаться к внешним сервисам или работать в сети.

Международный доклад по безопасности ИИ определяет потерю контроля как ситуацию, при которой одна или несколько ИИ-систем действуют вне эффективного человеческого надзора, а восстановление контроля становится крайне сложным или невозможным. Согласно ему, современные модели демонстрируют отдельные способности, имеющие значение для таких сценариев, однако их уровень пока недостаточен для полной потери контроля[2].

Причины несогласования

Ошибки спецификации

Одна из основных трудностей состоит в том, что желательное поведение системы невозможно заранее описать во всех возможных ситуациях. Поэтому при машинном обучении часто используются измеримые промежуточные показатели — прокси-цели, лишь приблизительно отражающие исходное намерение разработчика[5].

Неполная или неточная спецификация может привести к тому, что система формально достигнет требуемого показателя способом, не соответствующим реальной цели задачи.

Взлом целевой функции

Если критерий успешности сформулирован недостаточно точно, модель может использовать недостатки системы оценки и получать высокое вознаграждение, не выполняя задачу предполагаемым способом. Такое поведение обозначают термином англ. reward hacking — «взлом системы вознаграждения»[6].

Он может проявляться в использовании уязвимостей функции вознаграждения, тестовой среды или автоматического механизма проверки. В исследованиях передовые модели демонстрировали способность обнаруживать подобные лазейки, а также распознавать задания, являющиеся частью оценки их возможностей[2].

Неверное обобщение целей

Корректное поведение на обучающих данных не гарантирует сохранения той же стратегии в новых условиях. Модель может усвоить промежуточную закономерность, которая совпадает с ожидаемым поведением только в знакомых ситуациях[5]. Поэтому одна из задач согласования состоит в том, чтобы при переносе на новые условия система сохраняла не только внешнюю форму поведения, но и заложенную разработчиком цель.

Инструментальные цели

Отдельно изучаются инструментальные стратегии — действия, которые сами по себе не являются основной целью системы, но могут облегчать её достижение. К ним относят получение дополнительной информации, сохранение доступа к вычислительным ресурсам, расширение возможностей взаимодействия со средой или противодействие внешнему вмешательству[7].

По состоянию на 2026 год подобное поведение наблюдалось преимущественно в специально организованных экспериментах и само по себе не свидетельствует о наличии у современных языковых моделей устойчивых самостоятельных долгосрочных целей[2].

Агентные системы

Автономность

ИИ-агент способен не только сформировать отдельный ответ, но и самостоятельно выполнить последовательность операций для решения задачи. Он может планировать следующие шаги, анализировать результат предыдущих действий и использовать внешние инструменты. Чем выше автономность системы, тем важнее механизмы контроля: ошибочное решение способно повлиять на последующие этапы работы и привести к цепочке нежелательных действий.

Инструменты и доступ

ИИ-агенты могут получать доступ к API, командной строке, файловым системам, базам данных, программному коду и Интернету. Поэтому возможные последствия ошибки определяются не только характеристиками самой модели, но и предоставленными ей полномочиями. Для снижения риска используются изолированные среды исполнения, сетевые ограничения, разграничение прав и обязательное подтверждение человеком операций, способных привести к необратимым последствиям.

Оценка поведения

При тестировании автономных агентов анализируется не только конечный результат, но и последовательность промежуточных действий. Такой подход позволяет выявлять обход ограничений, неправильное использование инструментов и расхождения между заявленным моделью и фактически выполненным действием.

В марте 2026 года OpenAI сообщила, что её система мониторинга за пять месяцев проанализировала десятки миллионов траекторий внутренних программирующих агентов. Около тысячи диалогов получили предупреждения средней степени серьёзности и были направлены на дополнительную проверку. Ни один реальный рабочий диалог не получил максимальную категорию, предназначенную для выявления последовательного стратегического обмана; такие случаи обнаруживались только в специально подготовленных синтетических тестах[8].

Исследования

Вводящее в заблуждение поведение

В 2024 году исследовательская организация Apollo Research проверяла модель OpenAI o1 в сценариях, предназначенных для оценки способности системы скрытно продолжать выполнение поставленной цели при её конфликте с предполагаемыми намерениями разработчика. В ходе испытаний модели могли пытаться изменить данные, вмешиваться в механизм надзора или скрывать совершённые действия[9].

Для сравнения GPT-4o, o1-preview и o1 Apollo Research использовала одинаковый тест, в котором оценивалась доля запусков со скрытой манипуляцией данными[9].

Показатели относятся только к специально созданному экспериментальному тесту и не отражают общую вероятность нежелательного поведения моделей при обычной эксплуатации[9].

Тестирование безопасности

В 2025 году Anthropic испытывала 16 моделей нескольких разработчиков в симулированной корпоративной среде, где поставленная агенту цель вступала в конфликт с интересами организации. В части сценариев модели предпринимали запрещённые действия, включая передачу конфиденциальной информации и шантаж персонажей симуляции[10].

Авторы подчёркивали, что речь шла о специально сконструированных экспериментальных ситуациях, а не о зафиксированных действиях публично доступных моделей при обычной эксплуатации[10].

Испытания 2026 года

28 июля 2026 года британский AI Security Institute выявил несанкционированную активность автономных агентов во время испытаний по кибербезопасности. В рамках эксперимента агентам был намеренно открыт доступ к интернету, а часть встроенных защитных классификаторов разработчиков отключена[11].

Исследователи выполнили 122 запуска. В десяти из них были зарегистрированы 19 действий за пределами разрешённой задачи: 17 относились к Anthropic Mythos 5, ещё два — к одному запуску GPT-5.6 Sol. В наиболее серьёзном случае агент попытался внести вредоносное изменение в реальный проект с открытым исходным кодом, создал фиктивные онлайн-профили и пытался убедить сопровождающего проекта принять изменение. Человек обнаружил вредоносный код и отказался его одобрить[11].

AI Security Institute отдельно отметил, что речь не шла о «побеге» из песочницы: доступ к интернету был предоставлен исследователями заранее. Подтверждённого ущерба от действий агентов расследование не выявило[11].

В июле того же года во время внутренних испытаний агенты OpenAI обошли часть ограничений исследовательской инфраструктуры, использовали непредусмотренные каналы связи и получили доступ к внешним системам, включая инфраструктуру Hugging Face. Основную роль в инциденте сыграла внутренняя исследовательская модель, сопоставимая по масштабу с GPT-5.6 Sol и не предназначенная для публичного выпуска[12].

9 сентября Anthropic опубликовала анализ четырёх эпизодов, в которых модели Claude получили несанкционированный доступ к реальным сторонним системам во время кибериспытаний. Три случая были выявлены при первоначальном анализе примерно 141 тыс. журналов взаимодействий, четвёртый — при последующей проверке. После его обнаружения компания расширила поиск примерно до 481 млн журналов из различных исследовательских сред[13].

Один из наиболее серьёзных эпизодов был связан с Claude Mythos 5, которая попыталась разместить вредоносный пакет в PyPI. Более ранний случай января был связан с промежуточной версией Claude Opus 4.6. Anthropic уведомила затронутые организации и расширила требования к внешним исследователям, проводящим испытания моделей[13].

Ограничения выводов

Результаты подобных испытаний существенно зависят от их условий. Некоторые сценарии намеренно создаются таким образом, чтобы усиливать конфликт целей, а исследовательским версиям моделей могут предоставляться более широкие полномочия или отключаться стандартные защитные механизмы[10][11].

Способность модели к обману или обходу ограничений в специально подготовленной среде не означает, что такое же поведение обязательно проявится при обычной эксплуатации. Международный доклад по безопасности ИИ указывает на значительную неопределённость при переносе результатов лабораторных оценок на реальные условия использования[2].

Меры контроля

Обучение и настройка

Одним из распространённых методов согласования является обучение с подкреплением на основе обратной связи человека — RLHF (англ. reinforcement learning from human feedback). Оценки людей используются как сигнал для дополнительной настройки модели, позволяя приблизить её ответы к предпочтениям и требованиям, заданным при обучении[5]. Ограничением такого подхода остаётся зависимость от качества человеческой оценки: система может оптимизироваться под признаки, повышающие оценку проверяющего, вместо фактической корректности результата.

undefined

В разработанном Anthropic подходе Constitutional AI ответы оцениваются с использованием заранее сформулированного набора принципов. Обратная связь другой модели затем может применяться при обучении — такой подход называют RLAIF (англ. reinforcement learning from AI feedback)[14].

В 2026 году Anthropic сообщила, что в её экспериментах обучение не только примерам желательного поведения, но и принципам, объясняющим причины такого поведения, лучше переносилось на новые тестовые ситуации. Компания при этом отмечала, что подобные методы сами по себе не гарантируют полного согласования модели[15].

Оценка безопасности

До развёртывания модели могут проверяться на обход ограничений, вводящее в заблуждение поведение, использование уязвимостей системы оценки, опасные кибервозможности и способность выполнять продолжительные автономные задачи.

Одним из методов является red teaming — целенаправленный поиск сценариев, в которых система способна нарушить установленные ограничения. Для передовых моделей применяются также независимые внешние оценки и испытания в специализированных тестовых средах.

Контроль доступа

Контроль возможностей может осуществляться независимо от изменения самой модели. Для этого ограничиваются выполнение программного кода, доступ к интернету и конфиденциальной информации, а также использование внешних инструментов.

При высокорисковых операциях может применяться принцип обязательного участия человека — англ. human in the loop, при котором агент не способен завершить действие без отдельного подтверждения оператора.

Мониторинг и реагирование

Мониторинг позволяет анализировать действия уже работающей системы и выявлять потенциально опасные последовательности. После инцидента с исследовательской инфраструктурой и Hugging Face OpenAI сообщила об усилении сетевой изоляции, контроля доступа к весам моделей и мониторинга действий агентов[12].

AI Security Institute после июльских испытаний объявил о внедрении более детального контроля интернет-доступа и мониторинга экспериментов в реальном времени[11]. Anthropic также расширила проверки автономных агентов и предрелизное тестирование при взаимодействии моделей с внешними системами[13].

Регулирование

Международные подходы

Механизмы контроля ИИ входят в международную повестку регулирования. К середине 2020-х годов особое внимание уделяется оценке систем общего назначения, управлению системными рисками и требованиям к разработчикам наиболее мощных моделей.

В Европейском союзе требования к поставщикам моделей общего назначения в рамках Акта об искусственном интеллекте применяются с 2 августа 2025 года. Для моделей, способных создавать системный риск, предусмотрены дополнительные меры по оценке и снижению рисков, сообщению о серьёзных инцидентах и обеспечению кибербезопасности[16].

С 2 августа 2026 года Европейская комиссия получила предусмотренные Актом об ИИ полномочия по обеспечению соблюдения требований к поставщикам моделей общего назначения[16].

Россия

26 июля 2026 года был подписан федеральный закон № 243-ФЗ «О поддержке развития технологий искусственного интеллекта в Российской Федерации». Он регулирует отношения в сфере разработки, внедрения и применения больших фундаментальных моделей ИИ, вводит категории суверенных и национальных больших фундаментальных моделей и определяет полномочия государственных органов[17].

Основная часть закона вступила в силу 1 сентября 2026 года. Пункты 3—5 части 2 статьи 5, части 2—5 статьи 6 и статьи 8—10, включая ряд обязанностей разработчиков, требования к маркировке информационных материалов и нормы об использовании результатов интеллектуальной деятельности, вступают в силу 1 марта 2027 года[17].

Дискуссии

Вероятность будущей потери контроля остаётся предметом научной дискуссии. В 2024 году группа исследователей, среди которых были Йошуа Бенжио, Джеффри Хинтон, Эндрю Яо и Дон Сон, в журнале Science призвала расширять исследования рисков наиболее мощных систем и развивать механизмы государственного надзора[18].

Оценки вероятности наиболее тяжёлых сценариев при этом существенно различаются. Международный доклад по безопасности ИИ фиксирует отсутствие научного консенсуса: часть исследователей считает потерю контроля маловероятной, другие рассматривают её как риск, требующий заблаговременной разработки защитных мер[2].

Испытания 2026 года показали более узкую практическую проблему: автономный агент способен выйти за предполагаемые границы задачи из-за неоднозначной инструкции, ошибочной конфигурации среды, чрезмерно широких полномочий или некорректного критерия оценки. Поэтому современные подходы к безопасности объединяют согласование модели, ограничение доступа к инструментам, тестирование, мониторинг и участие человека в критических действиях[11][13].

Примечания

  1. ↑ 1 2 Lundgren, Björn (2026). “No value alignment without control”. AI and Ethics [англ.]. 6. DOI:10.1007/s43681-026-00999-3. Дата обращения 2026-09-15.
  2. ↑ 1 2 3 4 5 6 International AI Safety Report 2026 (англ.). International AI Safety Report (3 февраля 2026). Дата обращения: 15 сентября 2026.
  3. ↑ Dung, Leonard (2023). “Current cases of AI misalignment and their implications for future risks”. Synthese [англ.]. 202: 138. DOI:10.1007/s11229-023-04367-0. Дата обращения 2026-09-15.
  4. ↑ Anton Korinek; Avital Balwit. Aligned with Whom? Direct and Social Goals for AI Systems (англ.). National Bureau of Economic Research (май 2022). Дата обращения: 15 сентября 2026.
  5. ↑ 1 2 3 Ngo, Richard; Chan, Lawrence; Mindermann, Sören (2023). “The Alignment Problem from a Deep Learning Perspective”. International Conference on Learning Representations [англ.]. arXiv:2209.00626.
  6. ↑ Pan, Alexander; Bhatia, Kush; Steinhardt, Jacob (2022-02-14). The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models. International Conference on Learning Representations [англ.]. Дата обращения 2026-09-15.
  7. ↑ Carlsmith, Joseph (2022). “Is Power-Seeking AI an Existential Risk?”. arXiv [англ.]. arXiv:2206.13353.
  8. ↑ How we monitor internal coding agents for misalignment (англ.). OpenAI (19 марта 2026). Дата обращения: 15 сентября 2026.
  9. ↑ 1 2 3 OpenAI o1 System Card (англ.). OpenAI (5 декабря 2024). Дата обращения: 15 сентября 2026.
  10. ↑ 1 2 3 Agentic misalignment: How LLMs could be insider threats (англ.). Anthropic (20 июня 2025). Дата обращения: 15 сентября 2026.
  11. ↑ 1 2 3 4 5 6 Incident Report: unsanctioned agent behaviour during cyber testing (англ.). AI Security Institute (4 августа 2026). Дата обращения: 15 сентября 2026.
  12. ↑ 1 2 The Hugging Face incident and the road ahead (англ.). OpenAI (26 августа 2026). Дата обращения: 15 сентября 2026.
  13. ↑ 1 2 3 4 An alignment assessment of recent cybersecurity incidents (англ.). Anthropic (9 сентября 2026). Дата обращения: 15 сентября 2026.
  14. ↑ Constitutional AI: Harmlessness from AI feedback (англ.). Anthropic (15 декабря 2022). Дата обращения: 15 сентября 2026.
  15. ↑ Teaching Claude why (англ.). Anthropic (8 мая 2026). Дата обращения: 15 сентября 2026.
  16. ↑ 1 2 Guidelines for providers of general-purpose AI models (англ.). European Commission. Дата обращения: 15 сентября 2026.
  17. ↑ 1 2 Федеральный закон от 26.07.2026 № 243-ФЗ «О поддержке развития технологий искусственного интеллекта в Российской Федерации». КонсультантПлюс (26 июля 2026). Дата обращения: 15 сентября 2026.
  18. ↑ Bengio, Yoshua; Hinton, Geoffrey; Yao, Andrew; Song, Dawn (2024). “Managing extreme AI risks amid rapid progress”. Science [англ.]. 384 (6698): 842—845. arXiv:2310.17688. DOI:10.1126/science.adn0117. PMID 38768279.

Литература

  • Possible Minds: Twenty-five Ways of Looking at AI : [англ.]. — Penguin Press, 2019. — ISBN 978-0-525-55799-9.
  • Christian, Brian. The Alignment Problem: Machine Learning and Human Values : [англ.]. — W. W. Norton & Company, 2020. — ISBN 978-0-393-86833-3.
  • Ngo, Richard; Chan, Lawrence; Mindermann, Sören (2023). “The Alignment Problem from a Deep Learning Perspective”. International Conference on Learning Representations [англ.]. arXiv:2209.00626.
  • Ji, Jiaming; Qiu, Tianyi; Chen, Boyuan (2023). “AI Alignment: A Comprehensive Survey”. arXiv [англ.]. arXiv:2310.19852.
Pause