Нейронная сеть с обратной связью

Нейро́нная сеть с обра́тной свя́зью (англ. Feedback neural network) — это разновидность нейронных сетей, способных осуществлять обратную связь между выходами или последующими слоями сети и входами или предыдущими слоями. Такой подход широко используется в больших языковых моделях, особенно в моделях рассуждения. Механизм реализует имитацию самопроверки и внутреннего обсуждения математической задачи, направленный на уменьшение ошибок (например, галлюцинаций) и повышение интерпретируемости работы алгоритмов. Отражение (reflection) в данном контексте является одной из форм «вычислений во время тестирования», то есть увеличения вычислительных затрат на этапе инференса.

Архитектуры сетей с обратной связью

Asynchronous Neural Turing networks (ANT)

Архитектура Asynchronous Neural Turing networks (ANT) представляет собой рекуррентные нейронные сети, асинхронно моделирующие машину Тьюринга. В отличие от классических нейронных машин Тьюринга (NTM) и традиционных глубоких сетей, ANT работает без глобального тактового сигнала. Асинхронность реализуется за счёт того, что на каждом вычислительном шаге обновляется только один случайно выбранный нейрон, что позволяет активировать лишь необходимые для текущей задачи узлы и имитирует работу биологического мозга. Отказ от глобальной синхронизации позволяет снизить энергопотребление на порядки по сравнению с традиционными системами искусственного интеллекта. Архитектура обеспечивает высокую энергоэффективность, сопоставимую со спайковыми нейронными сетями (SNN), сохраняя при этом дифференцируемые свойства, полную вычислительную мощность и совместимость со стандартными методами обучения.

Deep Feedback Models (DFMs)

Deep Feedback Models (DFMs) — это класс нейронных сетей с сохранением состояния, использующих механизм обратной связи для итеративного уточнения признаков. В задачах компьютерного зрения и медицинской визуализации DFMs стабильно превосходят классические сети прямого распространения (feed-forward). Их ключевым преимуществом является повышенная устойчивость к шуму, которая достигается за счёт механизма экспоненциального затухания, стабилизирующего процесс итеративного уточнения[1].

Методы обучения и оптимизации

Direct Feedback Alignment (DFA)

Метод Direct Feedback Alignment (DFA) применяется в качестве альтернативы алгоритму обратного распространения ошибки сквозь время (BPTT). В отличие от BPTT, требующего вычисления точных якобианов для рекурсивной передачи градиентов, DFA использует фиксированную, случайно инициализированную матрицу обратной связи[2][3]. Ошибка передаётся напрямую от выходного слоя к скрытым, что позволяет вычислять градиенты и обновлять параметры всех слоёв параллельно[4][5]. Это устраняет строгую последовательную зависимость вычислений и ускоряет обучение крупномасштабных моделей.

Memory Caching (MC)

Метод Memory Caching (MC) для рекуррентных нейронных сетей (RNN) заключается в кэшировании контрольных точек состояний памяти по мере обработки сегментов входной последовательности. Это позволяет эффективной ёмкости памяти расти вместе с длиной контекста, предлагая компромисс между фиксированной памятью традиционных RNN и растущей памятью архитектуры Transformer[6]. Различные методы кэширования демонстрируют высокую эффективность по сравнению с традиционными механизмами полного внимания при работе с длинным контекстом. В частности, иерархическое кэширование обеспечивает высокую точность извлечения информации на контексте до 1 миллиона токенов[7], а метод селективного сжатия успешно сохраняет важную информацию из начала длинного контекста[8].

Постфактум-отражение

Проводится анализ и критика первичного вывода отдельно после факта; чаще всего заключается в том, что модель с помощью дополнительных промптов ищет ошибки или предлагает улучшения уже сгенерированного ответа. Такой подход реализуется, например, во фреймворке Reflexion[9]. Среди современных фреймворков и архитектурных подходов для анализа и критики вывода выделяются CyberCorrect и LangGraph. CyberCorrect формализует самокоррекцию как замкнутую систему управления, включающую тримодальный детектор ошибок, контроллер коррекции, судью сходимости и механизм отката[10]. LangGraph применяется для реализации многофазной многоагентной рефлексии, в которой агенты-генераторы и критики имеют противоположные цели, а критик получает доступ к внешним данным для проверки фактов[11]. Для верификации и повышения точности ответов в циклы обратной связи могут интегрироваться внешние инструменты через API, такие как Wolfram Alpha для сложных вычислений, Google SERPer для веб-поиска, а также ArXiv, OpenWeatherMap и Google Calendar[12].

Итеративное отражение

Позволяет динамически корректировать ранее сгенерированные части ответа уже в процессе генерации. Механизмы самоконтроля дают модели возможность пересматривать ход рассуждения по мере продвижения. Примером могут служить методы типа Tree-of-Thoughts, позволяющие возвращаться к альтернативным ветвям поиска. Развитие идей скрытых цепочек рассуждений привело к созданию архитектуры Fast Quiet-STaR, которая позволяет генерировать скрытые цепочки рассуждений без дополнительных задержек на этапе вывода. Примерами моделей, использующих этот подход, являются Mistral 7B и Qwen2.5 7B[13].

Внутреннее отражение

Встраивает самоконтроль непосредственно в архитектуру самой модели, а не только через внешние промпты, тем самым формируя у модели внутреннее представление об ограничениях собственных рассуждений и уровне достоверности. Такой метод был применён в Google DeepMind в технике Self-Correction via Reinforcement Learning (SCoRe): модель поощряется за улучшение собственных ответов[14]. Развитием подходов, аналогичных SCoRe, стал метод SIA (Self Improving AI). Его ключевым отличием является использование агента обратной связи, который динамически обновляет веса модели на основе результатов выполнения задач с помощью методов обучения с подкреплением (RL) и адаптеров LoRA[15].

Reward-модели процесса и ограничения

В ранних исследованиях применялись process reward models (PRM), которые предоставляют обратную связь по каждому шагу рассуждения, в отличие от классического обучения с подкреплением, при котором вознаграждается только финальный результат. Однако PRM имеют ограничения, связанные с вычислительной затратностью и уязвимостью к reward hacking. Разработчики DeepSeek-R1, например, пришли к выводу об их низкой эффективности[16][17].

Для борьбы с ложными вознаграждениями (reward hacking) и повышения надёжности оценки промежуточных шагов были разработаны новые подходы к автоматической верификации. Среди них выделяется метод причинно-следственной корректировки CRA (Causal Reward Adjustment), который использует разреженные автоэнкодеры для выявления семантики, вызывающей ложные вознаграждения, и устранения её влияния[18]. Подход PURE (Process sUpervised Reinforcement lEarning) определяет функцию ценности как минимум будущих вознаграждений, что предотвращает эксплуатацию моделью отдельных высоко оценённых шагов[19]. В моделях VPRM (Verifiable Process Reward Models) непрозрачные нейронные оценки заменяются на детерминированные верификаторы, основанные на правилах, что позволяет программно проверять логику каждого шага[20]. Кроме того, применяются методы наложения штрафов при резком падении качества (PS-GRPO), алгоритмы динамического вычисления весов доверия к сигналам PRM (Trust-GRPO), а также использование эталонных решений и стратифицированных рубрик (ContextRL и RuCL)[21].

Примечания

  1. Deep Feedback Models: State-Preserving Networks for Iterative Feature Refinement. arXiv. Дата обращения: 27 августа 2026.
  2. Direct Feedback Alignment: A Biologically Plausible Learning Rule. PMC. National Center for Biotechnology Information. Дата обращения: 27 августа 2026.
  3. On the Convergence of Direct Feedback Alignment. arXiv. Дата обращения: 27 августа 2026.
  4. Accelerating Deep Learning with Optical Direct Feedback Alignment. arXiv. Дата обращения: 27 августа 2026.
  5. Parallel Training of Deep Neural Networks with Direct Feedback Alignment. NeurIPS Proceedings. Дата обращения: 27 августа 2026.
  6. Memory Caching for Recurrent Neural Networks. arXiv (24 февраля 2026). Дата обращения: 27 августа 2026.
  7. Advancing Long-Context LLM Performance in 2025. flow-ai.com. Дата обращения: 27 августа 2026.
  8. Selective Compression of KV Cache. arXiv (5 апреля 2026). Дата обращения: 27 августа 2026.
  9. Shinn, Noah; Cassano, Federico; Berman, Edward; Gopinath, Ashwin; Narasimhan, Karthik; Yao, Shunyu (2023). “Reflexion: Language Agents with Verbal Reinforcement Learning”. arXiv. arXiv:2303.11366 [cs.AI]. Используется устаревший параметр |class= (справка)
  10. CyberCorrect: A Trimodal Error Detector and Targeted Correction Controller for LLM Self-Correction. arXiv (17 мая 2026). Дата обращения: 27 августа 2026.
  11. Reflection Agent Architecture: Eliminating LLM Hallucinations via Tool-Grounded Iterative Refinement. Towards AI. Medium. Дата обращения: 27 августа 2026.
  12. Athena: A Framework for Tool-Augmented LLM Reflection and Verification. arXiv (8 июля 2025). Дата обращения: 27 августа 2026.
  13. Fast Quiet-STaR: Hidden Reasoning. AlphaXiv. Дата обращения: 27 августа 2026.
  14. Dickson, Ben DeepMind's SCoRe показывает, что большие языковые модели могут использовать внутренние знания для коррекции собственных ошибок (англ.). VentureBeat (1 октября 2024). Дата обращения: 27 августа 2026.
  15. SIA (Self Improving AI). arXiv (2026). Дата обращения: 27 августа 2026.
  16. Uesato, Jonathan; Kushman, Nate; Kumar, Ramana; Song, Francis; Siegel, Noah; Wang, Lisa; Creswell, Antonia; Irving, Geoffrey; Higgins, Irina (2022). “Solving math word problems with process- and outcome-based feedback”. arXiv. arXiv:2211.14275 [cs.LG]. Используется устаревший параметр |class= (справка)
  17. Lightman, Hunter; Kosaraju, Vineet; Burda, Yura; Edwards, Harri; Baker, Bowen; Lee, Teddy; Leike, Jan; Schulman, John; Sutskever, Ilya; Cobbe, Karl (2023). “Let's Verify Step by Step”. arXiv. arXiv:2305.20050 [cs.LG]. Используется устаревший параметр |class= (справка)
  18. Causal Reward Adjustment for Process Reward Models. arXiv (1 августа 2025). Дата обращения: 27 августа 2026.
  19. Process sUpervised Reinforcement lEarning (PURE). NeurIPS (2025). Дата обращения: 27 августа 2026.
  20. Verifiable Process Reward Models (VPRM). AlphaXiv (1 января 2026). Дата обращения: 27 августа 2026.
  21. Advanced Techniques for Reward Hacking Mitigation. arXiv (1 апреля 2026). Дата обращения: 27 августа 2026.