Алгоритм актор-критик

Алгори́тм акто́р-кри́тик (англ. actor-critic algorithm, AC) — это семейство методов обучения с подкреплением, сочетающих алгоритмы на основе политики (такие как методы градиента политики) с алгоритмами на основе оценки ценности (такими как итерация по значениям, Q-обучение, SARSA и обучение временным различиям (TD-обучение))[1].

Алгоритм актор-критик состоит из двух основных компонентов: «актора», который определяет действия на основе функции политики, и «критика», который оценивает эти действия на основе функции ценности[2]. Некоторые алгоритмы этого типа являются on-policy, другие — off-policy. Они могут применяться как к непрерывным, так и к дискретным пространствам действий.

Общие сведения

Методы «актор-критик» можно рассматривать как развитие чистых методов градиента политики, например REINFORCE, за счёт введения базовой линии (baseline).

Актор

Актор использует функцию политики , в то время как критик оценивает или функцию ценности , или Q-функцию , или функцию преимущества , либо их комбинацию.

Актор представляет собой параметрическую функцию , где  — параметры актора. На вход актор получает состояние среды и формирует распределение вероятностей .

Если пространство действий дискретно, то . Если пространство действий непрерывно, то .

Цель оптимизации политики — улучшение актора, то есть подбор таких параметров , которые максимизируют ожидаемое суммарное вознаграждение:

коэффициент дисконтирования

Методы градиента политики нацелены на оптимизацию с помощью градиентного подъёма по градиенту политики .

Как подробно описано на странице метод градиента политики, существует множество несмещённых оценок градиента политики:

  • .
  • : алгоритм REINFORCE.
  • : алгоритм REINFORCE с базовой линией, где  — произвольная функция.
  • : обучение с временным различием TD(1).
  • .
  • : Advantage Actor-Critic (A2C)[3].
  • : TD(2).
  • : TD(n).
  • : TD(λ) (также известная как generalized advantage estimate, GAE)[4]. Это реализовано как экспоненциально затухающее по λ среднее по слагаемым TD(n).

Критик

В приведённых выше несмещённых оценках встречаются функции , аппроксимируемые критиком. Поскольку эти функции зависят от состояния актора, критик обучается параллельно с актором с использованием методов обучения с подкреплением на основе ценности.

Например, если критик оценивает функцию ценности состояния , она может быть получена любым методом аппроксимации функций. Пусть критик — аппроксиматор с параметрами .

Самый простой пример — TD(1), обучающий критика минимизировать ошибку временного различия:

Аналогично, если критик аппроксимирует функцию действия , обучение может выполняться с помощью Q-обучения или SARSA. В SARSA критик хранит оценку Q-функции с параметрами : . Ошибка временного различия: . Тогда обновление:

[3]

Оценка обобщённого преимущества (GAE) (англ. generalized advantage estimation) вводит гиперпараметр , который плавно интерполирует между возвратами Монте-Карло (, высокая дисперсия, отсутствие смещения) и одношаговым TD-обучением (, низкая дисперсия, смещение максимально). Это позволяет подобрать оптимальный баланс смещения и дисперсии в оценке преимущества, реализуемый как экспоненциальное среднее n-шаговых возвратов с постоянной затухания [4].

Варианты

  • Асинхронный актор-критик с преимуществом (A3C) (англ. Asynchronous Advantage Actor-Critic): параллельная асинхронная версия A2C[3].
  • Мягкий актор-критик (SAC) (англ. Soft Actor-Critic): реализует максимизацию энтропии для улучшения исследования[5].
  • Глубокий детерминированный градиент политики (DDPG) (англ. Deep Deterministic Policy Gradient): специализирован для непрерывных пространств действий[6].

Примечания

  1. Arulkumaran, Kai; Deisenroth, Marc Peter; Brundage, Miles; Bharath, Anil Anthony (ноябрь 2017). “Deep Reinforcement Learning: A Brief Survey”. IEEE Signal Processing Magazine [англ.]. 34 (6): 26—38. arXiv:1708.05866. Bibcode:2017ISPM...34...26A. DOI:10.1109/MSP.2017.2743240. ISSN 1053-5888. Дата обращения 2024-06-20. Проверьте дату в |date= (справка на английском); |access-date= требует |url= (справка)
  2. Konda, Vijay; Tsitsiklis, John (1999). “Actor-Critic Algorithms”. Advances in Neural Information Processing Systems [англ.]. MIT Press. 12. Дата обращения 2024-06-20.
  3. 1 2 3 Mnih, Volodymyr; Badia, Adrià Puigdomènech; Mirza, Mehdi; Graves, Alex; Lillicrap, Timothy P.; Harley, Tim; Silver, David; Kavukcuoglu, Koray (16 июня 2016). “Asynchronous Methods for Deep Reinforcement Learning” [англ.]. arXiv:1602.01783. Дата обращения 2024-06-20. |access-date= требует |url= (справка)
  4. 1 2 Schulman, John; Moritz, Philipp; Levine, Sergey; Jordan, Michael; Abbeel, Pieter (20 октября 2018). “High-Dimensional Continuous Control Using Generalized Advantage Estimation” [англ.]. arXiv:1506.02438. Дата обращения 2024-06-20. |access-date= требует |url= (справка)
  5. Haarnoja, Tuomas; Zhou, Aurick; Hartikainen, Kristian; Tucker, George; Ha, Sehoon; Tan, Jie; Kumar, Vikash; Zhu, Henry; Gupta, Abhishek (29 января 2019). “Soft Actor-Critic Algorithms and Applications” [англ.]. arXiv:1812.05905. Дата обращения 2024-06-20. |access-date= требует |url= (справка)
  6. Lillicrap, Timothy P.; Hunt, Jonathan J.; Pritzel, Alexander; Heess, Nicolas; Erez, Tom; Tassa, Yuval; Silver, David; Wierstra, Daan (5 июля 2019). “Continuous control with deep reinforcement learning” [англ.]. arXiv:1509.02971. Дата обращения 2024-06-20. |access-date= требует |url= (справка)

Литература