Алгоритм актор-критик
Алгори́тм акто́р-кри́тик (англ. actor-critic algorithm, AC) — это семейство методов обучения с подкреплением, сочетающих алгоритмы на основе политики (такие как методы градиента политики) с алгоритмами на основе оценки ценности (такими как итерация по значениям, Q-обучение, SARSA и обучение временным различиям (TD-обучение))[1].
Алгоритм актор-критик состоит из двух основных компонентов: «актора», который определяет действия на основе функции политики, и «критика», который оценивает эти действия на основе функции ценности[2]. Некоторые алгоритмы этого типа являются on-policy, другие — off-policy. Они могут применяться как к непрерывным, так и к дискретным пространствам действий.
Общие сведения
Методы «актор-критик» можно рассматривать как развитие чистых методов градиента политики, например REINFORCE, за счёт введения базовой линии (baseline).
Актор
Актор использует функцию политики , в то время как критик оценивает или функцию ценности , или Q-функцию , или функцию преимущества , либо их комбинацию.
Актор представляет собой параметрическую функцию , где — параметры актора. На вход актор получает состояние среды и формирует распределение вероятностей .
Если пространство действий дискретно, то . Если пространство действий непрерывно, то .
Цель оптимизации политики — улучшение актора, то есть подбор таких параметров , которые максимизируют ожидаемое суммарное вознаграждение:
коэффициент дисконтирования
Методы градиента политики нацелены на оптимизацию с помощью градиентного подъёма по градиенту политики .
Как подробно описано на странице метод градиента политики, существует множество несмещённых оценок градиента политики:
- .
- : алгоритм REINFORCE.
- : алгоритм REINFORCE с базовой линией, где — произвольная функция.
- : обучение с временным различием TD(1).
- .
- : Advantage Actor-Critic (A2C)[3].
- : TD(2).
- : TD(n).
- : TD(λ) (также известная как generalized advantage estimate, GAE)[4]. Это реализовано как экспоненциально затухающее по λ среднее по слагаемым TD(n).
Критик
В приведённых выше несмещённых оценках встречаются функции , аппроксимируемые критиком. Поскольку эти функции зависят от состояния актора, критик обучается параллельно с актором с использованием методов обучения с подкреплением на основе ценности.
Например, если критик оценивает функцию ценности состояния , она может быть получена любым методом аппроксимации функций. Пусть критик — аппроксиматор с параметрами .
Самый простой пример — TD(1), обучающий критика минимизировать ошибку временного различия:
Аналогично, если критик аппроксимирует функцию действия , обучение может выполняться с помощью Q-обучения или SARSA. В SARSA критик хранит оценку Q-функции с параметрами : . Ошибка временного различия: . Тогда обновление:
[3]
Оценка обобщённого преимущества (GAE) (англ. generalized advantage estimation) вводит гиперпараметр , который плавно интерполирует между возвратами Монте-Карло (, высокая дисперсия, отсутствие смещения) и одношаговым TD-обучением (, низкая дисперсия, смещение максимально). Это позволяет подобрать оптимальный баланс смещения и дисперсии в оценке преимущества, реализуемый как экспоненциальное среднее n-шаговых возвратов с постоянной затухания [4].
Варианты
- Асинхронный актор-критик с преимуществом (A3C) (англ. Asynchronous Advantage Actor-Critic): параллельная асинхронная версия A2C[3].
- Мягкий актор-критик (SAC) (англ. Soft Actor-Critic): реализует максимизацию энтропии для улучшения исследования[5].
- Глубокий детерминированный градиент политики (DDPG) (англ. Deep Deterministic Policy Gradient): специализирован для непрерывных пространств действий[6].
Примечания
- ↑ Arulkumaran, Kai; Deisenroth, Marc Peter; Brundage, Miles; Bharath, Anil Anthony (ноябрь 2017). “Deep Reinforcement Learning: A Brief Survey”. IEEE Signal Processing Magazine [англ.]. 34 (6): 26—38. arXiv:1708.05866. Bibcode:2017ISPM...34...26A. DOI:10.1109/MSP.2017.2743240. ISSN 1053-5888. Дата обращения 2024-06-20. Проверьте дату в
|date=(справка на английском);|access-date=требует|url=(справка) - ↑ Konda, Vijay; Tsitsiklis, John (1999). “Actor-Critic Algorithms”. Advances in Neural Information Processing Systems [англ.]. MIT Press. 12. Дата обращения 2024-06-20.
- ↑ 1 2 3 Mnih, Volodymyr; Badia, Adrià Puigdomènech; Mirza, Mehdi; Graves, Alex; Lillicrap, Timothy P.; Harley, Tim; Silver, David; Kavukcuoglu, Koray (16 июня 2016). “Asynchronous Methods for Deep Reinforcement Learning” [англ.]. arXiv:1602.01783. Дата обращения 2024-06-20.
|access-date=требует|url=(справка) - ↑ 1 2 Schulman, John; Moritz, Philipp; Levine, Sergey; Jordan, Michael; Abbeel, Pieter (20 октября 2018). “High-Dimensional Continuous Control Using Generalized Advantage Estimation” [англ.]. arXiv:1506.02438. Дата обращения 2024-06-20.
|access-date=требует|url=(справка) - ↑ Haarnoja, Tuomas; Zhou, Aurick; Hartikainen, Kristian; Tucker, George; Ha, Sehoon; Tan, Jie; Kumar, Vikash; Zhu, Henry; Gupta, Abhishek (29 января 2019). “Soft Actor-Critic Algorithms and Applications” [англ.]. arXiv:1812.05905. Дата обращения 2024-06-20.
|access-date=требует|url=(справка) - ↑ Lillicrap, Timothy P.; Hunt, Jonathan J.; Pritzel, Alexander; Heess, Nicolas; Erez, Tom; Tassa, Yuval; Silver, David; Wierstra, Daan (5 июля 2019). “Continuous control with deep reinforcement learning” [англ.]. arXiv:1509.02971. Дата обращения 2024-06-20.
|access-date=требует|url=(справка)
Литература
- Konda, Vijay R.; Tsitsiklis, John N. (январь 2003). “On Actor-Critic Algorithms”. SIAM Journal on Control and Optimization [англ.]. 42 (4): 1143—1166. DOI:10.1137/S0363012901385691. ISSN 0363-0129. Дата обращения 2024-06-20. Проверьте дату в
|date=(справка на английском) - Sutton, Richard S. Reinforcement learning: an introduction : [англ.] / Richard S. Sutton, Andrew G. Barto. — 2. — Кембридж, Массачусетс : The MIT Press, 2018. — ISBN 978-0-262-03924-6.
- Bertsekas, Dimitri P. Reinforcement learning and optimal control : [англ.]. — 2. — Бельмонт, Массачусетс : Athena Scientific, 2019. — ISBN 978-1-886529-39-7.
- Grossi, Csaba. Algorithms for Reinforcement Learning : [англ.]. — 1. — Чам : Springer International Publishing, 2010. — ISBN 978-3-031-00423-0.
- Grondman, Ivo; Busoniu, Lucian; Lopes, Gabriel A. D.; Babuska, Robert (ноябрь 2012). “A Survey of Actor-Critic Reinforcement Learning: Standard and Natural Policy Gradients”. IEEE Transactions on Systems, Man, and Cybernetics - Part C: Applications and Reviews [англ.]. 42 (6): 1291—1307. Bibcode:2012ITHMS..42.1291G. DOI:10.1109/TSMCC.2012.2218595. ISSN 1094-6977. Дата обращения 2024-06-20. Проверьте дату в
|date=(справка на английском)