Oct, 2018

部分观察多智能体环境下的演员 - 评论家策略优化

TL;DR本研究讨论了基于梯度上升的策略梯度和演员 - 评论家算法在部分可观测多智能体环境中的角色,并通过对零和不完全信息游戏等模型的建模来优化模型自由多智能体增强学习的表现。