Oct, 2022

受限马尔科夫决策过程中的安全策略改进

TL;DR该研究提出了一种解决增强学习自动合成策略的算法,该算法通过解决奖励形状设计和安全策略更新等挑战来实现,同时使用基于模型的 RL 算法来有效地利用我们收集的数据,并在标准控制基准中展示了其有效性和鲁棒性。