Oct, 2023

强化学习在具有轨迹优化的安全嵌入式马尔可夫决策过程中的应用

TL;DR这项研究将强化学习与轨迹优化相结合,以管理最大化奖励与遵守安全约束之间的权衡,并在安全性出发推理阶段取得显著高奖励和几乎零安全违规的性能,通过在真实机器人任务中将盒子推动穿越障碍物来展示了该方法的实际应用性。