ICLROct, 2020

勘探的保守安全批评家

TL;DR本文介绍了一种基于保守安全估计的强化学习安全探索方法,通过批判学习环境状态的保守安全估计,从理论上上界限制了灾难性失败概率,实验证明该方法在解决导航、操作和运动任务时达到了具有竞争力的任务性能,同步显著降低了灾难性失败率。