Jun, 2019

离线策略评估方法(Off-Policy Evaluation)基于离线策略分类(Off-Policy Classification)

TL;DR本文旨在解决深度强化学习领域中的模型选择问题,并提出一种基于 Q 函数作为决策函数的正无标记(PU)分类问题的度量方法来评估离线策略评估的性能,该方法适用于具有连续动作空间和稀疏二元奖励的马尔可夫决策过程,并且在一些任务上表现优于基线算法。