Dec, 2017

多任务强化学习中的层次和可解释技能获取

TL;DR本文提出了一种用于有效的多任务强化学习的新框架,该框架可以训练代理人使用分层策略,决定何时使用先前学习的策略和何时学习新技能。该方法通过给代理人提供随机时间语法来帮助代理人学习分层策略中必要的复杂时间依赖关系,并在Minecraft游戏中进行了验证。