Oct, 2020

保持冷静探索:基于语言模型的基于文本的游戏行动生成

TL;DR本文提出了上下文行动语言模型(CALM),该模型结合人类玩家的语言先验以及游戏历史信息生成紧凑的候选操作列表,并结合强化学习代理对其进行排序以最大化游戏收益,我们的实验使用Jericho基准测试游戏并在训练期间未见过的游戏中获得了69%的相对平均游戏得分改进。