策略梯度搜索：无需搜索树的在线规划和专家迭代

Apr, 2019

策略梯度搜索：无需搜索树的在线规划和专家迭代

Policy Gradient Search: Online Planning and Expert Iteration without Search Trees

Thomas Anthony, Robert Nishihara, Philipp Moritz, Tim Salimans, John Schulman

TL;DR本研究提出一种用于模拟搜索的政策梯度搜索方法，通过在线更新神经网络模拟策略，实现避免使用搜索树的效果。在 Hex 上，与 MCTS 相比，PGS 取得了相当的性能，并且使用 PGS 进行专家迭代训练的代理能够在 9x9 Hex 中击败最强的开源 Hex 代理 MoHex 2.0。

Abstract

monte carlo tree search (mcts) algorithms perform simulation-based search to improve policies online. During search, the simulation policy is adapted to explore the most promising lines of play. →

monte carlo tree search mcts policy gradient search neural network hex

发现论文，激发创造

使用蒙特卡罗树搜索的策略梯度算法用于非马尔可夫决策过程

本文介绍一种结合 Policy Gradient 和 Monte-Carlo Tree Search 的混合策略，旨在克服两种方法在应对非马尔可夫决策过程上的困难，有效提升算法的效率。

Jun, 2022

连续蒙特卡罗图搜索

本文提出了 Continuous Monte Carlo Graph Search（CMCGS），一种将 Monte Carlo Tree Search（MCTS）扩展到连续状态和动作空间的在线规划方法，并在 DeepMind Control Suite 基准测试和 2D 导航任务中表现优异。

Oct, 2022

单智能体优化：通过蒙特卡罗树搜索进行策略迭代

本文提出了一种使用基于 Monte-Carlo Tree Search 和深度强化学习相结合的方法的搜索算法，通过 1）用于潜在无限奖励问题的新颖行动价值规范机制，2）定义虚拟损失函数实现有效搜索并行化，以及 3）由自我对弈逐代训练的策略网络引导搜索，来提高搜索算法的效果。我们在同类游戏 SameGame 上进行实验，结果表明我们的算法在多个游戏宽度上优于基准算法，并与公共状态搜索问题的最新算法竞争力相当。

May, 2020

蒙特卡罗树搜索用于策略优化

本文提出了一种基于蒙特卡罗树搜索和无梯度优化的策略优化方法，称为 MCTSPO，通过使用上界置信度启发式获得更好的探索 - 利用平衡，相对于基于梯度和深度遗传算法的基准，在具有欺骗性或稀疏奖励函数的强化学习任务中表现更佳。

Dec, 2019

使用 MCTSnets 学习搜索

该论文提出了一种名为 MCTSnet 的体系架构，其将基于模拟的搜索嵌入神经网络中，并通过向量嵌入扩展，评估和备份。该网络的参数进行端到端的训练优化，应用于小范围的搜索中，显著优于 MCTS 基线的性能。

Feb, 2018

在非稳态环境中的决策制定与策略增强搜索

在非固定环境下，通过结合过时策略的动作价值估计和最新环境模型的在线搜索，我们引入了一种名为 PA-MCTS 的增强蒙特卡洛树搜索方法，该方法解决了时限有限情况下的顺序决策问题，并在与 AlphaZero 和 Deep Q Learning 的对比实验中显示优越性。

Jan, 2024

蒙特卡洛树搜索：近期修改和应用综述

本文调查了 Monte Carlo Tree Search (MCTS) 在领域特定修改和混合方法方面的应用，这种方法依赖于智能树搜索并平衡探索和利用。

Mar, 2021

多策略价值蒙特卡罗树搜索

介绍了一种名为多策略值 MCTS (MPV-MCTS) 的新方法，它结合了多个不同大小的策略值神经网络 (PV-NN)，以平衡精确状态估计和更多的 MCTS 模拟，以提升游戏运行代理的性能。在 NoGo 游戏和 AZ 训练中，与单个 PV-NN 结合策略值 MCTS 相比，MPV-MCTS 表现更好。

May, 2019

进一步改进 PPO 算法：基于值导向的蒙特卡罗树搜索解码

通过将 MCTS 与 PPO 集成，在推断时生成自然语言文本，相较于仅使用 PPO 策略，PPO-MCTS 极大地提高了生成文本的优越性，减少了训练和测试之间的部分输出评分机制不匹配的问题，证明了搜索算法在与 PPO 进行对齐的语言模型上的潜力和价值网络的未充分探索的好处。

Sep, 2023

学习停止：动态模拟蒙特卡罗树搜索

本文提出一种名为 Dynamic Simulation MCTS 的算法，它通过预测当前状态的不确定性来决定是否停止搜索，实现了在不降低胜率的情况下，将 NoGo 智能体训练速度提高了 2.5 倍，并在同样的平均模拟次数下，取得了 61% 的胜率。

Dec, 2020