Oct, 2022

通用和随机博弈纳什均衡学习的去中心化策略梯度

TL;DR研究了一种具有未知转移概率密度函数的一般和随机游戏的纳什平衡学习。介绍一种加权渐近纳什均衡的概念,并提出了两种算法,一种是针对精确伪梯度的,另一种是针对未知伪梯度的。