Nov, 2019

序列零和线性二次动态博弈的策略梯度全局收敛

TL;DR该研究提出了基于策略梯度的无投影序列算法来处理线性二次动力博弈问题,并证明了如果采用自然梯度下降 / 上升,该算法具有对纳什均衡的全局次线性收敛性;此外,如果领导者采用拟牛顿策略,该算法将具有全局二次收敛性。