Jun, 2018
带代理损失的上下文自适应赌博机:边界与高效算法
Contextual bandits with surrogate losses: Margin bounds and efficient
algorithms
TL;DR本文使用代理损失函数导出了新的后悔界限和新的算法,其中借助于坡道损失函数,我们导出了新的边界界限。同时也根据标准顺序复杂度度量了回归函数的基准类,使用铰链损失函数,导出了一种有效的算法,并且其中包含了一个以$d$维度回归器引出的基准方针。在实现假设下,本研究的结果也可以得出经典的后悔边界。