Jul, 2020

离线策略评估中的统计自举法用于不确定性估计

TL;DR本文研究了使用统计自助法来校准有偏策略价值估计结果得到置信区间的潜力,并提出了适用于实际情况的机制以减轻其影响。结果显示该方法在各种条件下能够产生准确的置信区间。