强化学习的反事实解释

Oct, 2022

Counterfactual Explanations for Reinforcement Learning

Jasmina Gajcin, Ivana Dusparic

TL;DR通过重新定义反事实解释方法，结合强化学习的特点，探索在强化学习领域实现反事实解释的方法和研究方向。

Abstract

While ai algorithms have shown remarkable success in various fields, their lack of transparency hinders their application to real-life tasks. Although →

ai algorithms transparency explanations counterfactual explanations reinforcement learning

发现论文，激发创造

GANterfactual-RL: 通过视觉反事实解释理解强化学习智能体的策略

本论文提出了一种新颖而简单的方法，将问题形式化为域转移问题，使用 StarGAN 等对抗性学习技术来生成 RL 代理的反事实解释，证明该方法在分析不同代理机器人的学习策略时表现最佳。

Feb, 2023

通过生成深度学习为强化学习智能体提供反事实状态解释

本文提出了一种基于生成式深度学习的新颖例子法方法，生成针对深度强化学习代理在视觉环境中操作（如 Atari）的反事实状态解释，探究这种解释的有效性，并对非专家参与者进行了测试比较。结果表明，与最近邻基线或根本没有解释相比，反事实状态解释对于帮助非专家参与者识别出有缺陷的强化学习代理具有足够的真实性。

Jan, 2021

机器学习的反事实解释和算法补救措施综述

本文综述分类了反事实解释的研究，包括如何评估和设计反事实解释算法，探讨了反事实解释在机器学习领域中的研究方向和发现的不足之处。

Oct, 2020

强化学习的经验性解释

通过 Experiential Explanations 生成局部反事实解释来帮助解释强化学习代理的决策，利用影响预测模型来恢复失去的关于策略如何反映环境的情境信息，并在人类评估研究中实现了更高的正确预测率和更高的解释实用性。

Oct, 2022

计算反事实解释的方法 —— 一项调查研究

机器学习模型日益广泛应用，因此解释其预测和行为变得越来越重要。本文综述了针对多种不同机器学习模型高效计算对抗性解释的模型特定方法，并提出了文献中尚未考虑的模型方法。

Nov, 2019

强化学习中的反事实解释策略

通过引入反事实解释，COUNTERPOL 框架能够分析强化学习政策，并找到引导所需结果的政策最小改变，展示其在设计和开发反事实政策方面的实用性。

Jul, 2023

RACCER：面向强化学习的可达到和确定的反事实解释

本文提出 RACCER，这是第一个针对 RL 行为生成对抗性解释的 RL 特定方法，我们使用 RL 特定的对抗性属性，并使用启发式树搜索算法来查找最合适的对抗性解释，并进行了用户研究以证明对抗性解释可以帮助用户更好地理解 RL 代理的行为。

Mar, 2023

对策说明的随机优化

通过提出一种基于随机学习的框架和特征选择模块来平衡反事实解释的权衡，本研究在生成可行的反事实解释方面展现了其有效性，并表明其比基线更加多样化和高效。

Sep, 2022

使用策略蒸馏的深度强化学习模型反事实解释框架

该论文提出一种新颖的反事实解释框架，以解释黑盒 DRL 的决策，并在自动驾驶系统和 Atari Pong 游戏领域进行了多项实验。分析表明，所提出的框架为深层 DRL 的各种决策生成了可行且有意义的解释。

May, 2023

理解反事实解释对人工智能辅助临床决策中信任与依赖的影响

通过使用显著特征解释和假设性解释来更加分析性地对待人工智能建议，可以降低对人工智能的过度依赖，提高医疗决策过程中的性能和一致性，尤其是在确保人工智能提供正确输出的情况下。

Aug, 2023