智能AI
morning
展望未来:深度强化学习的前瞻解释
摘要
arXiv:2608.09967v1 Announce Type: new Abstract: Deep reinforcement learning (DRL) agents achieve strong performance in complex environments, yet their decision-making processes remain difficult to int...
the
and
SPOT
policy
tree
DRL
their
sampling
based
policies
2026-08-13
1 阅读
约1分钟阅读
Tamar Gozlan, Claudia V. Goldman
字号:
arXiv:2608.09967v1 公告类型:新 摘要:深度强化学习(DRL)代理在复杂环境中取得了强大的性能,但其决策过程仍然难以解释。我们引入了 SPOT(采样策略观察树),这是一种与模型无关、基于采样的新颖框架,用于解释 DRL 策略。如果可以访问策略和环境模拟器,SPOT 通过对操作进行采样并递归地模拟结果后继状态来构建可解释的有限范围树。该树提供了政策行动偏好及其可能的下游演变的经验表示。我们提供正式的保证,建立 SPOT 渐近恢复策略的独特最可能行为,并描述其在高熵策略下的分歧行为。我们在 SUMO-RL 交通信号控制域中演示 SPOT。该案例研究说明了如何使用其基于树的表示来检查政策偏好、比较替代的未来轨迹,并揭示通过单时间步特征归因方法不可见的下游行为。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱