SPOTting the Future:深度强化学习的前瞻性解释
摘要
介绍了SPOT(采样策略观察树),一种模型无关的框架,通过构建有限时域前瞻树来揭示动作的下游后果,从而解释深度强化学习策略,并在SUMO-RL交通信号控制领域进行了演示。
arXiv:2608.09967v1 公告类型:新
摘要:深度强化学习(DRL)智能体在复杂环境中表现出色,但其决策过程仍然难以解释。我们引入了SPOT(采样策略观察树),一种新颖的、模型无关的、基于采样的DRL策略解释框架。在能够访问策略和环境模拟器的前提下,SPOT通过采样动作并递归模拟由此产生的后继状态,构建一棵可解释的有限时域树。该树提供了策略的动作偏好及其可能的下游演化的经验性表示。我们提供了形式化保证,证明SPOT能够渐近恢复策略唯一的最高概率动作,并刻画了其在高熵策略下的分歧行为。我们在SUMO-RL交通信号控制领域展示了SPOT。该案例研究说明了如何利用其基于树的表示来检查策略偏好、比较备选未来轨迹,并揭示通过单时间步特征归因方法无法观察到的下游行为。
查看缓存全文
缓存时间: 2026/08/12 08:19
# SPOTting the Future:面向深度强化学习的前瞻性解释
**来源**:https://arxiv.org/html/2608.09967
Tamar Gozlan1, Claudia Goldman2
1 耶路撒冷希伯来大学贝宁计算机科学与工程学院
2 耶路撒冷希伯来大学商学院数据科学系
\{tamar.gozlan, claudia.goldman\}@mail.huji.ac.il
###### 摘要
深度强化学习(DRL)智能体在复杂环境中表现出色,但其决策过程仍然难以解释。我们提出 SPOT(Sampling Policy Observation Tree,采样策略观测树),一种新颖的、模型无关的、基于采样的 DRL 策略解释框架。在能够访问策略和环境模拟器的前提下,SPOT 通过对动作进行采样并递归模拟后续状态,构建一棵可解释的有限时域树。这棵树为策略的动作偏好及其可能的后续演化提供了一种经验性表示。我们给出了形式化保证,证明 SPOT 能渐近恢复策略唯一的最可能动作,并刻画了其在高熵策略下的分歧行为。我们在 SUMO-RL 交通信号控制领域对 SPOT 进行了演示。案例研究表明,其基于树的表示可用于检查策略偏好、比较不同的未来轨迹,并揭示通过单时间步特征归因方法无法观察到的下游行为。
## 1 引言
尽管深度强化学习(DRL)在复杂决策任务中取得了成功,但由于其依赖大量数据、对不断变化的环境敏感以及缺乏可解释性,其在实际场景中的应用仍然受限(例如,Lekadi 等人(2025)(https://arxiv.org/html/2608.09967#bib.bib25))。现有的 DRL 可解释人工智能(XAI)方法大多聚焦于特征级归因,即识别哪些输入影响了某个给定动作。这些方法虽然有用,但本质上局限于单个时间步,无法捕捉决策如何影响未来状态。因此,它们无法解释长期后果,也无法发现那些影响随时间逐渐显现的次优决策。
我们提出 SPOT(Sampling Policy Observation Tree,采样策略观测树),一种全新的 XAI 框架,通过对智能体策略所引致的未来轨迹分布进行建模来解决上述局限。SPOT 通过动作采样和状态扩展构建一棵可解释的树,从而支持轨迹感知的解释,显式比较不同备选动作的结果。我们考虑一种人在回路的场景,其中智能体充当决策支持系统。因此,解释必须是可操作的,使操作员能够评估是遵循还是覆盖系统建议。SPOT 提供领域可读的摘要,突出关键信号以支持此类决策。我们在 SUMO-RL 交通控制环境中演示了 SPOT,表明它能揭示单时间步解释所遗漏的行为,并支持更明智的决策。
## 2 相关工作
深度强化学习(DRL)将强化学习(Sutton 和 Barto,2018)(https://arxiv.org/html/2608.09967#bib.bib12)与深度神经网络相结合,以从高维观测中学习策略。这种结合通过利用强大的函数逼近能力,使强化学习能够扩展到复杂环境(Dong 等人(2020)(https://arxiv.org/html/2608.09967#bib.bib1);Arulkumaran 等人(2017)(https://arxiv.org/html/2608.09967#bib.bib2))。
### 2.1 DRL 方法分类
DRL 方法通常分为基于价值的方法、基于策略的方法和 Actor-Critic 方法。这种分类反映了求解马尔可夫决策过程(MDP)的不同途径,其目标是最大化期望累积奖励(Dong 等人(2020)(https://arxiv.org/html/2608.09967#bib.bib1))。MDP 由元组 \(\langle S, A, P, R, \gamma \rangle\) 给出,其中 \(S\) 表示状态空间,\(A\) 表示动作集合,\(P\) 表示转移概率(这些概率并非 DRL 解所显式已知的),\(R\) 为奖励函数,\(\gamma\)相似文章
StraTA:通过策略轨迹抽象激励智能体强化学习
StraTA 提出了面向长期任务 LLM 智能体的策略轨迹抽象方法,通过分层 GRPO 风格的 rollout、多样化策略采样和批判性自判断机制,在样本效率和最终性能上超越了前沿模型和先前 RL 基线。
基于观测的自预测强化学习用于视觉连续控制
本文提出了 OG-SPR,一种无模型视觉强化学习算法,它将潜在自预测与观测预测相结合,学习具有动力学感知的表示,从而在 DeepMind Control Suite 任务上提高了样本效率。
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。
PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
基于梯度外推的策略优化
本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。