自适应系统中强化学习决策的解释

arXiv cs.LG 论文

摘要

本文介绍了 EARL,这是一个用于在强化学习中生成反事实解释的 Python 库,旨在提高自适应系统的透明度和用户信任。

arXiv:2608.14620v1 公告类型:新 摘要:强化学习(RL)已广泛应用于自主和自适应系统,但强化学习策略,尤其是依赖神经网络的深度强化学习策略,缺乏透明度且难以理解。这可能导致用户信任度下降,并使得系统验证更具挑战性。为了应对这一挑战,本文介绍了用于强化学习的替代现实解释(EARL),这是一个在强化学习设置中生成反事实解释的 Python 库。该库允许用户通过探索假设场景,比较可能的结果来阐明智能体的行为,从而生成解释。反事实解释在心理学研究中已被证明直观且用户友好,但直到最近才在强化学习中得到探索,现有实现通常仅限于玩具示例和基准测试。EARL 支持在基于强化学习的真实自适应系统中生成反事实解释。为了展示其适用性,我们演示了其在 CitiBikes 自适应共享单车系统模拟中的使用,并提供了评估结果,展示其在真实应用中的表现。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:17

# 强化学习决策在自适应系统中的解释
来源:https://arxiv.org/html/2608.14620
11institutetext:计算机科学与统计学院
都柏林圣三一学院
11email:\{gajcinj,roserolj,duspari\}@tcd\.ie###### 摘要

强化学习 \(RL\) 已被广泛应用于自主和自适应系统,但RL策略,尤其是依赖神经网络的深度RL策略,缺乏透明度且难以理解。这可能导致用户信任度降低,并使系统验证更具挑战性。为解决这一问题,本文介绍了"基于替代现实的强化学习解释"(EARL),这是一个用于在RL环境中生成反事实解释的Python库。该库允许用户通过探索假设情景来生成解释,通过比较可能的结果来阐明智能体的行为。心理学研究表明,反事实解释直观且易于用户理解,但直到最近才在RL中被探索,现有实现通常局限于简单示例和基准测试。EARL支持在基于现实的RL自适应系统中生成反事实解释。为证明其适用性,我们演示了它在CitiBikes\[13 (https://arxiv.org/html/2608.14620#bib.bib37)\](一个自适应共享单车系统)模拟中的应用,并提供了评估结果,展示其在实际应用中的表现。

## 1引言

自适应系统会根据环境变化动态调整其行为\[15 (https://arxiv.org/html/2608.14620#bib.bib1)\]。RL是实现自适应的最广泛使用的机器学习 \(ML\) 技术之一\[22 (https://arxiv.org/html/2608.14620#bib.bib14),4 (https://arxiv.org/html/2608.14620#bib.bib42)\],它允许智能体通过与环境的交互和反馈来学习最优策略\[26 (https://arxiv.org/html/2608.14620#bib.bib13)\]。然而,通过RL学习到的策略,尤其是使用神经网络的策略,通常由于神经网络固有的状态-动作映射过程而显得不透明且难以解释。

由于自适应系统需要与用户(包括非专家用户)协作并辅助他们,因此对解释的需求日益增长,以促进信任、便利验证并支持协作\[27 (https://arxiv.org/html/2608.14620#bib.bib5),30 (https://arxiv.org/html/2608.14620#bib.bib19),14 (https://arxiv.org/html/2608.14620#bib.bib18)\]。可解释强化学习 \(XRL\) 领域应运而生,但其许多方法是为开发者设计的,依赖于低级可视化或黑盒模型的全局近似\[24 (https://arxiv.org/html/2608.14620#bib.bib27),20 (https://arxiv.org/html/2608.14620#bib.bib11)\],通常需要高水平的技术专业知识。

相比之下,反事实解释通过展示不同条件下结果将如何变化,提供了高层次、用户友好的洞察。反事实解释通过展示“如果”情景来解释一个决策,阐明智能体为何做出该决策。例如,一个控制行走机器人的智能体可以通过展示如果它选择直行就会掉进坑里来解释其向左转的决定。这些方法已在监督学习中得到广泛应用\[29 (https://arxiv.org/html/2608.14620#bib.bib16),28 (https://arxiv.org/html/2608.14620#bib.bib12)\],但在RL中仍未得到充分探索\[8 (https://arxiv.org/html/2608.14620#bib.bib3)\]。至关重要的是,当前的研究进展受限于缺乏公开可用的工具,无法在真实的RL环境中生成和评估反事实解释。

为解决这一空白,我们推出了EARL,一个用于在RL中生成反事实解释的Python库。该库支持多种解释方法,使用户能够在复杂环境中探索“假设”情景。与现有通常绑定单一解释方法或局限于基准环境的实现不同,EARL提供了一个统一且可扩展的框架,将多种先进的反事实解释方法集成在一个通用接口下。该库包含可重用的模型封装器、标准化的评估框架以及参考实现,便于在不同RL智能体和环境中进行可复现的实验。此外,EARL扩展了现有方法,使其能够应用于自适应系统中常见的结构化状态表示。我们的工具旨在易于扩展、可复现,并适用于超越玩具领域的现实任务。我们演示了它在CitiBikes中的应用,这是一个受纽约市共享单车计划启发的模拟自适应单车调度系统\[13 (https://arxiv.org/html/2608.14620#bib.bib37)\]。我们评估了四种反事实解释方法,展示了它们如何在实际场景中揭示RL智能体行为背后的推理过程。该工具包括解释方法的实现、使用示例和实验设置,可在github111https://github.com/JuanK120/EARL获取。

本文其余部分的结构如下。在第2节 (https://arxiv.org/html/2608.14620#S2)中,我们提供了关于RL、XRL和反事实解释及其在自主系统中应用的背景知识。接着,在第3节 (https://arxiv.org/html/2608.14620#S3)中,我们概述了我们库包含的方法。第4节 (https://arxiv.org/html/2608.14620#S4)解释了我们库的构成和结构。最后,第5节 (https://arxiv.org/html/2608.14620#S5)展示了我们在真实场景中应用EARL的示例。

## 2相关工作

在本节中,我们首先概述自适应系统中的RL应用(第2.1节 (https://arxiv.org/html/2608.14620#S2.SS1))。第2.2节 (https://arxiv.org/html/2608.14620#S2.SS2)涵盖可解释RL的主题,而反事实解释则在第2.3节 (https://arxiv.org/html/2608.14620#S2.SS3)中介绍。

### 2.1自适应系统中的RL

RL是一种强大的ML方法,用于开发复杂的多目标策略。RL智能体适应不确定条件,并根据环境改变其行为。这使得RL适用于开发自适应系统,一些应用包括数据中心冷却\[10 (https://arxiv.org/html/2608.14620#bib.bib49)\]、无人机导航\[11 (https://arxiv.org/html/2608.14620#bib.bib51)\]和自适应服务器\[21 (https://arxiv.org/html/2608.14620#bib.bib50)\]。然而,RL决策往往难以解释,影响了其在高风险现实问题中的应用\[17 (https://arxiv.org/html/2608.14620#bib.bib38)\]。

### 2.2可解释RL

RL智能体,尤其是使用神经网络的智能体,其决策往往难以解释\[17 (https://arxiv.org/html/2608.14620#bib.bib38)\]。可解释性重要有多种原因:开发者需要它进行验证和调试\[5 (https://arxiv.org/html/2608.14620#bib.bib36),16 (https://arxiv.org/html/2608.14620#bib.bib34)\],专家不太可能信任不透明的系统\[3 (https://arxiv.org/html/2608.14620#bib.bib40)\],而欧盟GDPR等法律框架可能要求为公平性提供解释\[25 (https://arxiv.org/html/2608.14620#bib.bib33)\]。XRL专注于解释智能体决策的方法\[17 (https://arxiv.org/html/2608.14620#bib.bib38)\],它们被分为全局(解释整体行为)或局部(解释单个决策)方法。例如,行为摘要帮助用户理解智能体的优势\[1 (https://arxiv.org/html/2608.14620#bib.bib32)\],而显著性图则显示哪些输入区域影响了特定动作\[9 (https://arxiv.org/html/2608.14620#bib.bib26)\]。然而,大多数XRL方法面向开发者,提供低级的、特定任务的见解。非专家用户则需要高层次的、可操作的解释,以便有效地与RL系统交互。

### 2.3反事实解释

反事实解释的目标是通过呈现一个具有不同结果的替代场景,来解释为什么发生某个结果。这种对比性与人类推理相一致,使其具有直观的吸引力\[18 (https://arxiv.org/html/2608.14620#bib.bib7)\],其因果框架有助于用户分配责任\[2 (https://arxiv.org/html/2608.14620#bib.bib39)\]。这些特性使反事实解释特别用户友好。尽管在监督学习中被广泛研究\[28 (https://arxiv.org/html/2608.14620#bib.bib12)\],但RL中的反事实方法仍然有限\[19 (https://arxiv.org/html/2608.14620#bib.bib24),12 (https://arxiv.org/html/2608.14620#bib.bib25),8 (https://arxiv.org/html/2608.14620#bib.bib3)\]。在RL中,先前的工作也表明,在受控的用户研究中,反事实解释可以提高用户对智能体行为的理解并支持决策\[7 (https://arxiv.org/html/2608.14620#bib.bib15)\],此类方法旨在解释为什么智能体在状态\(s\)选择动作\(a\),通过生成一个相似的状态\(x'\),在该状态下会选择不同的动作\(a'\)。然而,尽管前景看好,RL中的反事实目前仅应用于像Gridworld和Atari游戏这样的简化环境。

## 3 RL中的反事实生成方法

在本节中,我们概述我们工具中实现的RL反事实生成方法。

### 3.1 GANterfactual-RL

GANterfactual-RL\[12 (https://arxiv.org/html/2608.14620#bib.bib25)\]是一种基于数据集的RL反事实生成方法。它仅需要智能体转换的数据集,但因此没有考虑环境的序列性或随机性。它将反事实生成框定为一个域迁移问题,将状态空间根据智能体的动作划分为域,并将状态从一个域转换到另一个域。基于StarGAN架构,它使用生成器生成逼真的状态,使用判别器区分生成状态和真实状态。原始的GANterfactual-RL实现(随原始论文发布)仅针对基于图像的输入;在我们的库中,我们实现了非图像版本以支持更广泛的应用。

### 3.2 RACCER

RACCER (面向RL的可达且确定的反事实解释)\[6 (https://arxiv.org/html/2608.14620#bib.bib52)\]是一种专门针对RL的方法,它通过探索从原始状态可达的状态,在智能体执行过程中搜索反事实,因此需要访问智能体的执行环境。它使用三个优化目标来评估和搜索反事实。首先,RACCER旨在最小化可达性,衡量原始状态\(x\)和反事实\(x'\)之间的距离,即它们之间的RL动作\(A\)的数量。其次是保真度,确保反事实\(x'\)是通过被解释策略可能的路径从原始状态到达的,以确保反事实代表智能体的策略。最后,RACCER确保即使在随机环境中,反事实也能以高确定性达到,这是通过优化随机不确定性来实现的。

RACCER有三种变体,它们在搜索和生成反事实的方式上有所不同:

#### 3.2.1 RACCER-HTS

在此变体中,我们使用启发式树搜索 (HTS) 来找到合适的反事实。RACCER将可达性、保真度和随机不确定性结合到一个损失函数中,以评估动作序列,平衡探索和利用。然后过滤结果,确保反事实状态\(x'\)导致目标动作\(a'\)。

#### 3.2.2 RACCER-Advance

此变体通过用进化算法 (NSGA-II) 替换树搜索来降低计算成本。RACCER-Advance从智能体的当前状态\(x_n\)开始生成反事实,探索未来的动作如何导致不同的决定。形式上,给定一个状态\(x_n\),它搜索一个动作序列\(A\),使得从\(x_n\)应用\(A\)导致一个反事实状态\(x'\)。这种变体允许用户提问:“未来可能有什么变化会导致不同的决定?”它保留了三个原始目标,并通过NSGA-II进行优化,生成多样且具有代表性的反事实。

#### 3.2.3 RACCER-Rewind

RACCER-Rewind通过修改智能体的过去来生成反事实。它将导致当前状态\(x_n\)的过去状态-动作序列\((x_{n-k}, a_{n-k}), ..., (x_{n-1}, a_{n-1})\)作为输入,并探索可能导致不同结果的替代过去序列。它搜索一个从\(x_{n-k}\)开始的修改后的动作序列\(A\),该序列导致一个反事实\(x'\),从而引出不同的决策。此变体回答诸如:“过去需要有什么不同?”之类的问题。与RACCER-Advance一样,它采用NSGA-II来优化相同的三个目标。

## 4 库结构

在本节中,我们将介绍EARL的结构和主要功能。该库采用模块化结构设计,可扩展以支持多种模型和实现。我们库的主要组件包括:1.解释方法,2.模型封装器,以及3.评估接口。此外,我们还包含了简单的深度Q学习算法和PPO算法的基础实现。

解释方法模块包含生成反事实解释的核心逻辑。每个解释算法都实现为一个独立的模块,暴露一个通用接口,允许用户选择所需策略,而无需修改库的其余部分。目前支持的方法有GANterfactual、RACCER-HTS、RACCER-Rewind和RACCER-Advance,在第3节 (https://arxiv.org/html/2608.14620#S3)中有描述。

模型封装器模块提供了EARL与RL智能体之间的通用接口。这些接口旨在便于在不同的RL模型上实现,以便EARL能够正确地与它们交互。这些模型假设存在预训练模型,或使用EARL中提供的默认智能体方法。这些封装器为RL智能体添加了一组通用函数,解释方法可以调用这些函数来检索智能体选择的动作和相关决策指标。因此,解释算法可以应用于不同的RL模型,而无需修改。

评估接口模块提供了用于比较解释方法的可重用工具。EARL提供两种机制来评估方法的质量和实用性:基于指标的评估和运行时日志记录。基于指标的评估在每个实现的评估模块中提供,它们计算覆盖率、生成时间、相似度、合理性和多样性等指标。这些指标为解释方法提供了比较,并帮助评估其性能。用户还可以扩展这些指标,以定义更适合其领域的评估标准。运行时日志记录在模拟过程中实时捕获智能体动作、解释输出和环境响应。

学习算法模块使用Stable Baselines3框架提供了DQN和PPO算法的基础实现。这些实现作为默认选项包含在其各自的模型封装器中,允许用户无需自定义模型即可立即测试解释方法。当没有提供预训练模型时,这些默认实现会提供默认的智能体策略,用于反事实生成。这确保了库可以开箱即用,而无需外部依赖。

相似文章

用于自适应交通信号控制的可解释强化学习

arXiv cs.AI

本文提出了一种可解释的以实体为中心的强化学习框架,用于自适应交通信号控制,该框架采用具有多头交叉注意力和自注意力的双阶段注意力网络,以提供可解释的亲和矩阵,同时将确定性动作掩码集成到PPO中以确保安全合规性。