通过归纳逻辑编程解释强化学习智能体
摘要
本文引入归纳逻辑编程来提取强化学习策略的符号化表示,并提出了新颖的可解释性度量(激活率、特征覆盖度、语法距离和语义距离),用于在单智能体和多智能体设置中进行客观评估。
arXiv:2607.13655v1 公告类型:新
摘要:可解释强化学习旨在使强化学习策略更加透明和可解释,这是在安全关键和以人为中心的场景中的关键要求。然而,它主要基于用户研究,因此针对特定受众的需求,缺乏共享的评估指标。另一方面,可解释人工智能中的基于逻辑的方法提供了紧凑、人类可读的决策抽象。然而,逻辑表示的可解释程度的系统性量化仍然是一个开放问题。本工作旨在通过引入面向目标和规划的指标来提升XRL在策略可解释性方面的水平。同时,它通过提供一种量化逻辑规则可解释性的原则性方法,超越了常识评估和简单的命题片段,为XAI的逻辑领域做出了贡献。我们采用归纳逻辑编程来提取RL策略的符号化表示,并定义了一组新颖的可解释性指标,包括激活率、特征覆盖度、语法距离和语义距离。这些指标量化了符号规则与智能体行为之间的一致性、特征在决策中的作用,以及在单智能体和多智能体RL中策略在训练过程中和跨智能体的演变。在多个RL领域的实验表明,所提出的指标突出了超越全局回报的动作特定学习动态,提供了超越经典全局特征重要性估计方法的领域特征的细粒度洞察,并揭示了MARL中的协调、专门化和适应模式。此外,它们为动作特定策略的迁移和泛化提供了关键见解。
查看缓存全文
缓存时间: 2026/07/16 04:24
# 利用归纳逻辑编程解释强化学习智能体 来源:https://arxiv.org/html/2607.13655 \\JAIRAE\\JAIRTrack 深度学习中的逻辑约束整合 ###### 摘要\. ††∗同等贡献11footnotetext:通讯作者 背景:可解释强化学习(XRL)旨在使强化学习(RL)策略更加透明和可解释,这在安全关键和人本场景中是一个关键要求。然而,它主要基于用户研究,因此针对特定受众的需求,缺乏共享的评估指标。另一方面,可解释人工智能(XAI)中基于逻辑的方法提供了紧凑、人类可读的决策抽象。然而,逻辑表示的可解释程度的系统化量化仍然是一个未解决的问题。 目标:本工作旨在通过引入面向客观和规划的单智能体和多智能体RL策略可解释性度量指标,推动XRL领域的发展。同时,它通过提供一种原则性的方法来量化逻辑规则的可解释性,超越了常识性评估和简单的命题片段,为XAI的逻辑领域做出贡献。 方法:我们采用归纳逻辑编程(ILP)来提取RL策略的符号表示,并定义了一组新颖的可解释性度量指标,包括激活率、特征覆盖度、句法距离和语义距离。这些指标量化了符号规则与智能体行为之间的一致性、特征在决策中的作用,以及在单智能体和多智能体强化学习(MARL)中策略在训练期间和跨智能体的演变。 结果:跨不同RL领域的实验表明,所提出的度量指标能够揭示超越全局回报的动作特定学习动态,提供超越经典全局特征重要性估计方法的领域特征细粒度洞察,并揭示MARL中的协调、专门化和适应模式。此外,它们为动作特定策略的迁移和泛化提供了关键洞察。 结论:我们的框架通过提供严格、客观且可解释的度量指标来评估符号策略表示,从而推动了XRL的发展。这有助于理解、调试和改进RL智能体,为在动态、安全关键和多智能体环境中构建更稳健和可信的应用程序铺平了道路。 ## 1\. 引言 强化学习(RL)(SuttonBarto2018)已成为序贯决策问题的强大范式,在机器人技术和自主系统等复杂领域取得了显著成功(kendall2019learning;levine2016end;silver2016mastering)。尽管取得了这些进展,但一个关键的局限性依然存在:RL智能体所学策略缺乏透明度和可解释性。在许多现实世界场景中,特别是那些涉及安全关键应用或人机交互的场景,理解智能体行为背后的基本原理对于建立信任、确保符合领域约束以及支持调试和验证过程至关重要。可解释人工智能(XAI)旨在通过开发使机器学习(ML)模型对人类更可解释的方法来应对这些挑战。近年来,在可解释机器学习(XML)方面取得了显著进展,特别是在解决监督学习模型的可解释性方面(burkart2021survey)。无论可解释性是通过归因(即特征重要性)、反事实还是逻辑规则实现的,XAI主要关注以用户为中心的评估(marques-silva2025logic)或定量度量指标,例如解释的大小及其相对于原始模型的保真度和稳健性,这些指标的适用性仅限于基于表格的ML(perotti2024metrics)。在RL领域,这个问题探索得甚至更少,其中智能体与复杂的、非稳态环境交互,并通过反复试错来学习策略(milani2024survey)。在这个方向上,大多数现有方法依赖于以用户为中心的标准,如保真度、可理解性和偏好性(milani2024survey),这些标准在从人类理解和用户满意度的角度评估解释质量方面起着至关重要的作用。然而,为了迈向标准化和严格的评估,用客观的度量指标来补充这些主观维度非常重要,这些指标能够跨不同领域和用户群体一致地评估解释,确保评估的效率和有效性(ras2022explainable;retzlaff2024human)。可解释ML中典型的“特征重要性”概念可以部分地适应到RL上下文中,以识别决定智能体动作的最相关环境特征(sequeira2020interestigness)。然而,可解释强化学习(XRL)文献中对智能体训练过程的深入和客观(即独立于用户)分析的重视程度有限(ras2022explainable;retzlaff2024human)。虽然最近的框架(amparore2021trust;nauta2023anecdotal)代表了朝着定义更系统的可解释性评估迈出的重要步骤,但它们主要针对静态监督学习环境中的特征归因解释。因此,它们不能直接应用于从RL智能体导出的策略,特别是在动态环境中。例如,很少探索如何评估不同动作下所学策略的质量,这可能有助于理解智能体在哪些决策上更自信或更稳健,从而为泛化潜力和策略改进需求提供洞察。此外,评估多智能体环境中学习策略的收敛性对于理解智能体间关系至关重要(foerster2016learning)。另一个相关方面是在相同回报下分析智能体策略的变化,这可能揭示从语义角度截然不同的、同样有价值的替代策略。最后,识别多智能体强化学习(MARL)中非稳态背后的原因可以为这类系统的动态和稳定性提供宝贵见解(foerster2016learning)。 为了解决上述局限性,我们的工作引入了一组新颖的可解释性度量指标,专门设计用于从RL策略中提取的符号表示。我们专注于逻辑形式主义,因为它是建模智能体决策过程的一个强大且多功能的工具;这一点得到了研究界对神经符号(NeSy)整合日益增长的兴趣的证实,这种整合将基于神经网络的ML与来自符号方法的知识表示和推理相结合(garcez2023neurosymbolic)。在此背景下,大量的努力致力于提取策略的符号表示,例如基于规则的模型和逻辑公式,它们为智能体的决策过程提供了紧凑、人类可读的抽象(darwiche2022quantifying;marques-silva2025logic)。已经提出了几种方法,通过观察RL智能体的行为来推断此类符号表示(meli2024learning;veronese2023inductive;furelos2021induction)。然而,据我们所知,当前文献中仍然存在一个关键的空白:缺乏系统性和与用户无关的标准来衡量RL训练过程和生成策略的可解释性水平(ras2022explainable;retzlaff2024human)。在此背景下,我们专注于评估以回答集编程(ASP)形式主义(gelfond1988stable)表达的逻辑策略表示,这是自主智能体的一种成熟符号表示范式(meli2023logic)。我们通过归纳逻辑编程(ILP)(law2015learning)从RL策略评估中学习ASP策略表示,从一组用户定义的谓词开始,这些谓词描述了领域的动作和主要环境特征。我们提出的度量指标超越了单纯的特征重要性和评估可解释性的主观标准,专注于RL策略的更高级和面向规划的关键方面,例如其对环境条件的稳健性和泛化能力。我们通过实验表明,这些指标可以有效地用于评估和解释RL智能体的动态训练过程,并评估所学技能的稳健性、可靠性和泛化能力,无论是在单智能体还是多智能体RL环境中。具体来说,我们做出以下贡献: - •我们定义了一组新颖的、客观的、与用户无关的可解释性度量指标,用于量化RL智能体的不同方面。这些指标包括所学ASP策略表示的激活率,即符号规则与智能体实际行为一致的程度(有助于突出智能体对哪些特定动作的策略更有信心);特征覆盖度,用于量化符号特征在智能体决策过程中的影响(类似于XML中的特征重要性);句法距离和语义距离,用于衡量两个符号(逻辑)策略表示之间的差异,从而揭示训练期间智能体技能的潜在演变或多个智能体之间的收敛情况; - •我们进行了彻底的实证研究,以评估我们的指标为XRL带来的优势。具体来说,我们考虑了不同复杂性和特征的RL环境,从单智能体RL(Intersection),到合作型(RWARE)和对比型(Simple Adversary)多智能体RL,这些环境具有内在的非稳态性和不同智能体学习过程之间的动态互连性; - •我们根据可解释性标准和指标对最优序贯决策的效用进行分析。具体来说,我们表明,我们的指标可用于评估智能体针对特定动作的子策略的泛化能力(通过激活率),并识别特定技能的学习或多智能体一致性的出现(通过语义和句法距离)。 本文的其余部分组织如下:在第2节 (https://arxiv.org/html/2607.13655#S2)中,我们回顾了XAI的最新研究,重点关注XRL,特别是使用逻辑和形式方法来增强可解释性。然后,在第3节 (https://arxiv.org/html/2607.13655#S3)中,我们介绍了关于马尔可夫决策过程(MDP)、ASP和ILP的相关背景知识和符号。在第4节 (https://arxiv.org/html/2607.13655#S4)中,我们提出了所提出的可解释性度量指标,以及学习待评估的逻辑策略表示的过程。然后我们在第5节 (https://arxiv.org/html/2607.13655#S5)中进行了广泛的实证评估。最后,在第6节 (https://arxiv.org/html/2607.13655#S6)中,我们总结了获得的结果,并讨论了工作的优点和局限性,还分析了未来可能的扩展。 ## 2\. 相关工作 可解释人工智能(XAI)旨在提高AI系统的透明度和可解释性(dwivedi2023explainable)。在此背景下,基于逻辑的方法作为提供结构化且形式化基础的学习模型解释的手段,日益受到关注。特别是,符号表示允许以可解释和可验证的形式表达AI智能体的行为和决策过程(darwiche2022quantifying;marques-silva2025logic)。由于环境的动态性和许多学习策略的黑箱特性,将可解释性技术应用于强化学习(RL)仍然具有挑战性。因此,可解释强化学习(XRL)领域已经开发了多种方法,旨在提高RL智能体及其决策过程的可解释性。然而,许多现有方法要么专注于针对特定用户群体的可解释策略表示,要么分析学习策略的有限方面,例如策略输出的特征重要性(retzlaff2024human),而没有提供客观和系统的标准来评估解释。在下文中,我们分析三个主要领域的相关工作:(i) 决策中的可解释性,侧重于事后和行为总结方法;(ii) RL中的可解释性,涉及旨在实现全局策略级理解的方法;(iii) 用于可解释性的基于逻辑的方法,该方法利用领域的形式化符号表示来增强AI模型的透明度和可验证性。我们的工作位于第二和最后一个研究领域的交叉点,特别关注从RL智能体执行轨迹派生的基于逻辑的解释,并引入用于评估所得符号策略近似值的度量指标。 ### 2\.1\. 决策系统中的可解释性 决策中的可解释性通常旨在为用户提供对智能体选择或策略的可理解的理由。几种方法侧重于事后可解释性方法,这些方法在不修改底层策略的情况下分析和解释智能体的决策,因此可应用于任何类型的决策智能体。例如,基于显著性图的技术(greydanus2018visualizing)通过突出显示智能体观察空间中的重要区域来生成视觉解释,而像(zahavy2016graying)这样的方法使用t分布随机邻居嵌入(t-SNE)将高维状态表示映射到可解释的二维空间。然而,这些方法通常存在计算开销,并且缺乏非专业用户的可访问性。 总结智能体行为以突出训练期间的关键时刻或状态的努力也引起了关注。例如,(amir2018summarizing)提出了识别策略总结关键状态的策略,而(huang2018establishing)则强调关键的决策点,帮助用户对智能体建立适当的信任。扩展这些想法,(sequeira2020interestigness)引入了一个领域无关的框架,该框架使用不同的“趣味性”标准,利用交互数据(如状态访问次数、动作频率、转移概率和值估计)来生成训练期间智能体交互的总结。然而,这些方法严重依赖用户研究作为其唯一的评估方法,从而引入了与生成解释的可扩展性和一致性相关的挑战。 针对这一局限性,最近的评估框架提出了更原则性的方法来评估XAI方法。Co-12框架(nauta2023anecdotal)确定了解释应满足的十二个核心属性,如正确性、完整性和一致性,并系统地分类了每种属性的评估方法。类似地,LEAF框架(amparore2021trust)提出了一组用于定量评估局部解释忠实度和稳定性的度量指标,包括局部保真度、重述相似性和规定性。虽然这些努力代表了迈向标准化评估的重要进步,但它们主要集中在特征归因方法上,忽略了策略评估的其他相关方面,例如技能的多样性和课程
相似文章
从黑箱到可执行逻辑:通过Prolog专家系统的可解释强化学习
本文提出了一种从深度强化学习策略中提取可执行Prolog程序的方法,提供了关于回报和保真度的理论保证,实现了可解释性和手动编辑。
从动作引导中学习智能体策略
本文提出了 ActGuide-RL,这是一种利用人类动作数据作为指导来训练大语言模型(LLM)智能体策略的方法,旨在无需大量监督微调的情况下克服强化学习中的探索障碍。
MechRL:强化学习代理用于机制可解释性中的电路发现
提出了 MechRL,一种利用强化学习自动发现 transformer 语言模型中电路的方案。经过多任务训练的 PPO 代理发现了与已知典型电路匹配的注意力头电路,并能泛化到一项保留任务上。
多智能体系统中的策略表示学习
OpenAI 研究人员提出了一个通用框架,用于在多智能体系统中使用最少的交互数据学习智能体策略的表示,将该问题视为表示学习,并应用于竞争控制和合作通信环境。
AIPO:通过与主动交互学习推理
本文介绍了 AIPO,一种强化学习框架,通过允许模型在探索过程中主动咨询协作智能体,从而克服能力边界,提升大语言模型的推理能力。