从黑箱到可执行逻辑:通过Prolog专家系统的可解释强化学习
摘要
本文提出了一种从深度强化学习策略中提取可执行Prolog程序的方法,提供了关于回报和保真度的理论保证,实现了可解释性和手动编辑。
arXiv:2607.15459v1 公告类型:新
摘要:训练好的深度强化学习策略是一个黑箱,我们探究是否可以通过将其重写为一个可执行逻辑程序来使其可解释,该程序能复现其行为,且人能阅读、逻辑引擎能运行、优化器能编辑。我们提出一种三阶段事后转换方法:提取冻结的近端策略优化教师,以经典关系学习的方式从其决策中归纳出有序规则列表,并将结果输出为一个Prolog程序,该程序的每个决策由现成的逻辑引擎执行;随后的扩展阶段编辑规则库,且仅在策略评估确认回报增加时才接受编辑。我们证明了四个保证。一个回报损失界限使得蒸馏后的程序成为有限马尔可夫决策过程中机器可检验的证书,扩展循环单调改进并终止。对于连续观测设置,我们回答了转换是否可能的问题:命题阈值实例化将网络转换为任意保真度,随着分辨率B的增长,不一致性为O(1/B),回报差距以相同速率缩小,而匹配的下界表明,对于倾斜决策边界,代价在观测维度上呈指数增长。实验上,在一个具有16,944个可达状态的两室钥匙门任务中,扩展后的Prolog程序在每个随机种子下均达到精确最优回报,并且在预算受限情况下,在十个种子中的十个种子上在精确回报方面超过了随机教师。在三个连续控制任务中,输出的程序取代了网络,在Acrobot上使用十一条子句匹配了神经教师(误差范围内),在CartPole上恢复了约97%的回报,而在更精细控制的LunarLander上仅部分恢复,恰好是指数下界预测的上限。
查看缓存全文
缓存时间: 2026/07/20 09:21
# 从黑盒到可执行逻辑:通过Prolog专家系统实现可解释强化学习
来源:https://arxiv.org/html/2607.15459
Eduardo C\. Garrido\-Merchán
技术研究所 (IIT),科米利亚斯教皇大学
DIGNUM AI伦理与数据权利中心
西班牙马德里
ecgarrido@comillas\.edu
###### 摘要
一个训练好的深度强化学习策略是一个黑盒,我们提出问题:能否通过将其重写为一个可执行逻辑程序来使其可解释,该程序能够重现其行为,并且人可以阅读、逻辑引擎可以运行、优化器可以编辑。
我们提出一个三阶段事后转换方法:提取一个冻结的近端策略优化教师;从其决策中以经典关系学习的方式归纳出一个有序规则列表;将结果输出为一个Prolog程序,其每个决策都由现成的逻辑引擎执行。随后一个扩展阶段编辑规则库,并且仅在策略评估认证回报增加时才接受该编辑。
我们证明了四个保证。一个回报损失上界使得蒸馏后的程序成为有限马尔可夫决策过程中的机器可验证证书,并且扩展循环单调改进并终止。对于连续观测设定,我们回答了转换是否可能:命题阈值实例化将网络转换为任意保真度,随着分辨率增长,不一致性为O(1/B),回报差距以相同速率闭合,并且一个匹配的下界表明,对于斜决策边界,规则数量在观测维度上呈指数增长,Ω(B^{d-1})。
实验上,在一个双房间钥匙门任务中,有16,944个可达状态,扩展后的Prolog程序在每个种子中达到精确最优回报,并且在预算受限机制下,在十个种子中精确回报均超过随机教师。在三个连续控制任务中,输出的程序替代了网络,在Acrobot上用十一个子句匹配神经教师(在噪声范围内),在CartPole上恢复了约97%的回报,而在更精细控制的LunarLander上仅部分恢复,这恰好达到了指数下界预测的上限。
## 1 引言
一个训练好的深度强化学习策略是一个密集的数值对象,关于它学到了什么这一实践性问题通常间接回答,通过显著性图、代理分数或反事实探测,但没有一个能产生可以阅读、执行和编辑的人造物。最古老的人工智能形式提供了另一种答案。符号专家系统将其行为表达为一组规则,人类可以检查,逻辑引擎可以运行,最近的工作表明这两种传统可以联系起来,使用大语言模型来起草经典专家系统的规则库(Garrido-Merchán and Puente, 2025 (https://arxiv.org/html/2607.15459#bib.bib7))。本文在强化学习内部采取了相反方向:不是通过手工或提示编写规则,而是从训练好的神经策略中恢复它们,并且我们探究恢复的符号程序能被推进到多远。我们产生的对象不是热力图或近似分数,而是一个可以执行任务的Prolog程序,我们回答的问题是,这样的程序能否匹配或超过其蒸馏来源的网络。
我们目标的人造物有三个特性。首先,提取是事后进行的:教师是任何冻结的策略,此处是近端策略优化智能体(Schulman et al., 2017 (https://arxiv.org/html/2607.15459#bib.bib17)),其训练过程未做任何修改以使其可解释。其次,学生是一个可执行的一阶逻辑程序,是一个基于谓词词汇表的有序子句列表,在SWI-Prolog (Wielemaker et al., 2012 (https://arxiv.org/html/2607.15459#bib.bib23))下无需更改即可运行,而不是命题决策树或拟合的评分函数。第三,流水线不止于模仿。一旦规则库存在,一个回报最大化的扩展阶段编辑它,并且仅保留那些策略评估预言机证实能提高回报的编辑,因此符号学生可以在教师错误的地方超越教师。
我们做出三项贡献。第一是转换流水线本身,包括一个提取阶段,该阶段查询冻结教师的贪婪动作(覆盖完整可达状态普查及其自身访问);一个归纳阶段,该阶段以FOIL算法的方式(Quinlan, 1990 (https://arxiv.org/html/2607.15459#bib.bib15))贪婪地增长一个有序的一阶规则列表;以及一个扩展阶段,该阶段在规则库编辑空间上进行精确回报的爬山。第二是理论分析。我们证明了一个回报损失上界:用蒸馏程序替换贪婪教师损失的回报最多为2R_max ε^† / (1−γ)^2,其中ε^†是教师折扣访问加权的分歧率,并且我们证明在有限马尔可夫决策过程中,这个不等式成为机器可验证的证书,因为其两边都可以通过求解线性系统精确计算。我们还证明扩展循环单调改进回报并停止。对于连续观测设定,我们回答了转换原则上是否可能:命题阈值实例化随着分辨率增长将网络转换为任意保真度,不一致性和回报差距均以O(1/B)速率闭合,并且这种转换遵循维度诅咒,我们将其精确化为Ω(B^{d-1})的下界,即任何轴对齐规则列表被斜决策边界所迫的规则数量。第三项贡献是在一个足够小的双房间钥匙门环境上的实验研究,该环境允许精确策略评估,扩展后的Prolog程序在收敛和预算受限教师设定下的每个种子中都达到精确最优回报,并且在受限设定中,在十个种子的精确回报上超过随机教师,平均配对边际为0.100,95%置信区间为[0.096, 0.104]。然后我们展示,同样的流水线以其命题形式在三个连续控制任务上运行,其中普查被DAgger循环(Ross et al., 2011 (https://arxiv.org/html/2607.15459#bib.bib16))取代,精确评估被蒙特卡洛取代,产生一个Prolog程序,在CartPole和Acrobot上替代网络,而在更精细控制的LunarLander上仅部分恢复,这既展示了转换超越了可枚举设定,也标志着命题学生的精度在哪里耗尽。我们全程报告四分位均值及分层自助法区间,采用Agarwal et al. (2021 (https://arxiv.org/html/2607.15459#bib.bib1))的方法,并且明确说明数据不支持的内容,包括在我们使用的折扣因子下回报损失证书的空洞性,以及在多重比较校正后蒸馏程序与扩展程序之间缺乏统计显著差异。
## 2 相关工作
将训练好的策略蒸馏成可解释代理是一个成熟的路线。VIPER通过DAgger风格的过程从深度Q网络中提取决策树,并为树学生证明了回报上界(Bastani et al., 2018 (https://arxiv.org/html/2607.15459#bib.bib2));程序化可解释强化学习通过神经预言机引导搜索领域特定程序空间(Verma et al., 2018 (https://arxiv.org/html/2607.15459#bib.bib21)),而其模仿投影后继将搜索视为镜像下降(Verma et al., 2019 (https://arxiv.org/html/2607.15459#bib.bib22))。线性模型U树将分段线性树拟合到网络行为(Liu et al., 2018 (https://arxiv.org/html/2607.15459#bib.bib13)),最近的工作将策略蒸馏成可编辑的程序化树,并研究何时可以手动修正(Kohler et al., 2024 (https://arxiv.org/html/2607.15459#bib.bib10))。我们的提取和归纳阶段完全处于这一传统中,而定理1 (https://arxiv.org/html/2607.15459#Thmtheorem1) 是决策列表版的VIPER树界,区别在于在我们的有限设定中,错误率是精确计算而非估计的。模仿到无憾在线学习的经典约简(Ross et al., 2011 (https://arxiv.org/html/2607.15459#bib.bib16))是当状态空间太大而无法枚举时替换我们彻底普查的工具。
目标语言使我们的工作与这一路线的大部分区别开来。一个平行的研究方向直接学习一阶逻辑策略,要么通过训练可微分的归纳逻辑层(Jiang and Luo, 2019 (https://arxiv.org/html/2607.15459#bib.bib8)),要么通过预训练的神经智能体引导符号规则搜索(Delfosse et al., 2023 (https://arxiv.org/html/2607.15459#bib.bib4)),要么在游戏中发明解释性谓词(Sha et al., 2024 (https://arxiv.org/html/2607.15459#bib.bib18)),要么将符号和神经策略混合在一个可训练模型中(Shindo et al., 2025 (https://arxiv.org/html/2607.15459#bib.bib19));概念瓶颈智能体将策略与以对象为中心的概念对齐,以实现相同的可解释性目标(Delfosse et al., 2024 (https://arxiv.org/html/2607.15459#bib.bib5))。这些方法训练逻辑,而我们则是事后从固定的神经教师中提取它。最接近的事后工作综合了来自强化学习策略的集合值命题规则,并在环境中改进它们(Coppens et al., 2021 (https://arxiv.org/html/2607.15459#bib.bib3));我们的学生是一阶、可执行的Prolog程序而非命题规则集,并且我们的扩展阶段优化精确回报而非修复保真度。
符号策略可以超越深度网络的观察已被用于闭合形式控制器的符号回归(Landajuela et al., 2021 (https://arxiv.org/html/2607.15459#bib.bib12)),并且有限状态控制器已从循环策略中提取(Koul et al., 2019 (https://arxiv.org/html/2607.15459#bib.bib11)),但两者都没有闭环,其中提取的逻辑程序被扩展到超越其教师。关系强化学习(Dzeroski et al., 2001 (https://arxiv.org/html/2607.15459#bib.bib6))是我们所用一阶表示的知识先驱,而最近的可解释强化学习综述(Milani et al., 2024 (https://arxiv.org/html/2607.15459#bib.bib14))将整个蒸馏家族置于上下文中,并将我们方法所占据的事后一阶可执行单元格基本留空。
## 3 问题设定
我们在无限水平折扣设定中工作,状态空间和动作空间有限。本文所有结果均基于以下假设,我们将在全文按其编号引用。
###### 假设 1(有限折扣MDP,有界奖励)。
环境是一个马尔可夫决策过程 M = (S, A, P, r, γ, μ_0),其中状态空间 S 和动作空间 A 是有限的,P(· | s, a) 是对于每个 (s, a) ∈ S × A 在 S 上的概率分布,奖励函数 r: S × A → R 满足 |r(s, a)| ≤ R_max,已知常数 R_max < ∞,折扣因子满足 γ ∈ (0, 1),并且 μ_0 是 S 上的概率分布,初始状态从中抽取。
*平稳策略* 是一个映射 π: S → Δ(A),其中 Δ(A) 表示 A 上概率分布的集合;我们用 π(a | s) 表示 π 在状态 s 选择动作 a 的概率。*确定性策略* 是一个映射 π: S → A,等同于将所有概率质量放在 π(s) 上的平稳策略。
给定策略 π,过程 (s_t, a_t)_{t≥0},其中 s_0 ∼ μ_0,a_t ∼ π(· | s_t),s_{t+1} ∼ P(· | s_t, a_t),是由 π 诱导的轨迹分布,我们记 Pr_{μ_0}^π 和 E_{μ_0}^π 表示其下的概率和期望。
###### 定义 1(价值函数和回报)。
在假设 1 (https://arxiv.org/html/2607.15459#Thmassumption1) 下,策略 π 的*状态价值函数*为
V^π(s) = E^π [ ∑_{t=0}^∞ γ^t r(s_t, a_t) | s_0 = s ],
*动作价值函数*为
Q^π(s, a) = r(s, a) + γ ∑_{s' ∈ S} P(s' | s, a) V^π(s'),
*优势函数*为
A^π(s, a) = Q^π(s, a) - V^π(s).
π 的*回报*为
J(π) = E_{s ∼ μ_0}[ V^π(s) ].
定义 V^π 的级数绝对收敛,因为 |r(s_t, a_t)| ≤ R_max 且 γ ∈ (0, 1),几何级数上界给出
|V^π(s)| ≤ R_max / (1 - γ), |Q^π(s, a)| ≤ R_max / (1 - γ), |A^π(s, a)| ≤ 2R_max / (1 - γ) (1)
对每个 π, s, a 成立。A^π 的上界由定义 A^π = Q^π - V^π 应用三角不等式得到。(1) (https://arxiv.org/html/2607.15459#S3.E1) 中的范围为定理 1 (https://arxiv.org/html/2607.15459#Thmtheorem1) 和命题 1 (https://arxiv.org/html/2607.15459#Thmproposition1) 提供了常数。
###### 定义 2(教师和 argmax 教师)。
*教师* π_T 是一个固定的随机平稳策略,在我们的实验中,它是收敛或预算受限 PPO 智能体(Schulman et al., 2017 (https://arxiv.org/html/2607.15459#bib.bib17))的 softmax 策略,训练后冻结。在 A 上固定一个全序。教师对状态 s 的*argmax 动作*为
a_T(s) = min { a ∈ A : π_T(a | s) = max_{a' ∈ A} π_T(a' | s) },
最小值按 A 上的固定序取,因此平局被确定性打破。*argmax 教师*是确定性策略 π̄_T(s) = a_T(s)。
整个论文中,蒸馏阶段的模仿目标是 argmax 教师 π̄_T,而非随机策略 π_T。该约定在此声明并一致使用:学生被训练以重现 a_T(s),定理 1 (https://arxiv.org/html/2607.15459#Thmtheorem1) 的回报损失上界是针对 J(π̄_T) 表述的,随机教师 π_T 与其 argmax 之间的差距 J(π_T) - J(π̄_T) 未在理论中分析,但可能在某些环境中显著(见附录备注)。相似文章
通过归纳逻辑编程解释强化学习智能体
本文引入归纳逻辑编程来提取强化学习策略的符号化表示,并提出了新颖的可解释性度量(激活率、特征覆盖度、语法距离和语义距离),用于在单智能体和多智能体设置中进行客观评估。
@jiqizhixin:太棒了!关于推理型LLM的强化学习现状 https://aweers.de/blog/2026/rl-for-llms/…
一篇全面回顾推理型LLM强化学习现状的博文,涵盖从REINFORCE、PPO到GRPO乃至更多方法,并与InstructGPT、DeepSeek-R1等关键模型相联系。
ESPO:早期停止近端策略优化
ESPO为强化学习引入了一种早期停止机制,能够检测并终止大语言模型中失败的推理轨迹,从而提升数学推理性能,同时减少超过20%的计算量。
SocraticPO:通过交互式指导的策略优化
SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。
基于 Lean 的过程验证强化学习用于定理证明
本文提出了过程验证强化学习,利用 Lean 证明助手作为过程预言机,在训练期间提供细粒度的策略级反馈,从而提升定理证明性能。