知识与梯度引导的参数化动作马尔可夫决策过程强化学习

arXiv cs.AI 论文

摘要

本文提出了KGRL,一种神经符号算法,利用以Datalog表达的领域知识来剪枝动作并约束参数,在参数化动作马尔可夫决策过程中提高了样本效率和回合回报,优于现有最先进的基线方法。

arXiv:2607.12924v1 公告类型:新 摘要:本文研究了参数化动作马尔可夫决策过程(PAMDP)中的强化学习,其中每个决策由符号动作和数值参数组成。在这种设置下,强化学习算法通常使用一次估计器确定参数,这使得训练样本效率低下。尽管在大多数PAMDP环境中,显式但不完整的知识(例如规则、安全约束或专家启发式)是可用的,但很少直接用于提高强化学习智能体训练的样本效率。我们填补了这一空白,提出了新颖的神经符号知识与梯度引导强化学习(KGRL)算法。KGRL利用Datalog知识库中的领域知识,推导出给定状态下适用的动作集合和可行参数。这使得它能够从决策空间中剪除非适用动作,并约束剩余动作的参数空间。然后,我们使用基于梯度的参数精化循环,在智能体的训练和部署期间估计最优参数。通过记录轨迹中激活的规则,KGRL还提供了关于动作剪枝和参数约束的局部程序性解释。总体而言,KGRL引导智能体的探索和部署走向可行且约束感知的决策,同时提高训练期间的样本效率。KGRL在样本效率和回合回报方面均优于PAMDP的最先进强化学习基线。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:21

# 面向参数化动作马尔可夫决策过程的知识与梯度引导强化学习
来源:https://arxiv.org/html/2607.12924
René Heesch1,2 Oliver Niggemann1,2  
\affiliations1HSU\-AI Institute for Artificial Intelligence 2Institute of Automation Technology Helmut\-Schmidt\-University, Hamburg, Germany  
\emails\{firstname\.lastname\}@hsu\.hamburg

###### 摘要

本文研究参数化动作马尔可夫决策过程(PAMDP)中的强化学习,其中每个决策由符号化动作和数值参数组成。在此类设定中,强化学习算法通常使用单步估计器来确定参数,这使得其训练样本效率低下。尽管大多数PAMDP环境中存在显式但不完整的知识(例如规则、安全约束或专家启发式方法),但很少直接利用这些知识来提高强化学习智能体训练的样本效率。我们填补了这一空白,提出了新颖的神经符号知识与梯度引导强化学习(KGRL)算法。KGRL利用存储在Datalog知识库中的领域知识,为给定状态推导出适用的动作集和可行参数。这使得我们能从决策空间中剪除不适用的动作,并约束剩余动作的参数空间。然后,我们使用基于梯度的参数精化循环,在智能体的训练和部署过程中估计最优参数。通过沿轨迹记录激活的规则,KGRL还能为动作剪枝和参数约束提供局部过程化解释。总体而言,KGRL将智能体的探索和部署引导至可行且遵循约束的决策,同时提升训练样本效率。在PAMDP任务中,KGRL在样本效率和回合回报上均超越了最先进的RL基线方法。

## 1 引言

当准确的符号化模型不可用或构建成本过高时(例如由于连续、随机或高维动态),强化学习(RL)可替代符号化决策算法进行规划和控制(?;?)。然而,训练RL智能体需要海量经验(以记录的训练数据或直接领域交互的形式),而通过探索收集此类经验通常成本高昂或不安全(?;?)。即便如此,在复杂的现实世界领域中,通常存在显式但不完整的领域知识(例如规则、安全约束或专家启发式方法),这些知识可以排除不安全或不可行的决策,而无需完全确定最优行为(?;?)。因此,本文要回答的核心问题是:显式但不完整的领域知识能否塑造RL智能体的训练和部署,使得(i)符号推理强制实施已知约束,同时(ii)将学习优化留给那些无法符号化指定的部分?

我们在参数化动作空间中研究这一问题,此时决策不仅涉及选择一个符号化动作,还涉及选择影响动作效果的数值参数(?)。这种混合结构引人关注,因为它在许多现实世界决策问题中很常见,例如工业控制和规划(?;?),其中高层动作本质上是符号化的(如`open_valve`, `start_pump`, `fill_tank`),但可以容纳数值参数(如`valve_opening`, `pump_speed`, `fill_height`)。此类场景的根本问题在于,决策空间是多个互不相交的连续空间的并集,且往往具有不同维度。近似方法,如将所有不相交的连续空间扁平化为单个连续控制空间,或对它们进行离散化,可能会错过可行或最优的参数值,或允许违反约束的动作或参数。这需要专门针对此类问题量身定制的算法。

关于参数化动作空间中RL的相关工作依赖于决策时的单步估计器来估计动作的参数(?;?;?;?)。然而,这些方法需要大量训练回合,并且不能直接解决部署RL智能体时出现分布外场景的风险。关于将知识融入RL智能体的相关工作通常侧重于构建领域模型(?;?;?)、在分布外场景中指定目标(?),或约束智能体以实现安全探索和部署(?;?;?;?)。直到最近,才出现少量方法开始从神经符号角度审视RL,将符号化决策作为RL策略的护栏或增强(?;?;?)。然而,这些方法通常仅在离散的玩具领域上评估。据我们所知,目前尚无工作将结构化的、可查询的知识库直接融入参数化动作空间中RL智能体的训练和参数估计中,以引导探索和部署走向可行决策并提升训练数据效率。

为填补这一空白,我们提出了新颖的神经符号知识与梯度引导强化学习(KGRL)算法。KGRL为DQN算法(?)引入两个耦合的扩展:一个**知识库**,包含状态相关规则,在每次动作和参数选择前进行评估;以及一个**梯度引导参数精化**循环,利用智能体动作-价值函数的梯度来寻找最优参数。我们提出以下研究问题(RQs):

**RQ1:将符号化知识库中的显式领域知识融入RL智能体的训练,是否能提升样本效率和性能?**

假设已经存在一个关于该领域的符号化规则知识库,我们建议利用该知识将智能体的探索和部署限制在已知无害的领域区域。具体而言,在每个智能体步骤,我们评估一个Datalog知识库以及一个符号化状态表示,以推导出给定状态下的适用动作集和参数约束。这使我们能够将探索和部署精简至仅适用动作和可行参数。

**RQ2:与单步估计器相比,梯度引导的参数精化能否提升RL智能体的样本效率和性能?**

在参数化动作空间中,每一步的决策问题包括选择一个动作**和**一个连续参数。现有算法通常使用单步估计器,通过一次前向传播为给定的状态和动作组合预测参数值。然而,为了将其调整为选择最优参数且不违反领域约束,它们的训练变得样本效率低下。因此,我们提出一种梯度引导的参数精化方法,它利用动作-价值函数的梯度,迭代调整参数值直至收敛到最优值。通过使用投影梯度上升(?),我们可以整合来自知识库的已知参数约束,以排除不现实的参数区域(例如温度低于0K)或违反已知领域约束的参数。

**RQ3:将符号化知识库中的显式领域知识融入RL智能体的部署,能否生成动作和参数选择的解释?**

当在每个步骤评估符号化知识库和状态表示时(参见RQ1),KGRL可以记录作为解释的、支持从决策空间中排除动作和活跃参数约束推导的已接地规则实例和符号化状态事实。此类记录沿着智能体的轨迹构成局部和过程化解释(?)。这对于安全关键的现实世界应用尤为重要,并与可解释和安全RL的工作相关(?;?;?)。

我们针对文献中的基线方法(?;?;?;?;?)评估了KGRL算法。KGRL在所有基线上表现更优,起始回报更高,且更快收敛到最优结果。我们的主要贡献包括:

- • 一种知识约束的参数化动作马尔可夫决策过程的形式化,允许RL智能体将符号化领域知识纳入其决策制定中。
- • 我们新颖的KGRL算法,将符号化知识库上的推理和梯度引导的参数精化整合到其决策制定中,从而带来更高的样本效率和性能。
- • 对KGRL与最先进基线方法的实证评估。
- • 展示如何在KGRL部署过程中,通过逐步评估知识库来记录局部和过程化解释轨迹。

## 2 相关工作

#### 参数化动作空间中的RL

该方向由(?)引入,其中作者将参数化动作马尔可夫决策过程(PAMDP)定义为包含数值参数的决策问题的基础形式化。在PAMDP中,决策空间是多个互不相交的连续动作子空间的并集,每个动作子空间由一个符号化动作和一个数值参数集定义(?)。早期方法将此问题视为两个耦合的决策。在(?)中,用于选择符号化动作的策略和用于选择参数的策略在训练期间交替更新。(?)延续了这一思路,提出了一种actor-critic方法,其中用于符号化动作和数值参数的独立策略头并行地在联合状态编码上操作。其他方法则将决策问题建模为联合策略。例如,(?)提出了一种actor-critic方法,其中一个策略网络输出符号化动作及其对应参数。相反,(?)将参数估计解耦到独立的参数估计器网络中,该网络建议参数值,然后与状态一起由深度Q网络(?)进行联合评估。(?)通过使用参数元素的批处理改进了这一方法,这减轻了参数之间的混淆效应,并带来更鲁棒的训练。最后,(?)提出利用联合的潜在决策空间来解决决策问题,并从该空间解码出符号化动作和数值参数。在这些方法中,动作适用性和参数可行性是隐式学习的,这导致了样本密集型的探索,并且如果环境不加以阻止,可能导致不可行的参数。

#### 将模型和约束知识注入RL

将领域知识注入RL算法的一种基本方式是将知识整合到领域模型或动态假设中,如基于模型的RL所做的那样(?)。例如,(?;?)证明了棋盘游戏的基于规则的动态模型可以帮助RL智能体在这些领域的决策问题中超越人类表现。此外,还有一系列工作将约束纳入RL,主要用于安全探索和可行利用。(?)提出了约束策略优化(CPO),这是一种通过预期成本约束进行正则化的策略梯度方法,旨在训练过程中始终保持策略更新接近可行性,而不仅仅在收敛时满足约束。同样地,(?)通过检查动作的允许性并以此约束动作选择来正则化RL智能体的探索。然而,这些约束并非来自结构化领域知识,而是依赖于训练前或训练期间学习到的函数(?)。

#### 将符号推理融入RL

大多数将符号推理用于评估动作适用性并融入RL智能体训练的方法集中在安全RL领域(?;?)。(?)在安全自动机中使用时序逻辑来评估状态-动作对,并作为屏蔽来过滤不安全动作。然而,其算法仅在离散状态和动作空间上运行。(?)使用混合系统模型的已验证模型约束来创建用于维持系统安全行为的监视器。(?)使用投影到预先定义的可验证符号策略类中,以允许安全探索。与我们的工作最接近的无疑是(?)和(?)。(?)建议通过使用符号状态抽象评估答案集编程规则获得的软符号策略来增强DQN智能体,而(?)使用概率语句决策图来屏蔽不合适的动作。然而,这些方法仍然局限于离散领域(?;?)。

尽管总体上存在将符号知识与RL相结合的工作,但据我们所知,目前尚无工作关注将不完整符号知识与参数化动作空间中的RL相结合。

## 3 问题形式化

在本节中,我们形式化如何将参数化动作空间中的RL与符号推理连接起来。为此,我们基于参数化动作马尔可夫决策过程(PAMDP)(?),并用Datalog知识库和抽象函数对其进行扩充。这使我们能够将数值PAMDP状态抽象为符号化表示,并与知识库一起评估,以推导出适用动作和参数约束。

### 3.1 参数化动作马尔可夫决策过程

一个PAMDP是一个元组

⟨S,A,\{Ψa\}a∈A,T,r,γ⟩        (1)

其中 S ⊆ Rn 是连续状态空间,A 是有限的符号化动作集合。每个动作 a ∈ A 关联一个连续参数空间 Ψa ⊆ Rma。因此,混合参数化动作空间是集合

A = {(a, ψ) | a ∈ A, ψ ∈ Ψa}.        (2)

T 是转移函数 T = P(s' | s, a, ψ),描述在状态 s ∈ S、动作 a ∈ A 和参数 ψ ∈ Ψa 下转移到状态 s' ∈ S 的概率。r 是奖励函数 r : S × A × S → R,在从 s 到 s' 转移时返回标量奖励。γ ∈ [0, 1) 是折扣因子。

策略是一个函数 π : S → A。执行 π 产生一个轨迹 (s, (a, ψ), r, d, s', (a', ψ'), r', d', ...),其中 π(s) = (a, ψ),s' ∼ T(·|s, a, ψ),r = r(s, a, ψ),d ∈ {0,1} 指示一个回合是否结束(d=1)或未结束(d=0)。策略的性能由其期望折扣回报度量:

J(π) = Eπ [∑_{t=0}^{∞} γ^{t} r(s_t, a_t, ψ_t)].        (3)

### 3.2 符号抽象与知识库

在现实世界领域中,通常存在显式但不完整的领域知识,形式为规则、安全约束和专家启发式方法。这些知识通常排除不安全或不可行的决策,但不指定最优行为。表示此类领域知识的一种方式是采用Datalog知识库 K。

#### 符号抽象

为了将数值PAMDP状态 s ∈ S 与符号知识库 K 连接起来,我们需要从数值状态表示到符号状态表示的抽象。因此,我们假设

相似文章

从动作引导中学习智能体策略

arXiv cs.CL

本文提出了 ActGuide-RL,这是一种利用人类动作数据作为指导来训练大语言模型(LLM)智能体策略的方法,旨在无需大量监督微调的情况下克服强化学习中的探索障碍。

超越推理:强化学习释放大型语言模型中的参数化知识

arXiv cs.CL

本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。

AdaKP:面向推理的强化学习的在线自适应知识点选择

arXiv cs.AI

介绍了AdaKP,一种在线自适应知识点选择器,能够在强化学习训练过程中动态重新选择注入哪些原子提示,以缓解推理任务中的奖励稀疏问题,在竞赛级数学基准上取得了改进,且开销可忽略不计。