在神经符号强化学习中管理动作前置条件:具身代理的三种放置策略

arXiv cs.LG 论文

摘要

本文将行为知识形式化为前置条件贝叶斯网络,并探讨了在神经符号强化学习中针对具身代理的三种放置策略,展示了在MiniGrid和Fetch等基准测试中在解决方案质量和样本效率方面的改进。

arXiv:2609.16056v1 公告类型:新 摘要:人类在每个新任务中带入如何在熟悉情况下行动的行为知识,而不是从头开始重新学习。没有理由强化学习(RL)智能体不应该这样做:已知的行为模式不需要学习,只需应用。神经符号强化学习通过将符号知识与学习策略一起注入来桥接先验知识和RL。这一点至关重要:不良的选择可能导致,例如,幻觉前置条件,这在变化环境中的智能体中表现为安全性和可靠性问题。我们将这种行为知识形式化为基于智能体\emph{结构动作}的前置条件贝叶斯网络(BN)——这些动作的合法性取决于前置条件,例如拾起钥匙、抓住块、切换门或丢弃对象。BN限制了这些动作何时可以触发,我们将其注入到RL循环中的三个放置点:(1) \emph{符号验证器},仅在推理时咨询,当前置条件满足时触发结构动作;(2) \emph{符号执行器},在训练和推理期间都活跃,贯穿整个学习过程控制结构动作的使用;(3) \emph{符号学习器},将知识折叠到网络中,并自己学习结构动作的限制和使用。为了测试这三个变体,我们在两个具有相反机制的基准测试上运行实验:一个基于长而有序的规划链,另一个基于连续操作。我们在解决方案质量、样本效率和可追溯性方面与强基线进行比较。回报是巨大的。在MiniGrid上,所有三种放置都比PPO+RND基线提高了\emph{解决方案质量},符号执行器以$98.2\%$领先于基线的$88.8\%$。在Fetch上,$\dots$
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:35

# 神经符号强化学习中动作前提条件的管理:具身智能体的三种部署策略
来源:https://arxiv.org/html/2609.16056
\\workshoptitle

神经符号具身智能

Norbert Oswald所属机构:分布式智能系统研究所所属机构:慕尼黑联邦国防军大学所属机构:德国慕尼黑邮箱:[norbert\.oswald@unibw\.de](mailto:)Fabian Deuser所属机构:分布式智能系统研究所所属机构:慕尼黑联邦国防军大学所属机构:德国慕尼黑邮箱:[fabian\.deuser@unibw\.de](mailto:)Thomas Bräunl所属机构:工程学院所属机构:西澳大学所属机构:澳大利亚珀斯邮箱:[Thomas\.Braunl@UWA\.edu\.au](mailto:)

###### 摘要

人类会将熟悉情境下的行为知识带入每一项新任务,而不是从头重新学习。没有理由认为强化学习(RL)智能体不应该这样做:已知的行为模式无需重新学习,只需应用即可。神经符号强化学习通过将符号知识注入学习策略,连接了先验知识与强化学习。这种知识整合的时机至关重要:选择不当可能导致例如产生幻觉前提条件,这在变化环境中行动的智能体会表现为安全性和可靠性问题。我们将此行为形式化为基于智能体*结构化动作*的先验条件贝叶斯网络(BN)——即那些合法性取决于前提条件的动作,例如捡起钥匙、抓取方块、切换门或丢弃物体。BN 限制了这些动作何时可以触发,我们将其在 RL 循环中以三种方式注入:(1)*符号验证器*,仅在推理时调用,在其前提条件满足时触发结构化动作;(2)*符号强制器*,在训练和推理期间均活跃,在整个学习过程中约束结构化动作的使用;(3)*符号学习器*,将知识融入网络并自行学习结构化动作的限制与使用。为测试这三种变体,我们在两个具有相反特性的基准测试上进行实验:一个基于长序列有序规划链,另一个基于连续操作。我们与强基线方法在解质量、样本效率和可追溯性方面进行比较。结果收益显著。在 MiniGrid 上,所有三种部署方式相较于 PPO+RND 基线都提升了*解质量*,其中符号强制器领先,达到 98.2%,而基线为 88.8%。在 Fetch 上,由于 SAC+HER 已能在约 97% 的任务中解决问题,解质量已无法区分各部署方式。收益转向*样本效率*,符号强制器和学习器达到该上限的速度快约 2 倍。此优势也扩展到具身基准测试之外:在一个基于真实街道网络的非具身路由任务中,外部部署再次领先,并能泛化到未见过的实例。除了性能优势,符号验证器和强制器还保持了行为的可检查性:结构化动作除非其接地的前提条件满足,否则永不会触发。

## 1引言

一个必须通过试错来发现一切的强化学习智能体学习缓慢,并且在大型或稀疏奖励环境中可能根本无法学习。关于如何行动的先验知识——在给定情境下哪些动作是合法的,以及它们能达到什么效果——让智能体能够应用已知知识,而不是重新发现它,从而减少探索,更快更好地学习,尤其是在复杂环境中。这提出了三个问题:智能体需要知道什么、如何表示这些知识,以及在 RL 循环的何处引入这些知识,其中最后一点,即我们的研究重点,受到的关注远少于前两点。

在变化环境中行动的机器人和交互智能体必须对目标和约束进行推理,执行长序列动作,并在假设失效时恢复。在这种设定下,幻觉前提条件或脆弱的领域模型会成为具体的安全性和可靠性问题:一个智能体在前提条件不满足时触发结构化动作,可能导致不可逆的错误,例如物体掉落或损坏。神经符号强化学习[19 (https://arxiv.org/html/2609.16056#bib.bib10)]为这类问题提供了一种原则性的解决方案,将关于动作前提条件和效果的行为知识注入到原本学习的策略中。我们使用“行为知识”一词来指代关于在熟悉情境下如何行动的先验知识:动作的前提条件和效果,以及由此产生的行为模式,无论其是手工指定还是从数据中发现的。我们将此行为知识形式化为一个关于状态、谓词、子目标和动作的*先验条件贝叶斯网络*(BN)。尚待解决的问题是合适的注入点:智能体是在推理时应用此知识,在训练过程中受其约束,还是将其融入自身的权重中。当领域模型已知时——这在服务机器人、仓库或辅助环境中很常见,因为任务结构通常被很好地理解——设计问题在于何处注入符号知识,而非如何发现它。

本文研究在 RL 流程中符号结构应从何处介入。三种自然的部署方式显而易见:推理时外部部署、训练时外部部署,以及通过监督头内嵌于网络内部。据我们所知,此前尚无工作在相同的先验条件规范下对它们进行比较。我们在两个基准测试上进行了这种比较,这两个测试旨在涵盖具身 RL 的两种范式,即离散序列规划(MiniGrid ObstructedMaze [8 (https://arxiv.org/html/2609.16056#bib.bib29)])和连续控制(FetchPickAndPlace [27 (https://arxiv.org/html/2609.16056#bib.bib30), 10 (https://arxiv.org/html/2609.16056#bib.bib31)])。我们进一步测试了由此产生的排序是否能从具身仿真扩展到真实街道网络上的非具身路由任务。在所有三个任务上,我们分析了解质量、样本效率和可追溯性方面的权衡,发现规则介入的位置会影响最终结果。

## 2相关工作

赋予强化学习智能体动作前提条件的先验知识已经研究了二十多年。我们沿着两个轴线来综述这项工作:知识如何表示,以及它在 RL 循环的何处介入。

知识已被多种形式表示。Sohn 等人 [31 (https://arxiv.org/html/2609.16056#bib.bib18)] 将子任务前提依赖关系编码为图,由专用的策略网络作为输入读取,从而实现对未见过的图的零样本迁移。Q-Cogni [9 (https://arxiv.org/html/2609.16056#bib.bib17)] 从数据(通过 NOTEARS)建模因果前提结构为贝叶斯网络,以引导表格 Q 学习器。无论形式如何,这些知识可以手工编写或从数据中学习:学习算子的前提条件和效果 [29 (https://arxiv.org/html/2609.16056#bib.bib20)],发明谓词本身 [30 (https://arxiv.org/html/2609.16056#bib.bib21)],从原始输入学习符号抽象 [4 (https://arxiv.org/html/2609.16056#bib.bib22)],或使用 LLM 合成 PDDL 模型 [13 (https://arxiv.org/html/2609.16056#bib.bib23)]。

侵入性最小的部署方式是在测试时包装已训练好的策略并过滤其动作。*屏蔽* [1 (https://arxiv.org/html/2609.16056#bib.bib1)] 根据安全规范合成一个屏蔽器,包装策略并否决或纠正任何不安全的动作,从而保持训练不变。该方法存在多种扩展:Jansen 等人 [17 (https://arxiv.org/html/2609.16056#bib.bib2)] 用概率屏蔽器取代了硬性的安全/不安全判定,当动作最终违反安全属性的概率过高时将其阻断;Carr 等人 [6 (https://arxiv.org/html/2609.16056#bib.bib4)] 将屏蔽扩展到部分可观察环境,并与深度 RL 紧密集成以加速学习;Könighofer 等人 [20 (https://arxiv.org/html/2609.16056#bib.bib3)] 在运行时计算屏蔽而非预先计算。第二种部署方式让符号结构在保持策略网络外部的同时影响学习过程。选项 [32 (https://arxiv.org/html/2609.16056#bib.bib5)]、HAM [26 (https://arxiv.org/html/2609.16056#bib.bib6)]、MAXQ [11 (https://arxiv.org/html/2609.16056#bib.bib7)]、HAC [21 (https://arxiv.org/html/2609.16056#bib.bib8)]、Feudal Nets [33 (https://arxiv.org/html/2609.16056#bib.bib9)] 是分层 RL 的方法和框架。它们将智能体分为两个层次:高层决策层选择下一个要追求的子目标,低层决策层学习达到该目标的原始动作。一些方法学习高层(HAC,Feudal Nets),另一些则手工指定它(HAM,MAXQ)。当高层是固定的、手写的规则集时,它充当从策略外部塑造学习的符号控制器。SDRL [22 (https://arxiv.org/html/2609.16056#bib.bib19)] 就是这种情况:STRIPS/PDDL 规划器根据动作的前提条件和效果排列子目标,每个子目标学习一个独立的低层策略。奖励级方法则通过奖励注入结构:PDDL 引导的 RL [16 (https://arxiv.org/html/2609.16056#bib.bib15)] 奖励遵循符号计划,奖励机 [15 (https://arxiv.org/html/2609.16056#bib.bib16)] 将任务指定为一个有限状态自动机,其转换发出奖励。第三种部署方式将符号知识编译到网络中。可微的神经符号方法在正向传播中嵌入逻辑推理,DeepProbLog [23 (https://arxiv.org/html/2609.16056#bib.bib11)] 是典范例子,而深度符号 RL [12 (https://arxiv.org/html/2609.16056#bib.bib13)]、神经符号策略学习 [18 (https://arxiv.org/html/2609.16056#bib.bib12)] 和基于语言接地的 RL [7 (https://arxiv.org/html/2609.16056#bib.bib14)] 则将符号结构与学习的表示以不同程度融合。Kautz 的神经符号分类法 [19 (https://arxiv.org/html/2609.16056#bib.bib10)] 涵盖了这一完整范围,从外部符号层与神经策略组合到紧密的网内耦合。

先前的工作几乎总是只采用一种部署方式——屏蔽、分层或网内模块——并孤立地研究它。相反,我们将推理时、训练时和网络级注入视为同一轴上的三个点,在相同的先验条件规范下对它们进行正面比较(§4 (https://arxiv.org/html/2609.16056#S4)),并表征每种方式何时占优。

## 3框架:符号部署策略

我们将三种部署形式化为*先验条件贝叶斯网络*(BN)进入 RL 循环的不同节点。我们的 BN 是标准 BN 形式主义的确定性特例:条件是布尔值,因此评估合法性掩码简化为直接的布尔函数评估,而非概率信念更新。概率推广,例如通过 NOTEARS 式结构学习或神经符号算子学习(NSRT)从数据中发现,将用概率的软掩码替代布尔掩码。我们的框架无需更改即可适用。

MOVE (Δxyz\\Delta xyz)夹爪位置方块位置手指宽度是否搬运目标位置夹爪在方块处手指张开持有方块在目标处已到达已抓取已运送已持于目标参见标题状态谓词子目标动作

图 1:FetchPickAndPlace 的前提条件 BN 描述了活动子目标以及 GRASP 何时触发。### 3.1先验条件贝叶斯网络

我们考虑一个标准的马尔可夫决策过程(MDP)M=\(S,A,P,R,γ\)\\mathcal\{M\}=\(\\mathcal\{S\},\\mathcal\{A\},\\mathcal\{P\},\\mathcal\{R\},\\gamma\),其中包含状态空间 S\\mathcal\{S\}、动作空间 A\\mathcal\{A\}、转移和奖励函数 P\\mathcal\{P\} 和 R\\mathcal\{R\},以及折扣因子 γ\\gamma。

对于此类 MDP 的*先验条件 BN*是一个有向无环图,包含四种节点类型和一个函数:

- • 状态 x1,...,xnx\_\{1\},\\ldots,x\_\{n\}:s∈Ss\\in\\mathcal\{S\} 的原始组成部分或从 s 低成本计算出的衍生量,如夹爪位置(gripper\_pos)、物体姿态(block\_pos)或关节速度。
- • 谓词 φ1,...,φk\\varphi\_\{1\},\\ldots,\\varphi\_\{k\}:布尔函数 φj:S→\{0,1\}\\varphi\_\{j\}:\\mathcal\{S\}\\to\\\{0,1\\\},堆叠成二元谓词向量 φ⁡\(s\)\\varphi(s),例如(带阈值 τ\\tau):
    φgripper\_at\_block\(s\)\\displaystyle\\varphi\_\{\\text\{gripper\\\_at\\\_block\}\}\(s\)=1\[∥sgripper\_posxy−sblock\_posxy∥2<τreach∧sgripper\_posz\>sblock\_posz\]\\displaystyle=\\mathbf\{1\}\\bigl\[\\,\\\|s\_\{\\text\{gripper\\\_pos\}\}^\{xy\}\-s\_\{\\text\{block\\\_pos\}\}^\{xy\}\\\|\_\{2\}<\\tau\_\{\\text\{reach\}\}\\,\\wedge\\,s\_\{\\text\{gripper\\\_pos\}\}^\{z\}\>s\_\{\\text\{block\\\_pos\}\}^\{z\}\\,\\bigr\]
    φholding\(s\)\\displaystyle\\varphi\_\{\\text\{holding\}\}\(s\)=1\[sfinger\_widths<τclosed∧scarried\]\\displaystyle=\\mathbf\{1\}\\bigl\[\\,s\_\{\\text\{finger\\\_widths\}\}<\\tau\_\{\\text\{closed\}\}\\,\\wedge\\,s\_\{\\text\{carried\}\}\\,\\bigr\]
- • 子目标 σ1,...,σm\\sigma\_\{1\},\\ldots,\\sigma\_\{m\}:标记任务进展里程碑的特殊谓词,堆叠成二元子目标向量 σ⁡\(s\)\\sigma(s)(例如 *已到达*、*已抓取* 等)。它们将任务分解为有序的阶段:在每个阶段,相关的动作空间可以限制为与活动子目标 g\* 一致的动作。
- • 动作 a∈Astruct∪Anava\\in\\mathcal\{A\}\_\{\\text\{struct\}\}\\cup\\mathcal\{A\}\_\{\\text\{nav\}\},按*效果*划分:*导航*动作仅改变智能体的姿态,而*结构化*(操作性)动作改变世界状态。例如:Anav=\{left,right,forward\}\\displaystyle\\mathcal\{A\}\_\{\\text\{nav\}\}=\\\{\\mathrm\{left\},\\mathrm\{right\},\\mathrm\{forward\}\\\}Astruct=\{pickup,toggle,drop\}\\displaystyle\\mathcal\{A\}\_\{\\text\{struct\}\}=\\\{\\mathrm\{pickup\},\\mathrm\{toggle\},\\mathrm\{drop\}\\\}
- • 前提条件函数:ρa:\{0,1\}k\+m→\{0,1\}\\rho\_\{a\}:\\\{0,1\\\}^\{k\+m\}\\to\\\{0,1\\\}。每个结构化动作 a∈Astructa\\in\\mathcal\{A\}\_\{\\text\{struct\}\} 都配备一个前提条件函数,用于判定在给定 φ⁡\(s\)\\varphi(s) 和 σ⁡\(s\)\\sigma(s) 的情况下 a 是否合法。实际上,每个 ρa\\rho\_\{a\} 仅依赖于 BN 中作为 a 父节点的 φ⁡\(s\)\\varphi(s) 和 σ⁡\(s\)\\sigma(s),例如:ρGRASP\(φ,σ\)=φfingers\_open∧¬φholding∧σreached\\rho\_\{\\text\{GRASP\}\}\(\\varphi,\\sigma\)=\\varphi\_\{\\text\{fingers\\\_open\}\}\\wedge\\neg\\varphi\_\{\\text\{holding\}\}\\wedge\\sigma\_\{\\text\{reached\}\}(1)

图 1 (https://arxiv.org/html/2609.16056#S3.F1) 展示了完整的 Fetch 前提条件 BN。对于任何状态 s,该 BN 诱导出一个合法性掩码向量 ρ⁡\(s\)=\(ρa\(φ⁡\(s\),σ⁡\(s\)\)\)a∈Astruct∈0,1|Astruct|\\boldsymbol\{\\rho\}(s)=\\bigl\(\\rho\_\{a\}\(\\varphi(s),\\sigma(s)\)\\bigr\)\_\{a\\in\\mathcal\{A\}\_\{\\text\{struct\}\}\}\\in\{0,1\}^\{\|\\mathcal\{A\}\_\{\\text\{struct\}\}\|},收集每个结构化动作的合法性位。结构化动作 a 在 s 中合法当且仅当 ρa\(φ⁡\(s\),σ⁡\(s\)\)=1\\rho\_\{a\}\(\\varphi(s),\\sigma(s)\)=1。

### 3.2知识注入的架构

为了将 BN 注入 RL 循环,我们引入图 2 (https://arxiv.org/html/2609.16056#S3.F2) 所示的三种架构:符号验证器(SV),一个仅在推理时使用的外部包装器,利用 BN 的合法性掩码向量 ρ⁡\(s\)\\boldsymbol\{\\rho\}(s) 来覆盖非法动作;符号强制器(SE),相同的包装器在训练期间也活跃,用以限制动作空间;以及符号学习器(SL),它将知识网络化。

相似文章

通过世界模型从人类偏好和理由中学习安全智能体行为

arXiv cs.AI

本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。

理解从预训练到后训练的推理

Hugging Face Daily Papers

本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。