面向部分可观测性的时序知识图谱记忆的神经符号元策略

arXiv cs.AI 论文

摘要

本文提出了一种面向部分可观测强化学习中时序知识图谱记忆的神经符号元策略,结合基于RDF的图表示与符号记忆管理启发式方法,实现了可检查且自适应的控制。

arXiv:2607.18368v1 公告类型:新 摘要:部分可观测强化学习需要决策在时间过程中保留、检索和遗忘什么。我们提出了一种神经符号元策略,它在保持执行符号化的同时,学习在每个决策点应用哪种符号记忆启发式方法。我们的设置使用RoomKG中的时序知识图谱记忆,其中隐藏状态和观察结果表示为资源描述框架(RDF)图,记忆则通过时序RDF三元组注释进行增强。该模型将记忆内容的知识图谱编码与用于问答、探索和遗忘的值头相结合,产生了一个既自适应又可检查的控制器。这使该工作通过基于RDF的表示、兼容注释的图语义以及基于显式记忆状态的图符号操作,直接与语义网相结合。在训练/测试房间分割中,长期记忆容量为512时,具有限定符感知能力的StarE-GNN配置在相比的符号、神经和神经符号系统中取得了最佳保留性能,同时保留了内存管理决策的逐步可追溯性。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:22

# 神经符号元策略用于部分可观测下的时态知识图谱记忆

来源:https://arxiv.org/html/2607.18368
11institutetext:HumemAI,荷兰
11email:[email protected]:阿姆斯特丹自由大学,荷兰
22email:[email protected]:ELLIS 研究所芬兰 & 奥博学术大学,芬兰
33email:[email protected]###### 摘要

部分可观测强化学习需要在时间推移中决定保留、检索和遗忘哪些内容。我们引入了一种神经符号元策略,该策略学习在每个决策点应用*哪个*符号记忆启发式,同时保持执行过程的符号性。在RoomKG环境中,我们的设定使用时态知识图谱记忆,其中隐藏状态和观察被表示为资源描述框架(RDF)图,并通过时态RDF三元组注释来增强记忆。该模型将记忆内容的知识图谱编码与用于问答、探索和遗忘的价值头相结合,产生了一个既自适应又可检查的控制器。通过基于RDF的表示、兼容注释的图语义以及基于图的显式记忆状态符号操作,这项工作直接获得了语义网的支撑。在长时记忆容量为512的训练/测试房间分割上,感知限定符的StarE-GNN配置在比较的符号系统、神经系统和神经符号系统中取得了最佳的预留性能,同时保持了记忆管理决策的步骤级可追溯性。

## 1引言

部分可观测环境中的强化学习(RL)需要有效的记忆管理:智能体必须决定在长期范围内保留什么、遗忘什么以及如何检索任务相关信息。经典的深度RL方法通过函数逼近提高控制性能[25 (https://arxiv.org/html/2607.18368#bib.bib25),32 (https://arxiv.org/html/2607.18368#bib.bib32)],循环扩展通过整合观察历史来缓解部分可观测性问题[14 (https://arxiv.org/html/2607.18368#bib.bib14),16 (https://arxiv.org/html/2607.18368#bib.bib16)]。然而,循环或端到端神经系统中的隐式记忆通常难以检查和追踪,这限制了它们在显式推理和解释重要的场景中的适用性。

与此同时,基于符号和知识图谱的方法表明,结构化表示可以改善迁移并使控制决策更易于检查[8 (https://arxiv.org/html/2607.18368#bib.bib8),34 (https://arxiv.org/html/2607.18368#bib.bib34)]。对于图结构表示,关系感知编码器如关系图卷积网络(R-GCN)以及感知限定符的超关系消息传递尤为相关[29 (https://arxiv.org/html/2607.18368#bib.bib29),7 (https://arxiv.org/html/2607.18368#bib.bib7)]。在我们的设定中,隐藏状态和观察被表示为资源描述框架(RDF)图[5 (https://arxiv.org/html/2607.18368#bib.bib5),15 (https://arxiv.org/html/2607.18368#bib.bib15),19 (https://arxiv.org/html/2607.18368#bib.bib19),20 (https://arxiv.org/html/2607.18368#bib.bib20)]。记忆还利用对观察到的事实的时间注释属性,使得记忆图上具有显式的时间和类似来源的元数据。具体而言,智能体需要在有界长期记忆预算下,从部分房间级观察中导航并回答物体-位置查询,因此核心问题是如何在无法保留所有相关事实时协调检索、探索和遗忘。这为本文提供了语义网的基础:智能体的内部状态是一个带有显式注释的基于RDF的知识图谱,其操作符通过检索和更新过程作用于该图。

这种结构产生了一种实际的设计张力。固定的符号启发式(例如,预定的遗忘或检索策略)明确但跨上下文不灵活。全神经策略自适应但通常不透明。

我们建立在RoomKG时态知识图谱记忆基底之上。环境、其情节、其符号记忆启发式以及时间注释的RDF记忆表示是先前的工作[21 (https://arxiv.org/html/2607.18368#bib.bib21)]。在此基底之上,我们将记忆决策视为一个元决策问题:学习到的元策略在每个决策点选择已命名的符号启发式。本文的贡献在于这个元策略层及其受控评估,而非基准或记忆基底本身。这种观点与分层策略选择和选项相关[30 (https://arxiv.org/html/2607.18368#bib.bib30),3 (https://arxiv.org/html/2607.18368#bib.bib3)],但在这里可选的动作是显式的符号操作符,而非潜在的选项嵌入。在我们研究的有界记忆RoomKG设定中,这使我们能够提出一个比广泛端到端优越性更窄的问题:学习的启发式选择能否在保持显式符号执行的同时,提高对强固定符号控制的自适应性,以及感知限定符的图编码器是否特别适合这个决策问题?

我们的主要贡献如下:

- •我们引入了部分可观测RL的神经符号*元策略*公式,其中适应性是通过选择命名的符号记忆启发式来实现的,而不是用不透明的潜在动作替换符号控制。
- •我们设计了一个感知限定符的时态知识图谱记忆元策略,该策略结合了基于RDF的记忆表示与RDF三元组注释、基于知识图谱的编码,以及用于问答、探索和遗忘的任务特定价值头。
- •我们在RoomKG中展示了在长期记忆容量为512时的强训练/测试泛化能力,基于StarE-GNN的配置提供了最佳的整体性能,同时保持了记忆管理决策的步骤级可追溯性。

## 2背景与问题设定

请参见图注图1:RoomKG中t=99t=99\(st=99s\_\{t=99\}\)时刻隐藏状态的鸟瞰示意图,显示空间布局和实体放置。此视图仅为直觉示意图:实际环境状态和智能体面对的世界以RDF知识图谱世界表示(图2 (https://arxiv.org/html/2607.18368#S2.F2))。智能体不能直接观察sts\_\{t\};其观察oto\_\{t\}是当前房间和可见邻接关系所诱导的RDF子图。该图有助于将后续的图视图置于直观的空间画面中,清晰地说明为何即使在结构化环境中,部分可观测性也并非小事。完整原图见补充材料。请参见图注图2:同一个隐藏状态在t=99t=99\(st=99s\_\{t=99\}\)时刻的知识图谱视图,表示为RDF结构。节点颜色表示语义类别:房间(黄色)、智能体(紫色)、静态物体(蓝色)、移动物体(绿色)和墙壁(灰色)。这是促使在所提出的元策略中使用关系感知编码器和显式记忆注释的结构形式。完整原图见补充材料。### 2.1环境与部分可观测性

我们考虑RoomKG基准[21 (https://arxiv.org/html/2607.18368#bib.bib21)],这是一个顺序决策环境,其中智能体仅接收部分观察,而完整环境状态是隐藏的。令sts\_\{t\}表示时刻tt的隐藏状态,oto\_\{t\}表示原始观察。智能体必须使用依赖于历史的内记忆来行动,因为仅凭oto\_\{t\}通常不足以推断所有任务相关事实。这使问题置于标准的部分可观测设定中,其中性能关键取决于随时间存储、更新和检索哪些信息。

具体而言,RoomKG是一个网格世界,其隐藏状态是一个关于房间、物体、墙壁和智能体的RDF知识图谱。每一步,观察oto\_\{t\}是由当前房间(本地邻接和物体-位置三元组)诱导的RDF子图。每一步还会发出一个查询,询问指定物体的当前位置,环境面对的动作由一个答案和一个从{north, east, south, west, stay}中选择的移动组成。这种设计迫使智能体随时间整合部分观察以正确回答。在端到端神经公式中,这变成了一个关于49个候选房间答案和5个移动方向(245个动作)的联合离散动作问题。

隐藏动力学是结构化的但非平凡:内墙可用性遵循固定的周期性调度,移动物体遵循确定性的偏好规则,但受墙壁约束。这使得基准可以重放,同时在局部可观测性下仍需要长期记忆。

形式上,我们将交互建模为部分可观测过程[18 (https://arxiv.org/html/2607.18368#bib.bib18)]

⟨S,O,A,P,R,Ω,γ⟩,\\langle\\mathcal\{S\},\\mathcal\{O\},\\mathcal\{A\},P,R,\\Omega,\\gamma\\rangle,其中S\\mathcal\{S\}是隐藏状态空间,O\\mathcal\{O\}是观察空间,A\\mathcal\{A\}是动作空间,P\(st\+1∣st,at\)P\(s\_\{t\+1\}\\mid s\_\{t\},a\_\{t\}\)是转移模型,R\(st,at\)R\(s\_\{t\},a\_\{t\}\)是奖励函数,Ω\(ot∣st\)\\Omega\(o\_\{t\}\\mid s\_\{t\}\)是观察模型,γ∈\0,1\)\\gamma\\in\[0,1\)是折扣因子。智能体在决策时无法直接访问sts\_\{t\},因此必须通过显式的记忆表示来近似信念相关信息。在RoomKG中,这一要求尤为重要,因为有用的线索可能在时间上延迟并分布在不同的观察中。

我们的重点是记忆决策层,该层根据当前观察和记忆内容决定应用哪个符号操作。

### 2.2时态知识图谱记忆表示

隐藏状态和观察都表示为基于RDF的RDF图[5 (https://arxiv.org/html/2607.18368#bib.bib5),15 (https://arxiv.org/html/2607.18368#bib.bib15),19 (https://arxiv.org/html/2607.18368#bib.bib19),20 (https://arxiv.org/html/2607.18368#bib.bib20)]。智能体维护一个时态知识图谱记忆MtM\_\{t\},该记忆通过使用RDF三元组注释扩展观察到的事实:time\_added、last\_accessed和num\_recalled。这使得记忆内容在注释三元组层面显式且可检查。换句话说,每个被记住的事实都存储为一个基本的RDF三元组,同时附带关于何时添加、最后使用以及被召回频率的语句级元数据。我们将此注释机制用作显式记忆元数据的实现基底,而不是对时态RDF语义的新贡献。

例如,一个观察如\(agent, at\_location, room\)可以进入短期记忆,并带有current\_time注释在步骤tt,如果保留,同一个RDF三元组会携带诸如time\_added=t=t、last\_accessed=t′=t^\{\\prime\}和num\_recalled=n=n这样的注释,因此智能体的记忆仍然是一个带有语句级时态元数据的显式RDF图。

我们保持独立的短期和长期记忆MtshortM\_\{t\}^\{\\mathrm\{short\}\}和MtlongM\_\{t\}^\{\\mathrm\{long\}\},其中Mt=\(Mtshort,Mtlong\)M\_\{t\}=\(M\_\{t\}^\{\\mathrm\{short\}\},M\_\{t\}^\{\\mathrm\{long\}\}\)。原始观察oto\_\{t\}通过附加current\_time成为短期记忆项,符号的记住/遗忘启发式要么用这些项刷新长期记忆条目,要么在容量达到时驱逐长期记忆条目。

每一步,观察到的RDF三元组根据选定的符号启发式合并到记忆中。限定符编码插入时间、访问近因和召回频率,因此智能体通过图内容和时态角色区分事实。长期记忆是有界的,\|Mtlong\|≤K\|M\_\{t\}^\{\\mathrm\{long\}\}\|\\leq K,因此控制必须协调问答(QA)、探索和遗忘,同时承受显式的容量压力。

图1 (https://arxiv.org/html/2607.18368#S2.F1)和图2 (https://arxiv.org/html/2607.18368#S2.F2)展示了控制器必须弥合的表示差距:隐藏世界具有丰富的关联结构,而智能体只接收房间局部的RDF观察,并且必须随时间维护自己的有界记忆。

### 2.3符号启发式动作空间

元策略不是输出不透明的潜在动作,而是选择命名的符号启发式用于QA、探索和遗忘。

令Hforget\\mathcal\{H\}^\{\\mathrm\{forget\}\}、Hqa\\mathcal\{H\}^\{\\mathrm\{qa\}\}和Hexplore\\mathcal\{H\}^\{\\mathrm\{explore\}\}分别表示三个决策类别的候选集。在每个决策点,元策略从每个集合中选择一个启发式,产生一个联合符号动作ht=\(htforget,htqa,htexplore\)h\_\{t\}=\(h\_\{t\}^\{\\mathrm\{forget\}\},h\_\{t\}^\{\\mathrm\{qa\}\},h\_\{t\}^\{\\mathrm\{explore\}\}\)位于有限乘积空间Hforget×Hqa×Hexplore\\mathcal\{H\}^\{\\mathrm\{forget\}\}\\times\\mathcal\{H\}^\{\\mathrm\{qa\}\}\\times\\mathcal\{H\}^\{\\mathrm\{explore\}\}\)中。

元策略不是直接学习完整的环境面对组合动作,而是在一个模块化的3×3×3=273\\times 3\\times 3=27符号空间上操作。操作符本身是固定的RoomKG原语:QA在带注释的RDF记忆上检索,探索在记忆的地图上规划,遗忘应用类似缓存的驱逐规则。学习到的组件是在线激活哪个启发式。

操作上,QA使用最近添加(MRA)、最近使用(MRU)和最频繁使用(MFU)对限定符元数据进行排序,探索使用相同的限定符优先级在规划前过滤记忆的图结构,遗忘在容量达到时使用先进先出(FIFO)、最近最少使用(LRU)和最不经常使用(LFU)进行驱逐。

### 2.4问题形式化

在每个决策点,参数化元策略πθ\(ht∣Mt\)\\pi\_\{\\theta\}\(h\_\{t\}\\mid M\_\{t\}\)将记忆状态MtM\_\{t\}映射到联合符号动作ht=\(htforget,htqa,htexplore\)h\_\{t\}=\(h\_\{t\}^\{\\mathrm\{forget\}\},h\_\{t\}^\{\\mathrm\{qa\}\},h\_\{t\}^\{\\mathrm\{explore\}\}\)。在部分可观测马尔可夫决策过程(POMDP)设定中,MtM\_\{t\}是观察历史的有界内部摘要,而不是精确的信念状态。

我们将符号执行步骤抽象地写为

Mtshort=Aug\(ot\),Mt=\(Mtshort,Mtlong\),M\_\{t\}^\{\\mathrm\{short\}\}=\\mathrm\{Aug\}\(o\_\{t\}\),\\qquad M\_\{t\}=\(M\_\{t\}^\{\\mathrm\{short\}\},M\_\{t\}^\{\\mathrm\{long\}\}\),\(1\)接着

\(Mt\+1,at\)=Φ\(Mt,ht\),\(M\_\{t\+1\},a\_\{t\}\)=\\Phi\\big\(M\_\{t\},h\_\{t\}\\big\),\(2\)其中Aug\(⋅\)\\mathrm\{Aug\}\(\\cdot\)通过附加current\_time将原始观察三元组转换为短期记忆项,Φ\\Phi确定性地执行选定的启发式以更新记忆并选择环境面对行为。

训练目标是在有界记忆约束下最大化期望回报,

maxθ⁡Eπθ\[∑t=0Tγtrt\]s\.t\.\|Mtlong\|≤K∀t,\\max\_\{\\theta\}\\;\\mathrm\{E\}\_\{\\pi\_\{\\theta\}\}\\\!\\left\[\\sum\_\{t=0\}^\{T\}\\gamma^\{t\}r\_\{t\}\\right\]\\quad\\text\{s\.t\.\}\\quad\|M\_\{t\}^\{\\mathrm\{long\}\}\|\\leq K\\;\\forall t,\(3\)
此处γ\\gamma是折扣因子,rtr\_\{t\}是时刻tt的奖励;在RoomKG中,奖励仅由问答正确性产生(正确答案+1\+1,否则0),因此探索和遗忘是通过学习形

相似文章

图原生强化学习通过概念重组实现可追溯的科学假设生成

arXiv cs.AI

本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。