从连接性到奖励:基于有向状态图的密集奖励学习

arXiv cs.LG 论文

摘要

本文介绍了G2QDR框架,该框架利用有向状态图为目标条件分层强化学习生成密集奖励,提升在稀疏奖励环境中的性能。

arXiv:2609.10781v1 Announce Type: new 摘要:图与目标条件分层强化学习(GCHRL)的整合受到了越来越多的关注,因为图自然编码了任务层次结构,有助于有效的子目标采样。然而,现有方法常常忽视内在连接信息,未能充分利用底层拓扑进行高效学习。大多数基于图的GCHRL方法将图用作随机采样工具,而不是编码连接性和状态可达性信息的环境模型。这一局限性在拟度量环境中尤为突出,其中状态转换的固有不对称性对稳定策略学习和鲁棒路径规划构成了基本挑战。在本文中,我们通过引入一个状态连接模型来解决这些问题,该模型旨在预测不对称环境中的成对状态连接强度。我们将这些连接强度转化为标量辅助密集奖励,提供跨多个层次级别的连续指导。我们证明,我们提出的框架——图引导拟度量密集奖励(G2QDR)——理论上可以集成到任何现有的GCHRL架构中,并且状态连接模型可以通过一个在探索过程中生成的有向状态图上训练的神经网络高效实现。在各种稀疏奖励环境中的实证结果表明,一般来说,G2QDR能够在可接受的计算开销内提升基线GCHRL方法的性能。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:19

# 从连通性到奖励:基于有向状态图的稠密奖励学习  
来源:https://arxiv.org/html/2609.10781  
Shuyuan Zhang,邮箱:[email protected]  
Zihan Wang,邮箱:[email protected]  
隶属机构:麦吉尔大学计算机科学学院  
隶属机构:Mila – 魁北克人工智能研究所  
Xiao-Wen Chang,邮箱:[email protected]  
隶属机构:麦吉尔大学计算机科学学院  
Doina Precup,邮箱:[email protected]  
隶属机构:麦吉尔大学计算机科学学院  
隶属机构:Mila – 魁北克人工智能研究所  
隶属机构:Google DeepMind  
隶属机构:CIFAR研究员  

###### 摘要  
图与基于目标条件的层次强化学习(GCHRL)的结合受到了越来越多的关注,因为图天然地编码了任务层次结构,可用于有效的子目标采样。然而,现有方法往往忽略了内在的连通性信息,未能充分利用底层拓扑结构进行高效学习。大多数基于图的GCHRL方法将图用作随机采样工具,而非编码连通性和状态可达性信息的环境模型。这一局限在拟度量环境中尤为突出,因为状态转移的固有不对称性对稳定的策略学习和鲁棒路径规划构成了根本挑战。本文通过引入一个状态连通性模型来解决这些问题,该模型旨在预测非对称环境中的成对状态连通强度。我们将这些连通强度转化为标量辅助稠密奖励,从而在多个层次级别上提供连续引导。我们证明,所提出的框架——图引导拟度量稠密奖励(G2QDR)——理论上可集成到任何现有的GCHRL架构中,且状态连通性模型可通过在探索过程中生成的有向状态图上训练的神经网络高效实现。在大量稀疏奖励环境中的实证结果表明,总体而言,G2QDR能够在可接受的计算开销下提升基线GCHRL方法的性能。  

## 1 引言  
稀疏奖励仍是强化学习(RL)中的一个基本挑战,智能体必须从稀少且延迟的反馈信号中学习。在此类环境中,传统的非层次方法(Schulman等,2017(https://arxiv.org/html/2609.10781#bib.bib29);Fujimoto等,2018(https://arxiv.org/html/2609.10781#bib.bib27);Haarnoja等,2018(https://arxiv.org/html/2609.10781#bib.bib28))常常在高效探索和不良信用分配方面存在困难。基于目标条件的层次强化学习(GCHRL)通过将一个长期任务分解为一系列中间子目标来解决此问题:高层策略提出子目标,而底层策略学习去实现它们。这种层次分解将困难的全局目标转化为一系列更易处理的局部问题,显著提高了学习效率。尽管有这些优势,早期的GCHRL方法(Nachum等,2018a(https://arxiv.org/html/2609.10781#bib.bib21);Nachum等,2018b(https://arxiv.org/html/2609.10781#bib.bib20))常常遭遇样本效率低下的问题,因为高层智能体必须从整个状态空间中选择子目标——这甚至可能比非层次方法中选择动作更具挑战性。先前的工作试图通过将子目标选择约束在局部区域(Zhang等,2022(https://arxiv.org/html/2609.10781#bib.bib24))、对采样的子目标施加平滑性约束(Li等,2022(https://arxiv.org/html/2609.10781#bib.bib32)),或采用随机采样策略(Wang等,2024(https://arxiv.org/html/2609.10781#bib.bib23);Wang等,2025(https://arxiv.org/html/2609.10781#bib.bib1))来解决这个问题。虽然这些方法减轻了高层智能体的负担,但它们并未将访问过的状态或子目标组织成结构化表示,因此丢失了重要的连通性信息。相比之下,基于图的GCHRL方法(Lee等,2022(https://arxiv.org/html/2609.10781#bib.bib19);Gieselmann和Pokorny,2021(https://arxiv.org/html/2609.10781#bib.bib15))通过状态图显式地对状态之间的关系和连通性进行建模,这本质上非常适合表示环境和任务结构。先前基于图的工作探索了诸如通过图搜索或遍历进行决策(Wan等,2021(https://arxiv.org/html/2609.10781#bib.bib17);Shang等,2019(https://arxiv.org/html/2609.10781#bib.bib18);Eysenbach等,2019(https://arxiv.org/html/2609.10781#bib.bib10)),以及将图用作世界模型(Zhang等,2021(https://arxiv.org/html/2609.10781#bib.bib14);Huang等,2019(https://arxiv.org/html/2609.10781#bib.bib22))等方向。然而,其中许多方法依赖于预先构建的图,这限制了它们的泛化能力。此外,大多数现有方法(Zhu等,2022(https://arxiv.org/html/2609.10781#bib.bib8);Hong等,2022(https://arxiv.org/html/2609.10781#bib.bib7))直接在构建的图上操作,当智能体遇到图中未表示的状态时,效果会较差。图学习则通过学习的嵌入和连通性模式进行泛化,即使当前状态未在图中明确表示,也能使智能体利用关系结构。最近的研究(Zhang等,2025(https://arxiv.org/html/2609.10781#bib.bib5))表明,将图表示融入学习过程可以显著提升底层强化学习算法的性能,同时提高样本效率和泛化能力。此外,图学习(Klissarov和Precup,2020(https://arxiv.org/html/2609.10781#bib.bib30);Klissarov和Machado,2023(https://arxiv.org/html/2609.10781#bib.bib16))通过捕捉状态空间的拓扑结构,促进了更明智的探索和规划,使智能体能够推理超出其直接经验的长期依赖性和转移。基于图的方法中另一个常见的挑战是,状态之间的距离常常是拟度量的(Wang和Isola,2022(https://arxiv.org/html/2609.10781#bib.bib3);Wang等,2023(https://arxiv.org/html/2609.10781#bib.bib4)),这意味着转移成本是不对称的:从B移动到A可能比从A移动到B困难得多。无向状态图(Zhang等,2025(https://arxiv.org/html/2609.10781#bib.bib5))无法捕捉这种不对称性,这促使我们使用有向图来替代。在本文中,我们提出了一种基于图的在线GCHRL框架来解决这些挑战。我们在探索过程中在线构建有向状态图,逐步纳入访问过的状态,同时剪枝过时的节点和连接。然后我们在此图上训练一个模型来预测状态连通性,该连通性作为转移距离的代理。随后,该连通性度量被用于生成稠密奖励信号,从而实现更高效的学习和对环境更好的理解。本文的主要贡献如下:  
- • 我们引入了一种在线构建有向状态图作为基于图的环境模型(Ha和Schmidhuber,2018(https://arxiv.org/html/2609.10781#bib.bib13);Zhang等,2021(https://arxiv.org/html/2609.10781#bib.bib14))的方法。该图在探索过程中直接构建,无需专家数据或手动设计的结构。  
- • 我们提出了一种新颖的架构,该架构包含一个状态连通性模型,用于根据观测到的到达情况预测状态间的经验证连通性。该模型允许评估尚未在图中表示的新访问状态。  
- • 我们利用从状态连通性导出的辅助奖励(Simsek和Barto,2006(https://arxiv.org/html/2609.10781#bib.bib12);Nehmzow等,2013(https://arxiv.org/html/2609.10781#bib.bib11)),以提高高层智能体的学习效率,并为底层智能体提供经过良好校准的学习信号。  
- • 我们的架构在理论上与对称和非对称环境中的任何GCHRL算法兼容。在我们的实验中,我们使用了四种代表性的骨干方法(HIRO、HRAC、HESS和HLPS)进行评估,并观察到在广泛的任务中性能有所提升。我们在一系列MuJoCo环境(Todorov等,2012(https://arxiv.org/html/2609.10781#bib.bib25))中评估了我们的方法,以检验我们实验结果的重要性。结果表明,我们的方法在成功率方面提升了底层GCHRL框架的性能。  

## 2 预备知识  
### 2.1 马尔可夫决策过程  
作为建模强化学习问题最广泛使用的框架,马尔可夫决策过程(MDP)(Puterman,2014(https://arxiv.org/html/2609.10781#bib.bib26))被定义为一个元组 \(\langle\mathcal{S}, \mathcal{A}, P, R, \gamma\rangle\)。在每个时间步 \(t\),智能体观察由环境提供的当前状态 \(s_t \in \mathcal{S}\),并根据其策略 \(\pi(a_t \mid s_t)\) 选择一个动作 \(a_t \in \mathcal{A}\),该策略指定了在给定状态 \(s_t\) 下选择动作 \(a_t\) 的概率。一旦动作被执行,环境根据转移概率函数 \(P(s_{t+1} \mid s_t, a_t)\) 将智能体转移到新状态 \(s_{t+1}\),该函数在无模型设置中通常是未知的。然后智能体根据奖励函数 \(R(s_t, a_t)\) 接收到一个奖励 \(r_t\),该函数评估在当前状态采取的动作,且通常也不能被智能体直接获取。智能体的目标是学习一个最优策略 \(\pi\),最大化期望折扣累积奖励 \(\mathbb{E}_{\pi}\big[\sum_{t=0}^{T} \gamma^{t} r_t \big]\),其中 \(\gamma \in [0,1)\) 是一个预定义的折扣因子,它优先考虑即时奖励而非遥远未来的奖励,以确保总回报是有限的。  

### 2.2 基于目标条件的层次强化学习(GCHRL)  
基于目标条件的强化学习(GCRL)(Liu等,2023(https://arxiv.org/html/2609.10781#bib.bib2))通过训练智能体实现特定目标(通常定义为目标状态)来扩展标准强化学习。在此设置中,智能体除了接收状态 \(s_t\) 外,还接收一个额外的目标输入 \(g_t\),并学习一个目标条件策略 \(\pi(a_t \mid s_t, g_t)\),旨在达到期望的目标。通过将目标明确地纳入策略输入,智能体的行为被引导去实现指定的结果。奖励函数通常是目标依赖的,当智能体成功达到目标状态时提供正向反馈。为应对大型复杂环境带来的挑战,基于目标条件的层次强化学习(GCHRL)(Nachum等,2018b(https://arxiv.org/html/2609.10781#bib.bib20);Zhang等,2022(https://arxiv.org/html/2609.10781#bib.bib24);Wang等,2024(https://arxiv.org/html/2609.10781#bib.bib23))将任务分解为一系列更简单、更易管理的子任务层次。通常,该框架包含两个控制级别。每隔 \(p\) 步,高层智能体选择一个子目标 \(g_t\),代表一个中间目标状态,然后将其传递给底层智能体执行。子目标从高层策略 \(\pi_h(g_t \mid \phi(s_t))\) 中采样,其中 \(\phi: \mathcal{S} \rightarrow \mathbb{R}^d\) 表示一个状态表示函数,将原始状态映射到一个紧凑的特征空间。给定子目标 \(g_t\) 和状态表示 \(\phi(s_t)\),底层策略根据策略 \(\pi_l(a_t \mid \phi(s_t), g_t)\) 选择一个动作 \(a_t\)。底层策略使用一个内在奖励信号进行训练,该信号定义为 \(r_{\text{int}}(s_t, g_t, a_t, s_{t+1}) = -\|\phi(s_{t+1}) - g_t\|_2\),它鼓励智能体最小化已实现状态表示与子目标之间的距离。高层和底层智能体均可使用基于策略的强化学习方法实现,包括先前在策略梯度方面开发的方法,如(Fujimoto等,2018(https://arxiv.org/html/2609.10781#bib.bib27);Haarnoja等,2018(https://arxiv.org/html/2609.10781#bib.bib28);Schulman等,2017(https://arxiv.org/html/2609.10781#bib.bib29))。  

### 2.3 MDP的图抽象  
图是一种通用且灵活的数据结构,用于建模许多现实世界问题中对象之间的复杂关系。一个图定义为 \(\mathcal{G} = (\mathcal{V}, \mathcal{E})\),其中 \(|\mathcal{V}| = N\) 表示节点集,\(\mathcal{E} = \{e_{ij}\}\) 表示边集(无自环)。图 \(\mathcal{G}\) 的邻接矩阵由 \(\bm{A} = (\bm{A}_{i,j}) \in \mathbb{R}^{N \times N}\) 给出,如果节点 \(i\) 和节点 \(j\) 之间存在一条边,则 \(\bm{A}_{i,j} = 1\),否则 \(\bm{A}_{i,j} = 0\)。该表述可以自然地扩展到加权邻接矩阵,其中 \(\bm{A}_{i,j}\) 表示与边 \(e_{ij}\) 相关联的权重,捕捉关系的强度或重要性。在马尔可夫决策过程(MDP)的背景下,节点可被解释为状态,而边权重编码状态之间的转移概率或可达性统计数据。从这个角度看,图作为环境动态的抽象表示,捕捉了状态如何通过智能体-环境交互相互连接(Lee等,2022(https://arxiv.org/html/2609.10781#bib.bib19))。更一般地说,这样的图可以被视为MDP的压缩或学习到的结构模型(Zhang等,2025(https://arxiv.org/html/2609.10781#bib.bib5)),其中连通性反映了可行的转移,边权重量化了它们的可能性或频率。这种抽象在大型或连续状态空间中特别有用,因为在这些情况下显式地建模完整的转移函数是难以处理的。通过操作图结构,可以利用状态之间的关系信息来促进规划、探索和表示学习。  

## 3 方法  
先前的工作(Zhang等,2025(https://arxiv.org/html/2609.10781#bib.bib5))专注于从无向图中导出稠密奖励,但这种方法在具有有向连通性的环境中遇到了困难,因为状态对称性不成立。在本节中,我们介绍了我们的框架——图引导拟度量稠密奖励(G2QDR)<sup>1</sup>,它通过有向图显式地对状态连通性进行建模。我们的框架在传统GCHRL流程中的整体结构如图1(https://arxiv.org/html/2609.10781#S3.F1)所示。请参见标题。  
图1:G2QDR框架概览。

相似文章

FedQHD:闭式函数空间联邦强化学习

arXiv cs.LG

本文提出FedQHD,一种新颖的联邦Q学习方法,使用超维随机特征状态编码器和线性读出器实现闭式函数空间聚合,解决了异构客户端编码器导致的联邦差距。