NFTR:从可证明的模式平均到离线目标条件强化学习中的测地线子目标选择
摘要
本文提出NFTR,一种用于离线目标条件强化学习的方法,该方法使用归一化流作为子目标策略,并采用三角松弛重新加权以解决层次隐式Q学习中的乐观偏差和模式坍缩问题。
arXiv:2607.07855v1 公告类型:新
摘要:层次隐式Q学习(HIQL)是一种离线目标条件强化学习方法,它仅通过价值函数优势来选择子目标。该规则存在两个耦合的失败模式:乐观偏差将幸运的随机结果视为技能选择,而模式坍缩将多模态子目标分布简化为单个高斯均值,该均值常常落在不可达区域。我们提出NFTR(带三角松弛重新加权的归一化流子目标策略)。一个条件归一化流替代了高斯策略,一个闭式模式平均结果将NF识别为基于AWR的子目标选择的最小生成类。一个三角松弛分数,建立在架构三角不等式之上而不依赖距离精度,以乘法方式修正AWR权重,以降低绕行成本超过平均可达性的子目标的权重。在确定性MDP中,三角松弛在测地线上消失,并在随机动力学下保持为复合性违规的保守上界。RWDR目标保留了AWR的总体单调改进,并允许一个三项次优性分解。这两个成分共同提供了子目标选择,可证明地避免了上述高斯坍缩,并在随机动力学下保持稳定。GitHub页面:https://github.com/erdemtbao/NFTR
查看缓存全文
缓存时间: 2026/07/10 06:16
# NFTR: 从可证明的模态平均化到离线目标条件强化学习中的测地子目标选择
来源:https://arxiv.org/html/2607.07855
Erdemt Bao1,∗Xing Lei2,∗†\{\}^\{2,\*\\,\\dagger\}Jun Chen3
1华中科技大学2西安交通大学3电子科技大学
baoerdemt366@gmail\.comleixing@stu\.xjtu\.edu\.cnjunchen@std\.uestc\.edu\.cn
###### 摘要
层次化隐式Q学习(HIQL)是一种离线目标条件强化学习方法,其仅通过值函数优势来选择子目标。该规则存在两种耦合的失败模式。*乐观偏置*将幸运的随机结果视为技巧性选择,而*模式坍缩*则将多模态子目标分布简化为单个高斯均值,该均值往往落在不可达区域。我们提出NFTR(带三角松弛重加权的归一化流子目标策略)。条件归一化流替代高斯策略,一个闭式模态平均化结果将NF识别为基于AWR的子目标选择的最小生成类。一个三角松弛分数,建立在架构三角不等式之上而不依赖于距离准确性,以乘法方式修正AWR权重,以降低绕路成本超过平均可达性的子目标。在确定性MDP中,三角松弛在测地线上消失,并在随机动力学下保持为可组合性违反的保守上界。RWDR目标保持了AWR在总体水平上的单调改进,并允许一个三项次优性分解。这两个组成部分共同提供了子目标选择,可证明避免了上述高斯坍缩,并在随机动力学下保持稳定。GitHub页面:https://github.com/erdemtbao/NFTR
††footnotetext:\* 同等贡献。†\\dagger 通讯作者。
### 1 引言
离线目标条件强化学习(GCRL)(Park et al., 2025a (https://arxiv.org/html/2607.07855#bib.bib330))旨在从静态数据集学习策略,无需与环境交互即可到达任意目标。这种设置对于在线数据收集成本高昂或危险的机器人和自主系统尤其有价值。在最近的进展中,层次化隐式Q学习(HIQL)(Park et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib274))通过将目标到达分解为高层子目标选择和低层动作执行,并使用共享值函数指导两个层次,取得了最先进的性能。HIQL的两种耦合失败推动了本工作。首先,由于高层子目标仅由学习的值函数选择,随机环境会产生*乐观偏置*。通过有利随机性到达目标的轨迹与通过可重复可达性成功的轨迹被同等对待,因此离线路径子目标获得膨胀的AWR权重。其次,由于高层策略是单峰高斯,由分支走廊或随机结果引起的多模态子目标分布会触发*模式坍缩*。高斯均值回归到模式中心的凸组合,这通常落在不可达区域内,而不是任何有效路径上。这些失败共同提出了一个问题。
我们能否同时学习高价值、可靠可达且忠实于多模态路径结构的子目标?我们通过NFTR(带三角松弛重加权的归一化流子目标策略)回答了这个问题。归一化流替代了HIQL的高斯高层策略,而源自内置三角不等式拟度量的三角松弛分数重新加权了AWR目标,使得几何不一致的子目标充当不可靠幸运转移的机制代理。
我们的贡献是理论性、方法论和实证性的。我们在确定性和随机MDP上刻画了三角松弛,将RWDR次优性分解为值、采样和有界几何正则化项,并保持了总体水平上的单调改进。NFTR是第一个将多模态子目标建模与几何可组合性过滤相结合的层次化离线GCRL方法。在OGBench (Park et al., 2025a (https://arxiv.org/html/2607.07855#bib.bib330))上,NFTR在随机、拼接和操作任务上显著优于HIQL。
### 2 预备知识
#### 2.1 离线目标条件强化学习
我们考虑一个受控马尔可夫过程M=\(S,A,P,γ,μ\)\\mathcal\{M\}=\(\\mathcal\{S\},\\mathcal\{A\},P,\\gamma,\\mu\),其中状态空间S\\mathcal\{S\},动作空间A\\mathcal\{A\},转移动力学P\(s′\|s,a\)P\(s^\{\\prime\}\|s,a\),折扣因子γ∈\(0,1\)\\gamma\\in\(0,1\),初始状态分布μ\(s0\)\\mu\(s\_\{0\}\)。目标条件策略π\(a\|s,g\)\\pi\(a\|s,g\)旨在从当前状态ss到达目标状态g∈Sg\\in\\mathcal\{S\}。目标条件值函数Vπ\(s,g\)V^\{\\pi\}\(s,g\)表示从状态ss开始,在策略π\\pi下到达目标gg的期望折扣概率:
Vπ\(s,g\)=Eπ\[∑t=0∞γt1\[st=g\]∣s0=s\]。V^\{\\pi\}\(s,g\)=\\mathbb\{E\}\_\{\\pi\}\\left\[\\sum\_\{t=0\}^\{\\infty\}\\gamma^\{t\}\\mathbf\{1\}\[s\_\{t\}=g\]\\mid s\_\{0\}=s\\right\]。 (1)
在离线GCRL中,我们只能访问由未知行为策略β\\beta收集的静态数据集D=\{\(st,at,st\+1\)\}t=1N\\mathcal\{D\}=\\\{\(s\_\{t\},a\_\{t\},s\_\{t\+1\}\)\\\}\_\{t=1\}^\{N\},目标通常通过事后重标记 (Andrychowicz et al., 2017 (https://arxiv.org/html/2607.07855#bib.bib16)) 从未来状态采样。挑战在于学习最大化目标到达性能的策略π\\pi,而无需额外的环境交互,这需要仔细处理学习策略与行为策略之间的分布偏移 (Levine et al., 2020 (https://arxiv.org/html/2607.07855#bib.bib94))。
#### 2.2 HIQL:层次化隐式Q学习
HIQL (Park et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib274)) 将目标到达分解为一个高层策略πH\(z∣s,g\)\\pi^\{H\}\(z\\mid s,g\),该策略提出kk步路标点ww的潜在代码z=φ\(\[s;w\]\)z=\\phi\(\[s;w\]\),以及一个低层策略πL\(a∣s,z\)\\pi^\{L\}\(a\\mid s,z\),驱动智能体朝向该路标点。编码器φ:S×S→Rd\\phi:\\mathcal\{S\}\\times\\mathcal\{S\}\\to\\mathbb\{R\}^\{d\}是参数化值函数V\(s,φ\(\[s;g\]\)\)V\(s,\\phi\(\[s;g\]\)\)的中间层,以端到端方式学习,没有单独的表征目标;HIQL的命题5.1表明,在确定性MDP中,这种表征足以实现最优控制。共享值函数使用IQL的无动作期望回归变体进行拟合 (Kostrikov et al., 2022 (https://arxiv.org/html/2607.07855#bib.bib245); Park et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib274)):
LV=E\(s,s′\)∼D,g∼p\(g∣τ\)\[Lτ2\(r\(s,g\)\+γVtgt\(s′,g\)−Vθ\(s,g\)\)\],\\mathcal\{L\}\_\{V\}\\;=\\;\\mathbb\{E\}\_\{\(s,s^\{\\prime\}\)\\sim\\mathcal\{D\},\\,g\\sim p\(g\\mid\\tau\)\}\\left\[L\_\{\\tau\}^\{2\}\\bigl\(r\(s,g\)\+\\gamma V^\{\\mathrm\{tgt\}\}\(s^\{\\prime\},g\)\-V\_\{\\theta\}\(s,g\)\\bigr\)\\right\], (2)
其中Lτ2\(u\)=\|τ−1\(u<0\)\|⋅u2L\_\{\\tau\}^\{2\}\(u\)=\|\\tau\-\\mathbf\{1\}\(u<0\)\|\\cdot u^\{2\}且τ∈\(0\.5,1\)\\tau\\in\(0\.5,1\)。然后通过优势加权回归 (Peng et al., 2019 (https://arxiv.org/html/2607.07855#bib.bib147)) 提取高层策略:
LπH=−E\(s,w,g\)∼D\[exp\(αHAenv\(s,w,g\)\)⋅logπH\(φ\(\[s;w\]\)\|s,g\)\],\\mathcal\{L\}\_\{\\pi^\{H\}\}\\;=\;\\-\\,\\mathbb\{E\}\_\{\(s,w,g\)\\sim\\mathcal\{D\}\}\\left\[\\exp\\bigl\(\\alpha\_\{H\}A\_\{\\mathrm\{env\}\}\(s,w,g\)\\bigr\)\\cdot\\log\\pi^\{H\}\\bigl\(\\phi\(\[s;w\]\)\\,\\bigm\|\\,s,g\\bigr\)\\right\], (3)
其中Aenv\(s,w,g\)=Vθ\(w,g\)−Vθ\(s,g\)A\_\{\\mathrm\{env\}\}\(s,w,g\)=V\_\{\\theta\}\(w,g\)\-V\_\{\\theta\}\(s,g\),αH\>0\\alpha\_\{H\}\>0。遵循HIQL的第5.2节,回归目标是潜在变量z=φ\(\[s;w\]\)z=\\phi\(\[s;w\]\),而非原始路标点ww,这一选择对于基于图像的环境是必需的,对于基于状态的环境也始终有益;NFTR保持不变。
我们分析的两个技术切入点:HIQL的层次结构通过信噪比论证得到证明 (Park et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib274), 命题4.1),该论证未涉及高层策略类别,因此从POR继承的单峰高斯 (Xu et al., 2022 (https://arxiv.org/html/2607.07855#bib.bib413)) 未得到分析。公式2 (https://arxiv.org/html/2607.07855#S2.E2) 中的无动作目标也仅在确定性动力学下无偏 (Park et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib274), 第3节),而公式3 (https://arxiv.org/html/2607.07855#S2.E3) 中的AWR会指数放大任何由此产生的值过估计。第3.1 (https://arxiv.org/html/2607.07855#S3.SS1) 和3.2 (https://arxiv.org/html/2607.07855#S3.SS2) 节利用了这两个切入点。
#### 2.3 三角不等式作为一个结构基元
我们从拟度量学习的更广泛机制中单独提取出一个结构性质:三角不等式。早期工作 (Wang et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib211); Liu et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib91); Myers et al., 2024 (https://arxiv.org/html/2607.07855#bib.bib321), 2025c (https://arxiv.org/html/2607.07855#bib.bib389)) 将拟度量视为一个*估计目标*,其中下游性能与距离恢复的准确性成正比。我们则将该不等式本身视为AWR权重上的一个*结构先验*,无论底层距离是否被准确恢复。第4 (https://arxiv.org/html/2607.07855#S4) 节 (Q3) 表明,一个未经训练的dθd\_\{\\theta\}已经能够达到与训练过的版本相当的性能,支持了这一设计。
###### 定义1(拟度量)。一个函数d:S×S→R≥0d:\\mathcal\{S\}\\times\\mathcal\{S\}\\to\\mathbb\{R\}\_\{\\geq 0\}是一个拟度量,如果它满足:(1) d\(s,s\)=0d\(s,s\)=0,(2) 当s≠gs\\neq g时d\(s,g\)\>0d\(s,g\)\>0,以及 (3) 对所有s,w,gs,w,g有d\(s,g\)≤d\(s,w\)\+d\(w,g\)d\(s,g\)\\leq d\(s,w\)\+d\(w,g\)。与度量不同,拟度量不必对称。在下文中,dθd\_\{\\theta\}表示一个学习的距离,其三角不等式在架构层面得到保证。具体的MRN参数化、训练损失以及训练与未训练的对比推迟到第3.4 (https://arxiv.org/html/2607.07855#S3.SS4) 和4 (https://arxiv.org/html/2607.07855#S4) 节。该构造的两个后果对我们的框架很重要。首先,该不等式在*架构上*成立,因此即使在训练之前也可作为结构先验使用。其次,嵌入隐式地捕捉了*数据集平均可达性*,这为第3.2 (https://arxiv.org/html/2607.07855#S3.SS2) 节描述的幸运转移过滤提供了机制基础。前者是我们使用的,后者使这种使用具有可解释性。
#### 2.4 归一化流(NF)
NF (Dinh et al., 2014 (https://arxiv.org/html/2607.07855#bib.bib367), 2017 (https://arxiv.org/html/2607.07855#bib.bib345); Papamakarios et al., 2021 (https://arxiv.org/html/2607.07855#bib.bib347); Ghugare and Eysenbach, 2025 (https://arxiv.org/html/2607.07855#bib.bib343)) 通过可逆函数变换简单的基分布来定义概率分布,从而能够进行精确的密度计算和高效采样。
###### 定义2(归一化流)。一个归一化流通过一个可逆变换fθ:Rd→Rdf\_\{\\theta\}:\\mathbb\{R\}^\{d\}\\to\\mathbb\{R\}^\{d\}应用于基分布pbase\(ε\)p\_\{\\text\{base\}\}\(\\epsilon\),定义了一个在z∈Rdz\\in\\mathbb\{R\}^\{d\}上的分布pθ\(z\)p\_\{\\theta\}\(z\):
z=fθ−1\(ε\),ε∼pbase\(ε\)。z=f\_\{\\theta\}^\{\-1\}\(\\epsilon\),\\quad\\epsilon\\sim p\_\{\\text\{base\}\}\(\\epsilon\)。 (4)
密度通过变量变换公式计算:
logpθ\(z\)=logpbase\(fθ\(z\)\)\+log\|det∂fθ∂z\|。\\log p\_\{\\theta\}\(z\)=\\log p\_\{\\text\{base\}\}\(f\_\{\\theta\}\(z\)\)\+\\log\\left\|\\det\\frac\{\\partial f\_\{\\theta\}\}\{\\partial z\}\\right\|。 (5)
条件流将变换fθf\_\{\\theta\}基于上下文cc进行条件化,以建模pθ\(z∣c\)p\_\{\\theta\}\(z\\mid c\),我们在第3.4 (https://arxiv.org/html/2607.07855#S3.SS4) 节中用RealNVP (Dinh et al., 2017 (https://arxiv.org/html/2607.07855#bib.bib345)) 的仿射耦合层实例化它。
### 3 方法:NFTR
我们提出NFTR,它通过两项互补创新解决HIQL的局限性:用于多模态子目标分布的归一化流高层子目标策略(第3.1 (https://arxiv.org/html/2607.07855#S3.SS1) 节),以及用于过滤几何不一致子目标的三角松弛可组合性重加权(第3.2 (https://arxiv.org/html/2607.07855#S3.SS2) 节)。然后我们提供对组合方法的理论分析(第3.3 (https://arxiv.org/html/2607.07855#S3.SS3) 节),并描述实现细节(第3.4 (https://arxiv.org/html/2607.07855#S3.SS4) 节)。整体架构如图1 (https://arxiv.org/html/2607.07855#S3.F1) 所示。
参见图注
图1: NFTR概览。(a) 离线轨迹。(b) 一个归一化流高层策略建模多模态子目标分布。(c) 拟度量dθd\_\{\\theta\}引出松弛量Δ\(s,w,g\)=ReLU\(d\(s,w\)\+d\(w,g\)−d\(s,g\)\)\\Delta\(s,w,g\)=\\mathrm\{ReLU\}\(d\(s,w\)\{\+\}d\(w,g\)\{\-\}d\(s,g\)\),该量降低不可组合子目标的权重。(d) 执行产生一条可行的拼接路径。RWDR将来自VθV\_\{\\theta\}的AenvA\_\{\\text\{env\}\}和来自dθd\_\{\\theta\}的Δ\\Delta结合,以训练高层子目标策略。
#### 3.1 归一化流高层子目标策略
两个关于HIQL高层训练集的事实驱动了分析。潜在代码z=φ\(\[s;w\]\)z=\\phi\(\[s;w\]\)是kk步路标点w=st\+kw=s\_\{t\+k\}的确定性图像 (Park et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib274), 算法1),并且对于在许多轨迹中出现的固定\(s,g\)\(s,g\),ww的经验分布由轨迹级别的路径多样性而非单步随机性塑造。分支走廊、随机化着陆点的传送器以及将相同物理路标点分散在φ\\phi空间中的观测噪声,都会产生由不可达区域Swall⊂Rd\\mathcal\{S\}\_\{\\mathrm\{wall\}\}\\subset\\mathbb\{R\}^\{d\}分隔的不相连的路标点簇。我们将其建模为一个状态相关的混合分布:
pD\(z∣s,g\)=∑m=1M\(s,g\)πm\(s,g\)qm\(z∣s,g\),p\_\{\\mathcal\{D\}\}\(z\\mid s,g\)\\;=\\;\\sum\_\{m=1\}^\{M\(s,g\)\}\\pi\_\{m\}\(s,g\)\\,q\_\{m\}\(z\\mid s,g\), (6)
其中组件具有路径连通、成对不相交的支撑集supp\(qm\)\\mathrm\{supp\}\(q\_\{m\}\)。我们将Swall\\mathcal\{S\}\_\{\\mathrm\{wall\}\}视为物理不可达区域在φ\\phi空间中的经验像(在我们的可视化中观察到,图7 (https://arxiv.org/html/2607.07855#A6.F7)),因为HIQL的表征充分性 (Park et al., 2023 (https://arxiv.org/html/2607.07855#bib.bib274), 命题5.1) 仅在确定性情况下精确成立。下一个定理刻画了HIQL从POR继承的单峰高斯失效的情况。据我们所知,这是HIQL模式坍缩局限性的第一个闭式刻画。
###### 定理3.1(高斯高层子目标策略的模式平均化)。设πθH\(z∣s,g\)=N\(z;μθ\(s,g\),σ2Id\)\\pi^\{H\}\_\{\\theta\}\(z\\mid s,g\)=\\mathcal\{N\}\(z;\\,\\mu\_\{\\theta\}\(s,g\),\\,\\sigma^\{2\}I\_\{d\}\),其中σ\>0\\sigma\>0固定,μθ\\mu\_\{\\theta\}无约束,通过HIQL的AWR目标LAWR\(θ\)=−E\(s,w,g\)∼D\[eαHAH\(s,w,g\)logN\(φ\(\[s;w\]\);μθ\(s,g\),σ2Id\)\]\\mathcal\{L\}进行训练相似文章
用于长期离线目标条件强化学习的递归价值学习
本文介绍了DCRL,一种用于离线目标条件强化学习的分治方法,通过递归二叉树分解减少长期任务中的错误累积,在OGBench基准测试中实现了性能提升。
PathBridger: 子目标桥接用于离线目标条件强化学习
PathBridger提出了一种分层离线目标条件强化学习方法,该方法通过逆动力学建模显式地将子目标选择与短期执行连接起来,在基准任务上实现了强大性能。
用于时间序列基础模型强化学习后训练的地面真值邻域正则化
本文发现了时间序列基础模型在强化学习后训练中的“次优坍缩”现象,并提出了地面真值邻域正则化(GTN-R),使输出分布保持在真实值附近,从而提升预测性能。
NormGuard:流匹配强化学习中保持奖励的范数约束
本文提出了NormGuard,一种范数预算正则化器,用于在流匹配生成模型的强化学习后训练过程中抑制与奖励无关的速度范数膨胀,从而在不牺牲奖励的情况下改善感知图像质量。
通过选择性奖励刺激改进离线目标条件强化学习
该论文提出了RSIQL,一种非层次化的离线目标条件强化学习方法,通过使用选择性奖励刺激来提升在D4RL等基准测试上的性能。