利用梯度惩罚潜在动力学实现平滑梦想与高效采样
摘要
GPLD为DreamerV3引入了梯度惩罚潜在动力学正则化器,强制转换学习中的局部平滑性,提高了连续控制任务(尤其是复杂运动)的样本效率。
arXiv:2605.23089v1 公告类型:新
摘要:基于模型的强化学习通过学习世界模型提高了样本效率。然而,现有的潜在世界模型(如DreamerV3)并未在其学习的转换动力学中明确施加局部平滑性,这导致转换动力学学习的一个有用的归纳偏置未被利用。我们提出了GPLD,一种针对DreamerV3的梯度惩罚潜在动力学正则化器,该正则化器对后验潜在分布应用逐行雅可比惩罚,以鼓励局部平滑的转换学习。我们证明,该惩罚可以解释为离散嵌入状态MDP中转换律有限差分平滑的连续潜在类比,并使用Hutchinson型随机探针高效估计。在经验上,在DeepMind Control本体感受任务中,GPLD提高了总体样本效率,在较高复杂度的运动环境中尤其显著。在更具挑战性的四足机器人任务中,GPLD更早地达到高回报行为,并在更长的周期内表现出更一致的后期学习。显式的局部平滑正则化是改进平滑连续控制环境的潜在世界模型的一种简单而有效的方法。GPLD的代码可在github.com/romils9/gpld-mbrl获取。
查看缓存全文
缓存时间: 2026/05/25 09:00
# 使用梯度惩罚潜在动态实现平滑梦境与高效采样
来源:https://arxiv.org/html/2605.23089
Romil V\. Sonigra 德克萨斯A&M大学 电气与计算机工程系 大学城,德克萨斯州 77843 romils@tamu\.edu &P\. R\. Kumar 德克萨斯A&M大学 电气与计算机工程系 大学城,德克萨斯州 77843 prk@tamu\.edu
###### 摘要
基于模型的强化学习通过学习世界模型来提高样本效率。然而,现有的潜在世界模型(如 DreamerV3)并未显式地在其学习的转移动态中施加局部平滑性,这导致一个有用的转移动态学习归纳偏置未被利用。我们提出 GPLD,一种用于 DreamerV3 的梯度惩罚潜在动态正则化器,它对后验潜在分布施加逐行雅可比惩罚,以鼓励局部平滑的转移学习。我们表明,该惩罚可以解释为离散嵌入状态 MDP 中转移规律的有限差分平滑在连续潜在空间中的类比,并使用 Hutchinson 风格随机探测法高效估计。在 DeepMind Control 本体感受任务上,GPLD 提高了总样本效率,在复杂度较高的运动环境中增益尤其显著。在更具挑战性的四足机器人任务上,GPLD 更早达到高回报行为,并在更长的时间跨度上表现出更一致的后期学习。显式的局部平滑正则化是改进应用于平滑连续控制环境的潜在世界模型的一种简单有效的方法。GPLD 代码可在 github\.com/romils9/gpld\-mbrl (https://github.com/romils9/gpld-mbrl) 获取。
## 1 引言
基于模型的强化学习 (MBRL) 通过学习可用于规划和策略优化的预测性世界模型来提高样本效率 (Ha and Schmidhuber,2018 (https://arxiv.org/html/2605.23089#bib.bib12))。DreamerV3 已证明,潜在世界模型通过学习紧凑的循环状态空间表示并通过想象推演训练策略,可以扩展到多样化的连续控制任务 (Hafneret al\.,2025 (https://arxiv.org/html/2605.23089#bib.bib13))。尽管取得了成功,标准的潜在世界模型并未显式利用许多连续控制系统的一个基本结构先验:相邻状态会诱导相似的短时域转移行为。直接在学习的潜在动态中编码这一先验可以帮助世界模型在相邻状态之间共享信息,从而减少学习有用转移结构所需的交互数据量。
我们研究如何通过 *梯度惩罚潜在动态* (GPLD) 来利用这种局部平滑性先验,GPLD 是一种用于潜在世界模型动态的可微正则化器。该正则化器通过一个离散到连续的平滑性论证得到激励。在有限嵌入状态 MDP 中,可以通过惩罚相邻状态转移规律之间的差异来施加局部平滑性。当状态表示是连续的并且转移模型是可微的时,这些归一化的有限差分就变成了学习到的动态的方向导数。对局部方向进行平均会得到 Frobenius 雅可比惩罚。这提供了一条从表格 MDP 中的邻域平滑到 GPLD 使用的梯度惩罚的原则性路径。
我们在 DreamerV3 中实现了 GPLD,并在 DeepMind Control 任务上进行了评估。实验表明,GPLD 提高了本体感受任务的总体样本效率,其中在复杂度较高的运动环境中增益最大。在困难的四足机器人任务上,这种益处在更长的时域上变得更加明显,GPLD 更早达到高回报行为,并表现出更一致的后期学习。像素观测结果显示出较温和的总增益,这表明当动态学习与高维视觉编码耦合时,潜在平滑正则化的效果较弱。
我们的贡献是:
1. 1. 一个离散到连续的论证,展示了表格转移规律的有限差分平滑如何导致可微潜在模型中的 Frobenius 雅可比正则化。
2. 2. GPLD,一个针对 DreamerV3 的后验雅可比正则化器,明确鼓励潜在概率图中的局部平滑性,在 DeepMind Control 本体感受基准测试上实现了 17.7\% 的归一化总增益。
3. 3. 在 DeepMind Control 上对 GPLD 的评估,显示了在较高复杂度的本体感受运动任务上 34.6\% 的归一化总增益,在困难的四足机器人任务上更清晰的长期增益,以及主要设计选择的消融实验。
GPLD 代码可在 github\.com/romils9/gpld\-mbrl (https://github.com/romils9/gpld-mbrl) 获取。
## 2 相关工作
#### 强化学习中的平滑性
平滑性长期以来被认为是强化学习中泛化、稳定预测和控制的关键 (Boyan and Moore,1994 (https://arxiv.org/html/2605.23089#bib.bib3); Munos and Szepesvári,2008 (https://arxiv.org/html/2605.23089#bib.bib15); Asadiet al\.,2018 (https://arxiv.org/html/2605.23089#bib.bib1); Christmannet al\.,2024 (https://arxiv.org/html/2605.23089#bib.bib11))。无约束神经网络可能产生破坏稳定性和泛化的高频振荡 (Boyan and Moore,1994 (https://arxiv.org/html/2605.23089#bib.bib3); Roscaet al\.,2020 (https://arxiv.org/html/2605.23089#bib.bib17); Christmannet al\.,2024 (https://arxiv.org/html/2605.23089#bib.bib11)),并且此类误差会在多步值或动态预测中累积 (Thrun and Schwartz,1993 (https://arxiv.org/html/2605.23089#bib.bib22); Venkatramanet al\.,2015 (https://arxiv.org/html/2605.23089#bib.bib23))。在基于模型的强化学习中,Asadiet al\. (2018 (https://arxiv.org/html/2605.23089#bib.bib1)) 表明,对学习到的转移模型施加 Lipschitz 约束会得到更紧的多步估计误差界,直接将转移平滑性与世界模型准确性联系起来。这些工作激发将平滑性作为学习动态的一个有用归纳偏置,但没有为随机潜在世界模型提供局部雅可比正则化器。
#### 梯度惩罚与控制平滑性
梯度惩罚提供了一种可微的方式来鼓励局部平滑性,并已广泛应用于表示学习和生成建模 (Gulrajaniet al\.,2017 (https://arxiv.org/html/2605.23089#bib.bib7);terjék2020adversariallipschitzregularization; Goodfellowet al\.,2015 (https://arxiv.org/html/2605.23089#bib.bib8))。在强化学习中,相关方法通常正则化值函数、策略或动作轨迹。例如,Wanget al\. (2025 (https://arxiv.org/html/2605.23089#bib.bib24)) 将梯度惩罚应用于无模型 RL 中的 Q 函数,而 Chenet al\. (2024 (https://arxiv.org/html/2605.23089#bib.bib4)) 引入了 Lipschitz 约束策略作为任务特定奖励平滑启发式方法的可微替代方案。其他控制方法通过对机械能或低通滤波施加惩罚来鼓励平滑行为 (Fuet al\.,2021 (https://arxiv.org/html/2605.23089#bib.bib6); Penget al\.,2020 (https://arxiv.org/html/2605.23089#bib.bib16))。相比之下,GPLD 针对学习到的世界模型本身:它对 DreamerV3 中的后验潜在概率图施加逐行雅可比惩罚,改进了用于推理和想象的潜在动态。
#### 全局与局部平滑性约束
诸如谱归一化之类的全局平滑性方法通过约束逐层谱范数来限制神经网络的 Lipschitz 常数 (Gogianuet al\.,2021 (https://arxiv.org/html/2605.23089#bib.bib10); Bjorcket al\.,2022 (https://arxiv.org/html/2605.23089#bib.bib2))。然而,全局约束可能过于严格,因为全局 Lipschitz 常数可能源于输入空间中罕见、未见或无关的区域 (Dherinet al\.,2022 (https://arxiv.org/html/2605.23089#bib.bib5))。GPLD 则是在世界模型训练期间对采样的潜在输入施加一个局部的、数据依赖的平滑惩罚。这将 GPLD 与全局归一化方法和策略平滑方法区分开来:GPLD 正则化了基于模型的智能体使用的后验转移表示,而世界模型的其余部分除了训练目标外不受约束。
## 3 GPLD 的离散到连续论证
我们通过将转移规律上的离散局部平滑性先验与潜在世界模型设置中使用的连续雅可比惩罚联系起来,来论证 GPLD。我们从一个有限的嵌入状态 MDP 开始,其中可以通过惩罚相邻转移分布的有限差来施加平滑性。然后我们考虑一个在连续状态表示上的可微转移模型,并表明这些有限差变成了方向雅可比范数,其各向同性平均产生 Frobenius 雅可比范数。这产生了 GPLD 中使用的逐行后验正则化器。
### 3.1 离散局部平滑性先验
我们从有限状态和有限动作 MDP 开始。令 S 表示状态空间,A 表示动作空间,并令 e: S → R^d 是将状态嵌入度量空间的函数。对于每个动作 a ∈ A,令 P(· | s, a) ∈ Δ^{|S|-1} 表示转移概率向量,并定义 s 的 ε 邻域为
N_ε(s) := {k ∈ S : ‖e(k) - e(s)‖_2 ≤ ε}.
给定一个转移数据集 D = {(s, a, s')}_{t=1}^T,令 N(s, a, s') 表示从 (s, a) 到 s' 的观测转移次数。标准最大似然估计器最小化负对数似然
L_MLE(P; D) = - ∑_{s,a,s'} N(s, a, s') log P(s' | s, a).
一个自然的结构先验是相邻状态应诱导相似的转移规律。我们通过一个有限差正则化器来耦合相邻转移向量:
L_FD(P) = ∑_a ∑_s ∑_{k ∈ N_ε(s)} ∑_{s'} ( (P(s'|k,a) - P(s'|s,a)) / ‖e(k)-e(s)‖_2 )^2. (1)
这产生了正则化目标
min_P L_MLE(P; D) + λ L_FD(P).
这是 GPLD 的离散前身:它惩罚跨越相邻状态的转移规律的归一化局部差异,因此明确倾向于局部平滑的转移估计。
### 3.2 连续状态极限
当转移规律由连续状态嵌入上的可微函数表示时,式 (1) 中的离散有限差正则化器会导致雅可比惩罚。考虑一个相邻状态 k ∈ N_ε(s)。在嵌入空间中,它相对于 s 的位移可以写为
e(k) - e(s) = h u, (2)
其中 h = ‖e(k) - e(s)‖_2,u ∈ R^d 是一个单位向量。将 (2) 代入 (1) 的求和项得到
‖ (P(·|k,a) - P(·|s,a)) / ‖e(k)-e(s)‖_2 ‖_2^2 ↝ ‖ (f_θ(x+hu, a) - f_θ(x, a)) / h ‖_2^2,
其中 x = e(s),并且 f_θ 表示一个可微的连续状态转移模型。因此,离散正则化器自然产生了 f_θ 的归一化局部有限差。
小邻域极限 h → 0 随后将这些有限差转化为方向导数。
令 f_θ: R^d → R^m 在 x ∈ R^d 处是局部 Fréchet 可微的。那么对于任何单位向量 u ∈ R^d,
lim_{h→0} ‖ (f_θ(x+hu) - f_θ(x)) / h ‖_2^2 = ‖ J_{f_θ}(x) u ‖_2^2. (3)
这表明每个归一化有限差项收敛到 ‖ J_{f_θ}(x) u ‖_2^2。由于离散正则化器聚合每个参考状态周围的相邻状态,其小邻域连续极限引入了对 x 周围所有单位方向的平均。
为了了解各向同性平均如何产生 Frobenius 雅可比能量,让 u 在单位球面 S^{d-1} 上均匀分布。那么
E_u[ ‖ J_{f_θ}(x) u ‖_2^2 ] = (1/d) ‖ J_{f_θ}(x) ‖_F^2. (4)
因此,在局部各向同性假设下,离散有限差正则化器的连续对应物,忽略常数因子,是一个平方 Frobenius 雅可比惩罚。这建立了从离散邻域平滑到 GPLD 使用的连续雅可比正则化的理论桥梁。在下一节中,我们通过在 DreamerV3 中对后验潜在概率图逐行应用此惩罚来实例化它。式 (3) 和 (4) 的证明见附录 A (https://arxiv.org/html/2605.23089#A1)。
## 4 DreamerV3 中的梯度惩罚潜在动态
我们现在将在第 3 节中推导出的 Frobenius 雅可比惩罚实例化到 DreamerV3 中。GPLD 正则化后验潜在概率图,而非原始环境转移图。这一选择与在世界模型学习期间用于潜在状态推断的对象相匹配,并通过反向模式自动微分直接实现。
DreamerV3 训练一个循环状态空间世界模型,包含确定性潜在状态 h_t、随机潜在状态 z_t、编码器输出 e_t 和动作 a_t,所有都在时间 t。其世界模型目标可以写为
L_Dv3 := E_{q_φ}[ ∑_{t=1}^T ( β_pred L_pred,t + β_dyn L_dyn,t + β_rep L_rep,t ) ],
其中 L_pred,t 在时间 t 组合了重建、奖励和继续预测损失。动态和表示 KL 项为
L_dyn,t = max(1, D_KL( sg[ q_φ(z_t | h_t, e_t) ] ‖ p_φ(z_t | h_t) )),
并且
L_rep,t = max(1, D_KL( q_φ(z_t | h_t, e_t) ‖ sg[ p_φ(z_t | h_t) ] )),相似文章
重新思考LLM强化学习中的散度正则化
本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。
Dreamer-SAC:在潜在世界模型中进行离策略学习以实现样本高效的自动驾驶
本文提出Dreamer-SAC,一种基于模型的强化学习框架,将递归状态空间世界模型与潜在空间中的软演员-评论家算法相结合,以实现样本高效的自动驾驶。该框架在需要更少的真实环境交互的情况下,优于DreamerV3、SAC和PPO基线。
Dynamic-dLLM:动态缓存预算与自适应并行解码,实现扩散大语言模型的无训练加速
本文提出 Dynamic-dLLM,一种无训练框架,通过动态分配缓存更新预算和校准解码阈值来加速扩散大语言模型,在 LLaDA 和 Dream 等模型上实现超过 3 倍的加速,同时保持性能。
自蒸馏策略梯度
SDPG(自蒸馏策略梯度)是一种面向大语言模型的全新强化学习训练框架,结合了基于组相对验证器的优势函数、在线自蒸馏与KL正则化,旨在解决RLVR训练中稀疏奖励与训练不稳定的问题。该方法通过条件化特权上下文,使同一模型同时充当学生和教师,在稳定性和性能上均优于RLVR及自蒸馏基线方法。
从噪声到控制:Parameterized Diffusion Policies
本文介绍了参数化扩散策略(Parameterized Diffusion Policy, PDP)框架,该框架通过以低维潜在参数为条件,使扩散策略变得可控,从而实现无需重新训练即可进行平滑的行为插值和自适应。在仿真和真实机器人实验中,该方法在复杂的多模态机器人任务上展现了更优的性能。