学习可泛化的技能策略,基于数据高效的无监督强化学习
摘要
提出GenDa,一个统一的无监督强化学习框架,通过技能重新标记和互补信息瓶颈解决了非平稳技能语义和脆弱泛化问题,显著提高了数据效率和泛化能力。
arXiv:2607.00392v1 Announce Type: new
摘要:无监督强化学习(URL)旨在无需外部奖励的情况下预训练可扩展的、以技能为条件的策略,作为下游控制任务的基础。尽管近期取得了进展,我们认为当前的离策略URL方法受到两个关键且被忽视的瓶颈的限制:(1)非平稳技能语义和(2)脆弱泛化。为了解决这些挑战,我们提出了GenDa(Generalizable Data-efficient Agent,可泛化的数据高效智能体),一个统一的鲁棒无监督强化学习框架。首先,我们引入了技能重新标记机制以缓解非平稳性,并显著提高预训练的数据效率。其次,我们提出了互补信息瓶颈(CIB),鼓励学习到的技能策略关注自我中心特征,并在下游任务中对分布变化具有鲁棒性。通过多种实验,我们证明了GenDa显著增强了URL的可扩展性,具有优越的泛化能力和数据效率。我们的代码和视频可在 https://ihatebroccoli.github.io/official-GenDa 获取。
查看缓存全文
缓存时间: 2026/07/02 05:38
# 使用数据高效无监督强化学习学习可泛化的技能策略
来源:https://arxiv.org/html/2607.00392
###### 摘要
无监督强化学习(URL)旨在无需外在奖励的情况下预训练可扩展的、以技能为条件的策略,为下游控制任务奠定基础。尽管近期取得进展,我们认为当前离策略URL方法受限于两个关键且被忽视的瓶颈:(1) 技能语义的非平稳性,以及(2) 脆弱的泛化能力。为应对这些挑战,我们提出GenDa(可泛化数据高效智能体),这是一个用于鲁棒无监督强化学习的统一框架。首先,我们引入一种技能重标记机制,以缓解非平稳性并显著提升预训练的数据效率。其次,我们提出互补信息瓶颈(CIB),促使所学技能策略聚焦于自我中心特征,从而对下游任务的分布偏移具有鲁棒性。通过多项实验,我们证明GenDa显著提升了URL的可扩展性,具备优越的泛化能力和数据效率。我们的代码和视频可在https://ihatebroccoli.github.io/official-GenDa/ 获取。
机器学习,ICML
## 1 引言
无监督强化学习(URL)的最新进展使得从状态转换中发现语义上不同的行为(“技能”)成为可能,而无需访问外部奖励信号(Gregor et al., 2016; Kim et al., 2021; Kamienny et al., 2022; Park et al., 2023; Yang et al., 2023)。这一范式旨在创建一个通用的控制基础,而非仅仅学习单个技能。它提供了一个预训练策略,可通过最少的微调轻松适应各种下游任务(Laskin et al., 2021; Rajeswar et al., 2023)。实现URL的可扩展性需要预训练阶段的效率以及迁移阶段的鲁棒性,确保所学策略能泛化到不同的下游任务。
尽管URL近期取得了进展,我们认为当前最先进的方法面临两个关键瓶颈,阻碍了这种可扩展性:(1) 因被忽视的非平稳技能语义导致的样本效率低下,以及(2) 因对全局上下文过拟合导致的脆弱泛化。
首先,真实世界的交互代价高昂,这使得数据效率至关重要。为了最大化数据效率,现代URL方法依赖离策略算法,这些算法会重用存储在回放缓冲区中的过去经验。然而,这引入了一个致命缺陷:语义漂移。在离策略设置中,每条轨迹都是在随机采样的技能z和以z为条件的技能策略下收集的(Eysenbach et al., 2019; Sharma et al., 2020)。由此产生的z-轨迹对存储在回放缓冲区中,并在整个训练过程中被重用(Haarnoja et al., 2018; Laskin et al., 2022; Park et al., 2024; Zheng et al., 2025)。随着学习的进行,由相同技能z引发的行为轨迹可能会发生变化,因为技能策略在离策略学习中不断演化。z的时变语义通过提供过时样本,导致技能策略的不稳定。
其次,要使技能策略成为各种下游任务的可扩展基础,它必须对分布偏移具有鲁棒性。例如,“向前走”这样的技能,无论全局上下文信息(如环境因素)如何变化,都应能够执行。然而,在先前许多工作中(Eysenbach et al., 2019; Park et al., 2024; Zheng et al., 2025),用于训练技能策略的观测包含了并非执行技能所必需的全局上下文信息。当技能策略以这些全局信号为条件时,相同的技能可能会在坐标分布发生微小偏移时表现出截然不同的行为,或者对特定全局上下文过拟合。这种脆弱性限制了技能在下游任务中的可复用性,并导致基本的泛化失败。
为解决这些挑战:
- • 我们形式化了两个被忽视的失败模式,并提供了其影响的理论和实证证据。
- • 我们引入技能重标记来缓解先前离策略URL中的语义漂移。我们还提出了一种新的正则化项,以确保在互信息目标下的技能多样性,有效将我们的技能重标记框架与其他领域的先前文献区分开来(Andrychowicz et al., 2017)。
- • 我们提出互补信息瓶颈(CIB),这是一个兼容无监督框架的即插即用模块。CIB学习一种嵌入,阻止策略利用全局上下文信息,从而提升在分布偏移下技能执行的一致性。
我们在多样化的状态和像素基准测试中评估了我们的方法,证明与先前方法相比,在数据效率和技能策略泛化方面具有优越性。值得注意的是,我们还考虑了高维状态环境,现有方法在这些环境中无法发现有意义的技能,而我们的方法成功学习了连贯且可复用的技能策略。
## 2 预备知识
##### 无监督技能发现
我们遵循先前工作的设置(Park et al., 2024),即一个没有奖励函数的受控马尔可夫过程。MDP定义为 M = (S, A, μ, p)。S 表示状态空间,A 表示动作空间,μ : Δ(S) 表示初始状态分布,p : S × A → Δ(S) 表示转移动力学核。我们还考虑一组离散或连续的潜在向量 z ∈ Z,以及一个以潜在为条件的技能策略 π(a | s, z)。
在无监督技能发现的术语中,潜在技能向量 z 从先验分布 p(z) 中采样。然后技能策略 π(a | s, z) 在整个回合中使用固定的 z 展开轨迹 τ = (s0, a0, s1, a1, ..., sT)。在此设置中,主要目标是在没有任何指导(如数据、先验知识和监督)的情况下从头开始学习多样且有用的行为 π(a | s, z)。
我们遵循度量感知无监督技能发现(Park et al., 2024)的表示目标,其中使用潜在映射函数 φ(s) 为技能向量 z ∈ Z 注入语义:
sup_{π, φ} E_{p(τ,z)} [∑_{t=0}^{T-1} (φ(s') - φ(s))^⊤ z] s.t. ‖φ(s) - φ(s')‖_2 ≤ 1, ∀ (s, s') ∈ S_adj (1)
##### 使用预训练技能策略的下游应用
预训练的技能策略 π 可适应下游任务。一个分层控制器 π^h(z | s) 从学习到的技能集合中采样,并将 z 传递给(冻结的)技能策略,以最大化下游奖励。
参见图注 图1: 先前算法(Park et al., 2024)中的语义漂移。该图显示了技能策略使用相同技能向量 z 收集的轨迹,说明在训练过程中,相同的 z 可能观察到不同的行为轨迹。在标准的离策略URL中,这些轨迹全部存储在回放缓冲区中,并反复用于表示学习。因此,z 与轨迹之间出现一对多的映射,这会破坏表示学习的稳定性并导致语义漂移。
## 3 问题陈述
我们形式化地识别出阻碍离策略URL实现可扩展性的两个核心挑战。
### 3.1 来自语义未接地技能展开的样本效率低下
在离策略URL设置中,智能体以采样的技能 z ~ p(z) 为条件收集轨迹 τ。包含技能标签 (τ, z_roll) 的转移元组存储在回放缓冲区 B 中。关键问题在于 z 的双重角色:它既是策略 π(a|s,z) 的输入技能,又是表示 φ(s) 的目标标签。
与标准强化学习不同(奖励函数是静态的),在URL中,z 的语义由持续演化的表示 φ 定义。令 φ_t 表示训练步骤 t 时的表示。在时间 t_old 使用技能 z 生成的轨迹 τ 满足关系 z ≈ φ_{t_old}(τ)。然而,在当前步骤 t_curr,更新后的表示 φ_{t_curr} 可能将该轨迹映射到潜在空间中一个完全不同的点。
大多数现有方法忽略这种漂移,使用缓冲区中的过时对 (τ, z) 来更新当前策略。这造成了语义错配:策略因未能根据当前 φ_{t_curr} 生成 z 而受到惩罚,即使该轨迹在 φ_{t_old} 下是正确的。因此,直到智能体收集到足够多的“新鲜”样本以有效取代或压倒过时数据时,有意义的修正才会发生。这成为梯度估计中高方差噪声的一个来源。因此,增加样本重用率(即高UTD比率)——这在离策略强化学习中通常能提升效率——反而通过在持续的标签噪声上过拟合而加剧了URL中的不稳定性。
图1 展示了相同的技能 z 可能根据 φ 和 π 的训练阶段而与不同的轨迹关联,凸显了离策略URL框架中一个潜在的严重失败模式。
参见图注 图2: 对xy坐标(全局上下文)的过拟合。偏移量 (a,b) 表示评估时智能体的初始xy位置设置为 (a,b)。在训练期间,智能体始终从 (0,0) 开始,因此该设置评估给定技能 z 在初始条件偏移下是否产生一致的行为。相同颜色的曲线表示由相同技能 z 生成的轨迹。当应用不同偏移量时,技能策略(Park et al., 2024)未能复现一致的轨迹,这是脆弱泛化的明确证据。
### 3.2 下游任务中技能策略泛化能力的缺失
第二个限制涉及所学技能策略的有限泛化能力。在URL中,技能策略通常旨在作为一致的局部行为基本单元,响应局部状态变化,并由给定技能的指导定向。这一特性是技能策略在不同初始条件和下游环境中复用的关键前提。
然而,在大多数先前工作中,技能策略通常直接以完整状态观测为条件。这些观测包含对执行局部行为并非必要的全局上下文信息(例如绝对位置或视觉背景线索)。当策略以这些信息为条件时,技能执行会与全局上下文纠缠在一起,削弱了所学行为预期的局部性。
这种纠缠使得策略在分布偏移下变得脆弱。预训练与部署之间全局上下文的变化会导致相同的潜在 z 产生不可靠的行为,严重阻碍下游性能。
在图2中,我们展示了先前算法的一个失败模式:以完整状态观测为条件时,在不同的全局上下文中无法可靠执行。这一失败表明,最大化预训练期间的状态覆盖是必要的,但不足以实现可扩展性;所学技能还必须与它们被发现的特定全局上下文分离。
## 4 方法
我们提出GenDa(可泛化数据高效智能体),这是一个旨在训练可扩展控制技能基础的统一框架。与先前将技能发现视为静态优化问题的工作不同,GenDa 解决了离策略学习的动态性质以及泛化的结构要求。我们引入 (a) 技能重标记,以动态地将过去经验与演化中的潜在空间对齐,以及 (b) 互补信息瓶颈(CIB),以结构上促使策略学习自我中心、可复用的行为。我们的方法基于先前的最先进算法(Park et al., 2024)。
### 4.1 技能表示学习的重标记
#### 4.1.1 使用当前潜在解释进行重标记。
标准离策略URL方法遭受语义漂移,即存储在回放缓冲区中的技能标签 z 随着表示 φ 的演化而变得过时。使用这些过时标签更新策略会在学习过程中注入高方差噪声,从而限制离策略设置中的数据效率。为克服这一点,我们引入技能重标记,将过去的轨迹视为灵活的、可以重新解释的经验,而非固定的 (τ, z) 对。
##### 重标记(z 步)
为了纠正由回放缓冲区中固定的 rollout 时间 z_roll 引起的语义不一致,我们需要定义一个与当前 φ 一致的新标签 z。为了定义这个 z,我们重新审视等式1中的 telescoping 和。对于一个回合 τ = (s0, a0, s1, ..., sT),telescoping 和可以写为 (φ(s_T) - φ(s_0))^⊤ z,这意味着 ∑_{t=0}^{T-1} (φ(s_{t+1}) - φ(s_t))。我们可以将这个 telescoping 和定义为传递最合适的方向向量,以使用当前策略 φ 解释 τ。
不使用 z_roll,而是根据当前潜在函数计算 z_relab:
z_relab(τ) = unit(φ(s_T) - φ(s_0)),其中 unit(x) := x / max(||x||_2, ε) 。 (2)
这里 ε 是一个非常小的正标量。
##### 优化(φ 步)
然后我们通过用 z_relab 替换 z 并停止梯度来学习等式1中的目标。相似文章
Skill0.5:面向智能体强化学习中分布外泛化的技能内化与利用联合框架
Skill0.5是一种新颖的智能体强化学习框架,通过动态难度感知路由器将通用技能内化与任务特定技能利用相结合,改进了复杂任务环境中的分布外泛化能力,在ALFWorld和WebShop上的实验证明了其效果。
Skill1:通过强化学习实现技能增强型智能体的统一进化
Skill1 是一个统一框架,通过共享的任务结果目标,训练单一策略以协同进化技能选择、利用与蒸馏。在 ALFWorld 和 WebShop 上的实验表明,该框架在复杂任务环境中优于现有的基线方法。
OPID: 同策略技能蒸馏用于智能体强化学习
OPID提出了一种同策略技能蒸馏框架,从完成的轨迹中提取密集后见监督,将基于结果的强化学习与词元级自蒸馏相结合,以提高语言智能体在多轮任务上的训练效率和性能。
GRLO:从零开始迈向开放环境下的通用强化学习
GRLO 提出了一种新颖的强化学习后训练方法,仅使用 5000 条提示和 22.7 GPU 小时,就在多个领域(数学、代码等)实现了强大的泛化能力,在效率和数据需求上显著优于领域内的 RLVR 基线。
利用局部动态规律实现离线分层强化学习中的可复用技能
本文介绍了CARL,一种利用局部动态规律学习可复用技能的离线分层强化学习方法。该方法将需要相似动作序列的状态-目标对进行聚类,从而实现更有效的技能复用,并在复杂的人形机器人任务上提升了性能。