Learning More from Less: 从后见之明中进行强化学习
摘要
介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。
查看缓存全文
缓存时间: 2026/07/13 07:58
# 从更少中学习更多:事后强化学习(Reinforcement Learning from Hindsight) 来源:https://arxiv.org/html/2607.09042 Iris Xu1,2,\*,Sunshine Jiang1,John Marangola1,Nitish Dashora1,Richard Li1,Thomas Liu1,Zexue He3,Yuheng Zhi4,Alex Pentland3,Pulkit Agrawal1,Zhang\-Wei Hong1,2 1Massachusetts Institute of Technology 2MIT\-IBM Computing Research Lab 3Stanford University 4University of California, San Diego ###### 摘要 强化学习(RL)越来越多地被用于视觉-语言-动作(VLA)模型的后训练,但每次更新都需要机器人的 rollout,这些 rollout 的收集缓慢且成本高昂,因此样本效率成为核心问题。操作任务通常只提供稀疏奖励,因此一个弱的策略在训练初期几乎每次 rollout 都会失败,并且几乎没有什么可学习的内容,即使这些失败执行了连贯的行为。然而,这种失败在另一个任务上却是成功的。我们提出了事后学习(LfH),它通过根据失败 rollout 实际完成的任务对其进行评分,将事后重标记引入 VLA 的 RL 后训练中。一个单一的视觉-语言模型同时重标记指令和奖励:为一组失败的 rollout 提出一个事后指令,并评分每个 rollout 满足该指令的程度,然后策略在重标记后的 rollout 和原始 rollout 上共同训练。由于 VLA 在语言上具有泛化能力,用语言进行重标记使得策略能从相同的轨迹中学习更多。在分布外的 LIBERO-PRO 任务上,标准 RL 提升缓慢,而 LfH 实现了 5 倍的样本效率提升,并且优于密集进度奖励基线。这种增益在多个 VLA 骨干网络以及真实的 Franka 机器人上均成立。 ††footnotetext: \*通讯作者:[email protected] ## 1 引言 强化学习(RL)[10 (https://arxiv.org/html/2607.09042#bib.bib20)] 已成为大语言模型后训练的标准工具 [19 (https://arxiv.org/html/2607.09042#bib.bib21),1 (https://arxiv.org/html/2607.09042#bib.bib22)],并且越来越多地用于微调机器人控制的视觉-语言-动作(VLA)模型 [6 (https://arxiv.org/html/2607.09042#bib.bib23)]。然而,在机器人领域,后训练受到更严酷的数据瓶颈限制:每次 RL 更新都依赖于从物理机器人收集的 rollout,这些 rollout 缓慢、昂贵,且通常难以扩展。因此,提高样本效率对于使 RL 后训练在 VLA 上变得实用至关重要。这一挑战在操作任务中尤为突出,因为 VLA 通常使用稀疏奖励进行微调。只有当机器人完成所指令的任务时,rollout 才会获得奖励,所有其他行为均不被赋予任何奖励。稀疏奖励是 RL 中长期存在的障碍 [4 (https://arxiv.org/html/2607.09042#bib.bib42),20 (https://arxiv.org/html/2607.09042#bib.bib41)]:在弱策略能够改进之前,它必须首先通过探索发现成功的轨迹。因此,在训练初期,几乎所有的 rollout 都看似无用。例如,当指令是“关闭微波炉”时,机器人可能反而拿起一个杯子(图 1 (https://arxiv.org/html/2607.09042#S1.F1))。这种行为在广义的操作意义上是连贯且与任务相关的,但并不满足所指令的任务。标准 RL 将整个 rollout 视为失败,忽略了机器人实际上成功执行了另一个有意义的技能这一事实。 我们的关键观察是,许多失败的 rollout 仅仅是相对于原指令失败而已。事后重标记 [2 (https://arxiv.org/html/2607.09042#bib.bib8),22 (https://arxiv.org/html/2607.09042#bib.bib1),21 (https://arxiv.org/html/2607.09042#bib.bib96),8 (https://arxiv.org/html/2607.09042#bib.bib10),23 (https://arxiv.org/html/2607.09042#bib.bib24)] 通过根据轨迹实际完成的任务(而非其被指令解决的任务)对其进行评估来利用这一现象。例如,拿起杯子的 rollout 可以被重标记为“拿起杯子”这一任务。这与密集进度奖励 [13 (https://arxiv.org/html/2607.09042#bib.bib59)] 不同,后者为同一指令任务提供更细粒度的反馈。事后重标记改变了任务分配本身,将原本无奖励的失败转化为对不同相关指令的成功示范。由于 VLA 以语言为条件并且可以在指令间泛化,这样的重标记 rollout 能提供标准 RL 会忽略的有用监督。剩下的挑战是如何用语言推断机器人实际做了什么;一个预训练的视觉-语言模型(VLM)[3 (https://arxiv.org/html/2607.09042#bib.bib19)] 可以直接从 rollout 的观测中提供这种描述。 我们提出事后学习(LfH),一种用于 VLA 的 RL 后训练方法,将失败的 rollout 转化为额外的训练信号。LfH 使用单个 VLM 同时重标记指令和奖励。给定一组未完成指令任务的 rollout,VLM 检查其中一个 rollout 并提出一个描述机器人实现行为的事后指令。然后,它评分该组中每个 rollout 满足该事后指令的程度。VLA 在原始 rollout 和它们的事后重标记版本上共同训练,使得策略既能从预期的成功中学习,也能从未预期但有意义的行为中学习。 我们通过在分布外的 LIBERO-PRO 任务 [32 (https://arxiv.org/html/2607.09042#bib.bib45)] 上微调 VLA 来评估 LfH,其中初始策略的成功率接近零,标准 RL 提升缓慢。LfH 从大多数失败的 rollout 中恢复出可用的信号,在大约训练步骤的五分之一处达到标准 RL 的最终成功率,并实现了 5 倍的样本效率提升。它还优于密集进度奖励基线,这表明在稀疏、低成功率的制度下,更改 rollout 被赋予奖励的任务可能比仅为原指令分配更密集的反馈更有价值。这些增益在多个 VLA 骨干网络以及真实的 Franka 机器人上均成立。 参见图注 图 1:事后学习(Learning from Hindsight)。一个未能完成指令任务的轨迹仍然可以表现出有意义的行为。LfH 使用 VLM 以语言重标记所实现的行为,将原本无用的失败转化为 VLA 微调的训练信号。 ## 2 相关工作 事后重标记。事后经验回放(HER)[2 (https://arxiv.org/html/2607.09042#bib.bib8)] 建立了这一思想,通过将目标重标记为代理实际达到的状态(而非原始目标)来工作。HER 也已被扩展到图像目标,使用想象的目标生成器 [23 (https://arxiv.org/html/2607.09042#bib.bib24),33 (https://arxiv.org/html/2607.09042#bib.bib93)]、目标条件价值函数 [8 (https://arxiv.org/html/2607.09042#bib.bib10)] 以及自监督方法 [21 (https://arxiv.org/html/2607.09042#bib.bib96)]。在开放式指令重标记 [31 (https://arxiv.org/html/2607.09042#bib.bib14)] 的并行工作中,该工作展示了在类游戏环境中基于语言的事后重标记,而我们提供了一种独特的算法和基于语言的事后重标记实现,并证明其在机器人领域的有效性。 奖励塑形与基础奖励模型。除了事后重标记,解决稀疏奖励 RL 的经典方法是奖励塑形,它提供中间反馈来引导代理朝向期望行为 [18 (https://arxiv.org/html/2607.09042#bib.bib95)]。由于手工设计这样的塑形成本过高,近期工作提出了大规模密集奖励模型用于可转移的奖励学习。先前的工作训练了文本条件的进度模型,可以是目标达成价值函数 [17 (https://arxiv.org/html/2607.09042#bib.bib54),16 (https://arxiv.org/html/2607.09042#bib.bib55)],或者结合演示上的插值启发式 [15 (https://arxiv.org/html/2607.09042#bib.bib56),13 (https://arxiv.org/html/2607.09042#bib.bib59),29 (https://arxiv.org/html/2607.09042#bib.bib82)],或者使用偏好标签 [25 (https://arxiv.org/html/2607.09042#bib.bib57)]。LfH 与密集进度奖励是互补的:LfH 不是为固定任务密集化反馈,而是通过重标记生成新的多样化任务,并通过泛化将成功桥接到原始任务。 提升语言可操控性。除了强化学习,另一种提升 VLA 任务完成的方法是增强语言可操控性。一种常见策略是在模仿学习或离线 RL 范式下进行数据增强,使用 VLM 对离线数据集中的指令进行重标记或合成,以扩展任务多样性 [27 (https://arxiv.org/html/2607.09042#bib.bib16),30 (https://arxiv.org/html/2607.09042#bib.bib15),9 (https://arxiv.org/html/2607.09042#bib.bib5),28 (https://arxiv.org/html/2607.09042#bib.bib6)]。一个互补的方向是在推理时进行操控:Wuet al. [26 (https://arxiv.org/html/2607.09042#bib.bib7)] 使用 VLM 从采样动作中选择与 VLA 原始文本指令最匹配的一个。我们的方法与这些方法不同,因为它是 1) 在线的,并且 2) 将重标记任务的信号融入权重中,而不是在测试时进行操控。 ## 3 预备知识 我们研究视觉-语言-动作(VLA)策略 [6 (https://arxiv.org/html/2607.09042#bib.bib23),11 (https://arxiv.org/html/2607.09042#bib.bib32)] 的 RL 微调。在每个回合开始时,环境采样一个指令 `g ∼ P_g` 和一个初始 RGB 观测 `o_0`。策略 `π_θ` 执行动作 `a_t ∼ π_θ(· | o_t, g)` 共 `T` 步,生成轨迹 `τ = (o_0, a_0, ..., a_{T-1}, o_T)`,该轨迹接收一个二值成功奖励 `R(τ, g)`,当 `τ` 完成 `g` 时为 1,否则为 0。目标是最大化期望成功 `J(θ) = E_{g ∼ P_g, τ ∼ π_θ(· | g)} [R(τ, g)]`。 我们使用组相对策略优化(GRPO)[24 (https://arxiv.org/html/2607.09042#bib.bib26)] 实例化 LfH。对于每个指令 `g`,GRPO 从 `π_θ_old` 中采样一组 `K` 条轨迹 `{τ_i}_{i=1}^K`,用 `R_i = R(τ_i, g)` 评分,并在组内归一化优势: ``` \hat{A}_i = (R_i - μ_R) / (σ_R + δ), μ_R = (1/K) ∑_{j=1}^K R_j, (1) ``` 其中 `σ_R` 是组标准差,`δ` 是一个小常数。使用重要性比率 `r_{i,t}(θ) = π_θ(a_{i,t} | o_{i,t}, g) / π_θ_old(a_{i,t} | o_{i,t}, g)` (2),以及相对于参考策略的 KL 惩罚 `D_{i,t}(θ)`,GRPO 最大化: ``` L_GRPO(θ) = E_{g, {τ_i}} [ (1/K) ∑_{i=1}^K ∑_{t=0}^{T-1} ℓ_{i,t}(θ) ], ℓ_{i,t} = min( r_{i,t} \hat{A}_i, \bar{r}_{i,t} \hat{A}_i ) - β D_{i,t}, (3) ``` 其中 `\bar{r}_{i,t} = clip(r_{i,t}, 1-ε, 1+ε)`。奖励方差 `σ_R` 为零的组不提供学习信号,被丢弃。 ## 4 方法:事后学习(LfH) 问题。当一组的所有轨迹获得相同奖励时,GRPO 组不提供学习信号。全为一的组 `{τ_i | R_i = 1}` 已经包含成功行为;瓶颈是全为零的组 `{τ_i | R_i = 0}`,它们在公式 (1) 中归一化优势为零,不贡献梯度。由于奖励依赖于轨迹 `τ` 和指令 `g`,弱的初始策略导致大多数 rollout 失败,留下许多全零组,微调进展缓慢。LfH 从这些本被丢弃的轨迹中恢复学习信号。 方法。在一个指令下失败的轨迹可能在另一个指令下成功。被命令“关闭微波炉”的机器人可能转而拿起一个杯子:这个 rollout 对 `g = "close the microwave"` 是失败的,但对手动指令 `g' = "pick up the mug"` 是成功的。LfH 用描述机器人实际完成情况的指令重标记失败的轨迹,将零奖励样本 `(τ, g)` 转化为成功示例 `(τ, g')`。事后指令 `g'` 不必来自 `P_g`:在低成功率的制度下,原指令下的失败不提供信号,而事后标记的成功提供信号。LfH 让策略在能够可靠地解决指令任务之前,先学习它已经能做什么。 还有两个问题:(1) 如何生成事后标记的数据(第 4.1 节),(2) 如何将其融入 GRPO(第 4.2 节)。 ### 4.1 来自事后经验的训练信号 对于每个指令 `g`,GRPO 采样一组 `{τ_i}_{i=1}^K` 并用 `R_i = R(τ_i, g)` 评分。LfH 仅在低信号组上激活,即平均奖励 `(1/K) ∑_i R_i < η` 的组;高奖励组已经在强化指令行为,重标记它们会用替代信号取代正确的训练信号。给定一个低奖励组,LfH 分两步将其转换为事后标记组。 指令重标记。我们推断一个替代提示,使得失败的 rollout 在该提示下仍然提供监督。由于机器人 rollout 可能缺乏特权对象状态或任务标注,VLM 重标记器 `M_ψ` 从可用的轨迹信息(如 RGB 观测和动作)中工作。LfH 从失败的轨迹中采样一个锚点 `i⋆ ∼ Unif({i : R_i = 0})`,因为成功的轨迹已经有了可靠的标签。然后 VLM 生成一个描述锚点行为的事后指令 `g'`: ``` g' ∼ M_ψ^inst(· | τ_{i⋆}). (4) ``` 并非每个失败都有用:一些轨迹仅包含偶然的运动。为了避免嘈杂的提示,我们首先让 VLM 分类锚点是否包含有意义的行为,并丢弃那些被标记为无趣的。 奖励重标记。LfH 然后在共享的事后指令 `g'` 下评估组中的每条轨迹: ``` \tilde{R}_i = M_ψ^rew(τ_i, g') ∈ {0, 0.5, 1}, (5) ``` 其中 1 表示完成 `g'`,0 表示失败,0.5 表示模糊结果。共享指令是必要的,因为 GRPO 相对于组内其他轨迹计算优势;用不同的提示重标记每条轨迹会使它们的奖励不可比较。 这产生了事后组 `\tilde{G} = {(τ_i, g', \tilde{R}_i)}_{i=1}^K`,GRPO 将其像普通 rollout 组一样使用,从 `{\tilde{R}_i}` 计算优势。
相似文章
后见之明经验回放
# 后见之明经验回放 来源:[https://openai.com/index/hindsight-experience-replay/](https://openai.com/index/hindsight-experience-replay/) ## 摘要 处理稀疏奖励是强化学习(RL)中最大的挑战之一。我们提出了一种名为后见之明经验回放的新颖技术,它允许从稀疏二元奖励中进行样本高效学习,因此避免了复杂的奖励工程设计的需要。它可以与任意组合
从仿真泛化
# 从仿真泛化 来源: [https://openai.com/index/generalizing-from-simulation/](https://openai.com/index/generalizing-from-simulation/) 仿真机器人的强化学习成果充斥市场,这可能会给人一种印象,即强化学习能轻松解决大多数机器人任务。但常见的强化学习算法只在那些对动作的小幅扰动能带来奖励增量变化的任务中表现良好。一些机器人任务具有简单的奖励函数,比如行走任务,可以根据行进距离来评分
机器人研究的关键要素
OpenAI 推出了Hindsight Experience Replay (HER),这是一种强化学习技术,使机器人能够通过将实现的替代结果追溯性地作为成功目标来从失败的尝试中学习,即使在奖励信号稀疏的情况下也能进行学习。
H^2SD:混合事后自我蒸馏
提出H^2SD,一种混合事后自我蒸馏框架,通过对成功和失败轨迹采用不同的教师模型使用方式,改善了RLVR,实现了更优的推理性能。
HINT-SD: 面向长程智能体的目标性事后自我蒸馏
HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。