SCOUT:面向稀疏奖励强化学习的每上下文重置课程
摘要
SCOUT 提出了面向稀疏奖励强化学习的每上下文重置课程,根据每个上下文的学习进度调整辅助移除,在导航和操作任务中优于全局节奏方法。
arXiv:2607.26417v1 公告类型:新
稀疏奖励强化学习常常失败,因为从无辅助评估起点开始的轨迹很少能到达后期任务阶段。重置课程通过从一些称为支架的较容易的中间状态开始部分训练轨迹来解决这一问题。此类课程面临两个决策:支架访问(获取信息性起点)和支架分配(决定辅助移除的速度)。大多数现有课程采用一个共享的时间表来移除辅助,当任务实例(即上下文)学习速度不同时,这种方法可能会失败。我们提出了 SCOUT,一种在线、与学习器无关的重置控制器,为每个上下文提供其自己的课程。仅使用二元轨迹成功信号,SCOUT 在持续成功后移除辅助,在失败后恢复辅助,并在进度停滞时谨慎测试更难的起点,而不改变奖励、优化器或学习器。一个计数构造表明,当上下文需要冲突量的辅助训练时,同步全局节奏可能不足。在六个导航和操作设置中,支架访问改善了学习,并在三个无辅助训练在报告预算内失败的场景中实现了成功。在一个构造的节奏冲突中,每个测试的全局调度都留下一个组未解决,而 SCOUT 解决了两个组。平均成功率可能掩盖这种失败,因此我们还报告了最不成功的组。当学习差异遵循已知组时,组级节奏有效,但当差异发生在一个组内时可能会失败。SCOUT 不需要组标签,并且在两种情况下都保持稳定强劲。重置课程应在学习进度出现差异的尺度上移除辅助。
查看缓存全文
缓存时间: 2026/07/30 09:58
# SCOUT:基于上下文重置课程的稀疏奖励强化学习
来源:https://arxiv.org/html/2607.26417
###### 摘要
稀疏奖励强化学习常常失败,因为从无辅助评估起点开始的轨迹很少能到达任务后期阶段。重置课程通过从较易的中间状态(称为脚手架)开始部分训练轨迹来解决这一问题。此类课程需要处理两个决策:*脚手架访问*(获取有信息量的起始点)和*脚手架分配*(决定如何快速移除该辅助)。大多数现有课程按照一个共享的全局计划移除辅助,当任务实例(即上下文)以不同速率学习时,这种方法可能失败。我们提出 SCOUT,一种在线、与学习器无关的重置控制器,它为每个上下文提供独立的课程。仅使用二值回合成败,SCOUT 在持续成功后移除辅助,在失败后恢复辅助,并在进展停滞时谨慎尝试更难的起始点,无需改变奖励、优化器或学习器。一个计数构造表明,当上下文需要冲突程度的辅助练习时,同步的全局调整可能不足。在六个导航和操作设置中,脚手架访问改善了学习,并在三个设置中实现了成功,而这些设置在报告预算内无辅助训练无法成功。在一个构造的调整冲突中,每个测试的全局计划都会留下一个组未解决,而 SCOUT 解决了两个组。平均成功率可能掩盖这种失败,因此我们还报告了最不成功的组。当学习差异遵循已知分组时,分组级别调整有效,但当差异发生在一个组内时,则可能失败。SCOUT 不需要组标签,并且在两种情况下都保持一致的强性能。重置课程应在学习进展出现差异的尺度上移除辅助。
## 引言
如果智能体几乎从未到达任务的后期阶段,它就无法学习这些阶段。仅对最终放置给予奖励,对于还无法在长时域任务(如拿起物体并放置在架子上)中抓取物体的策略来说,几乎无法提供指导。事后重新标记可以重用智能体访问过的状态,但无法为智能体从未到达的阶段创造经验 (Andrychowicz et al. 2017 (https://arxiv.org/html/2607.26417#bib.bib1))。相反,训练可以在支持状态恢复的模拟器中从任务中间开始。我们研究如何选择这些训练起点,以使智能体从用于评估的无辅助起点学习长时域、稀疏奖励任务。
我们将一个临时的、更易的训练起点称为*脚手架*。例如,一个已抓取物体的状态让智能体在能可靠执行前面的抓取之前练习放置。几个有序的脚手架形成一条从靠近成功的简单状态回到无辅助评估起点(即*目标起点*)的梯子。*重置课程*选择每个训练轨迹在这条梯子上的起点,并逐渐移除辅助 (Florensa et al. 2017 (https://arxiv.org/html/2607.26417#bib.bib10), 2018 (https://arxiv.org/html/2607.26417#bib.bib9))。我们将移除速率称为课程的*调整*。课程必须解决两个问题:*脚手架访问*(获取有用的中间起点)和*脚手架分配*(决定随着策略提升每个起点获得多少训练)。我们将每个任务实例(如物体-目标对)称为一个*上下文*。
先前的重置和起始状态课程主要研究了访问。基于演示的方法如 ACED 和 RFCL 也分别沿每条演示调整进度 (Dai, Hofmann, and Williams 2021 (https://arxiv.org/html/2607.26417#bib.bib4); Tao et al. 2024 (https://arxiv.org/html/2607.26417#bib.bib20)),但它们没有问哪些上下文应该共享一个调整。课程可以对所有上下文使用一个调整,每个任务组一个调整,或每个上下文一个调整;我们研究何时每种粒度是充分的。
在我们的操作设置中,桌面上的上下文很快受益于无辅助练习,而长距离空中的上下文则需要更多来自抓取起点的练习。过早移除辅助会放弃困难上下文;过晚移除则浪费了简单上下文上的训练。平均成功率可能隐藏这种失败,因为简单上下文主导了分数,因此我们也评估最不成功的组。一个计数构造表明失败是结构性的:一些上下文对无法通过任何同步的全局计划同时解决(命题 1 (https://arxiv.org/html/2607.26417#Thmproposition1))。课程调整*必须*在与学习进展差异相同的粒度上操作。
我们提出 SCOUT,一个重置控制器,为每个上下文单独做出此调整决策。SCOUT 为每个上下文维护一个*前沿*:其脚手架梯子的当前梯级。持续成功将前沿移向无辅助目标起点,失败则恢复辅助,并且当进展仍不确定时,控制器会谨慎尝试一个更难的梯级。SCOUT 仅观察每个回合是否成功,因此它适用于不同的 RL 算法,无需改变其奖励或优化器。
我们的实验将访问与分配分开。访问脚手架在六个导航和操作设置中改善了学习,并在三个目标起点训练无法在报告预算内成功的设置中实现了成功。当上下文以相似速率进展时,没有一种分配规则是普遍最优的;当进展出现差异时,分配才重要。SCOUT 在一个构造的操作冲突中对两个组都成功,而每个测试的全局计划在一个组上失败。在已知任务组内合并调整,当学习差异跟随这些组时有效,但当差异发生在一个组内时可能放弃困难上下文。SCOUT 不需要组标签,并且在两种情况下都保持一致的强性能。从每个上下文的一条成功参考轨迹构建的梯子,保留了手工建造脚手架的优点,同时减少了手动层级设计。
### 贡献
本文识别出重置课程是一个*粒度匹配的分配问题*:辅助应以学习进展出现差异的尺度进行调整。SCOUT 通过每个上下文独立的前沿(可以前进、后退或测试更难层级)实现了这一思想,并且不需要组标签。实验区分了脚手架访问的普遍好处和局部分配的狭窄好处。
参见图注图 1:SCOUT 控制每个上下文的脚手架前沿。行是上下文,列是仅训练的脚手架层级,其中 l=0\ell{=}0 是用于留出评估的目标起点。SCOUT 从活跃单元格 (x,fx)(x,f_x) 训练,并使用二值成败(前进、后退或谨慎的更难步骤)移动每个前沿。
## 相关工作
### 起始状态、重置和轨迹衍生课程
反向课程生成随着能力提升从目标向外扩展起点 (Florensa et al. 2017 (https://arxiv.org/html/2607.26417#bib.bib10))。GoalGAN 在学习者前沿附近采样目标 (Florensa et al. 2018 (https://arxiv.org/html/2607.26417#bib.bib9))。相关框架通过性能估计选择起始状态 (Wöhlke, Schmitt, and van Hoof 2020 (https://arxiv.org/html/2607.26417#bib.bib22)),沿演示追踪进度 (Duan et al. 2025 (https://arxiv.org/html/2607.26417#bib.bib7)),或扩展重置多样性以进行多阶段操作 (Yin et al. 2026 (https://arxiv.org/html/2607.26417#bib.bib24))。这些方法主要改进*访问*。这些方法在调整辅助时使用共享的全局计划或为每个演示单独调整。RFCL 是最接近的先前方法,它为每个演示维护一个独立调整的反向课程前沿 (Tao et al. 2024 (https://arxiv.org/html/2607.26417#bib.bib20))。ACED 沿每个演示推进重置段 (Dai, Hofmann, and Williams 2021 (https://arxiv.org/html/2607.26417#bib.bib4))。我们的重点反而是共享课程调整的单位,我们比较一个全局调整、每个任务组一个调整和每个上下文一个调整。SCOUT 通过通用任务上下文索引其前沿,沿有序的重置梯子移除辅助(该梯子不必表示轨迹时间),并可在失败后恢复辅助或在进展停滞时探测更难层级,使用二值成败而不需要模仿或奖励塑形。这些差异在粗粒度脚手架梯子上最为重要,因为两个前进规则的组件匹配版本由于无法后退而表现更差(结果)。我们的主要贡献是调整粒度问题及其评估。
### 任务分布、教师和程序化课程
课程学习最初被框架为从易到难排序示例 (Bengio et al. 2009 (https://arxiv.org/html/2607.26417#bib.bib2))。在 RL 中,自动课程和教师-学生方法通过学习进展、难度或遗憾选择任务 (Graves et al. 2017 (https://arxiv.org/html/2607.26417#bib.bib11); Matiisen et al. 2020 (https://arxiv.org/html/2607.26417#bib.bib15); Portelas et al. 2020 (https://arxiv.org/html/2607.26417#bib.bib19); Narvekar et al. 2020 (https://arxiv.org/html/2607.26417#bib.bib16))。自步 RL 将训练分布移向目标 (Klink et al. 2020 (https://arxiv.org/html/2607.26417#bib.bib14))。程序化方法如 Prioritized Level Replay、PAIRED 和 ACCEL 在学习能力前沿附近选择或生成关卡 (Jiang, Grefenstette, and Rocktäschel 2021 (https://arxiv.org/html/2607.26417#bib.bib13); Dennis et al. 2020 (https://arxiv.org/html/2607.26417#bib.bib5); Parker-Holder et al. 2022 (https://arxiv.org/html/2607.26417#bib.bib17))。DISCOVER 和 ACDC 为稀疏奖励目标到达和操作构建课程 (Diaz-Bone et al. 2025 (https://arxiv.org/html/2607.26417#bib.bib6); Wang et al. 2026 (https://arxiv.org/html/2607.26417#bib.bib21))。当直接在我们的*上下文库*上测试时,两个教师家族在*组级别*调整冲突中都难以处理困难组(结果)。
### 目标条件离策略学习和重新标记
我们的连续设置建立在 SAC 和 Hindsight Experience Replay 之上 (Haarnoja et al. 2018 (https://arxiv.org/html/2607.26417#bib.bib12); Andrychowicz et al. 2017 (https://arxiv.org/html/2607.26417#bib.bib1))。事后重新标记通过替换已到达的目标将失败的轨迹转换为有用的更新,但它只能使用策略访问过的状态。因此,脚手架和重新标记是互补的。脚手架改变了学习器体验的状态分布,而重新标记从这些状态中提取更多监督。SCOUT 控制前者,而让后者保持不变。
## 方法
### 问题设置
设 X\mathcal{X} 表示一个有限的训练上下文库,l∈{0,…,L}\ell\in\{0,\ldots,L\} 索引脚手架层级。重置算子 G(x,l)G(x,\ell) 将上下文 xx 和脚手架层级 \ell 映射到初始状态分布 ρ0x,l\rho_0^{x,\ell}。层级 l=0\ell=0 是用于评估的无辅助目标分布。更大的 \ell 是仅训练的起点,具有领域特定语义。
我们将每个对 (x,l)(x,l) 称为一个上下文-脚手架单元格。SCOUT 为每个上下文维护一个活跃前沿 fxf_x,初始化为最简单层级 LL。训练从活跃单元格 (x,fx)(x,f_x) 中抽取重置。评估总是使用 l=0\ell=0 时不相交的留出上下文(图 1 (https://arxiv.org/html/2607.26417#Sx1.F1))。
### 控制器要求
SCOUT 是一个在线重置分布控制器:它观察活跃单元格上的二值回合成败,并选择下一个训练重置的单元格。该接口不对优化器做任何假设。然而,由于策略随时间变化,控制器必须在非平稳训练下进行分配。因此设计是*证据感知*的:它仅在拥有足够近期证据时行动,且旧证据会衰减。它也是*转移导向*的:它将每个上下文移向用于评估的无辅助目标起点。
### 成败统计
SCOUT 为每个活跃单元格维护二进制回合成败的指数移动平均:sx,l←(1−β)sx,l+βrs_{x,\ell}\leftarrow(1-\beta)s_{x,\ell}+\beta r,其中 r∈{0,1}r\in\{0,1\}。它还维护一个证据计数、一个转换冷却、一个最近计数器 cx,lc_{x,\ell} 和一个陈旧计数器 dxd_x。陈旧计数器记录自前沿上次移动以来符合条件的控制器更新次数。SCOUT 仅在收集到足够证据并完成冷却后做出前沿决策。这防止了一次幸运成功或失败导致转换。
### 活跃单元格采样
每个控制器步骤通过仅成功的分数采样活跃单元格:
score(x)=λhsx,fx(1−sx,fx)+λpL−fxL+λstalelog(1+cx,fx),\begin{split}\mathrm{score}(x)\;=\;&\lambda_h\,s_{x,f_x}\,(1-s_{x,f_x})\;+\;\lambda_p\,\frac{L-f_x}{L}\\
&+\;\lambda_{\mathrm{stale}}\,\log\!\big(1+c_{x,f_x}\big),\end{split} (1)
第一项偏好处于中间胜任能力的单元格。第二项,转移导向项,轻微偏好较不依赖辅助的单元格。第三项增加最近未采样单元格的覆盖。这些分数定义一个 softmax 分布,带有均匀探索下限 ε\varepsilon 和每个单元格上限 qmaxq_{\max}。因此,一次短暂失败不会永久排除一个上下文。我们保持系数在所有设置和条件下固定。
### 前沿转换
每个上下文根据当前成功估计在满足证据和冷却条件后更新其前沿:
fx←{max(0,fx−1),sx,fx≥τhigh,min(L,fx+1),sx,fx≤τlow,max(0,fx−1),dx≥Nstale∧sx,fx>τlow,fx,otherwise.f_x\leftarrow\begin{cases}\max(0,f_x-1),&s_{x,f_x}\geq\tau_{\mathrm{high}},\\ \min(L,f_x+1),&s_{x,f_x}\leq\tau_{\mathrm{low}},\\ \max(0,f_x-1),&d_x\geq N_{\mathrm{stale}}\ \land\ s_{x,f_x}>\tau_{\mathrm{low}},\\ f_x,&\text{otherwise}.\end{cases} (2)
高成功移除辅助,低成功恢复辅助。第三种情况是*防停滞*转换。没有此转换的成功阈值控制器具有死区 (τlow,τhigh)(\tau_{\mathrm{low}},\tau_{\mathrm{high}})。处于该范围内的上下文既不够不成功以至于后退,也不够成功以推进,因此可能无限期停留。SCOUT 在 NstaleN_{\mathrm{stale}} 次合格更新无转换后采取一个更难步骤。如果此步骤为时过早,普通的失败转换会恢复辅助。因此防停滞鼓励谨慎进展而不妨碍恢复。算法 1 (https://arxiv.org/html/2607.26417#alg1) 给出了完整的控制器循环。
算法 1 SCOUT 课程控制器
1:输入:上下文库 X\mathcal{X},层级 {0,…,L}\{0,\dots,L\},重置算子 GG
2:阈值 τlow,τhigh\tau_{\mathrm{low}},\tau_{\mathrm{high}},陈旧限制 NstaleN_{\mathrm{stale}}
3:初始化 fx←Lf_x\leftarrow L,成功平均,证据计数,冷却,陈旧计数器
4:for 每个训练迭代 do
5: 从活跃单元格分布(式 1 (https://arxiv.org/html/2607.26417#Sx3.E1))中采样上下文 xx,带有探索下限
6: 从 G(x,fx)G(x,f_x) 重置环境;收集轨迹;更新学习器(SAC+HER / PPO)
7: 更新 (x,fx)(x,f_x) 的成功平均和证据
8: for 每个满足证据和冷却条件的上下文 do
9: 应用式 2 (https://arxiv.org/html/2607.26417#Sx3.E2) 的前沿转换
10: end for
11:end for
12:仅在留出上下文上评估相似文章
非平稳环境下的上下文强化学习综述
本综述探讨了非平稳环境下的上下文强化学习(ICRL),其中预训练决策模型通过累积的上下文进行适应,无需参数更新。它围绕变化的内容、变化的方式以及变化的可观测性来组织文献,并指出了诸如陈旧上下文压力测试和自适应遗忘等研究空白。
Shapley上下文剪枝:面向上下文重排序与剪枝的合作博弈视角
本文提出了Shapley上下文剪枝(SCP),一种用于RAG系统中上下文重排序和剪枝的合作博弈论框架。它采用Deep Sets架构和蒙特卡洛采样,高效地归因句子重要性,通过轻量级的3M参数价值网络实现了有竞争力的下游问答性能。
动态上下文调度:超越静态环境的学习
该论文提出动态上下文调度方法,旨在增强上下文强化学习的泛化能力,实验表明在模拟环境中在分布外和分布内区域均实现性能提升。
利用强化微调克服视觉连续学习中的灾难性遗忘
本文提出保留感知策略优化(RaPO),通过强化微调缓解视觉连续学习中的灾难性遗忘。RaPO采用轨迹级奖励塑形和跨任务优势归一化,缩小了类增量学习和域增量学习中强化微调与监督微调之间的差距。
超越奖励工程:长上下文强化学习的数据配方
本文表明,通过精心设计的长上下文强化学习数据配方,结合基于结果的最小GRPO,能够显著提升多个模型和基准测试的推理能力,并迁移到GAIA和BrowseComp等智能体任务。