@lateinteraction: 确实如此。但比GRPO更具可扩展性的强化学习范式的下一个突破已经到来:训练你的自教师……
摘要
介绍了教学强化学习(Pedagogical RL),这是一种新范式,模型学会利用特权信息主动采样成功且易于遵循的轨迹,从而成为自我教师,相比GRPO和同策略蒸馏方法,实现了高达40%的相对提升。
查看缓存全文
缓存时间: 2026/05/20 04:26
@nrehiew_ @DimitrisPapail 确实如此。但下一个比 GRPO 更具可扩展性的 RL 范式突破已经到来:
训练你的自教师成为一个有教学法的、温和的离策略采样器,用于 RL 的 rollout,这些 rollout 既要正确,又要每一步都易于遵循。
https://t.co/wriGo2OJ9t
教学强化学习:教模型从特权信息中自学
来源:https://noahziems.com/pedagogical-rl
Souradip Chakraborty*,1,2, Noah Ziems*,1,3, Furong Huang2, Meng Jiang3, Amrit Singh Bedi4, Omar Khattab1
1MIT 2UMD 3UND 4UCF *同等贡献
典型的强化学习和在策略蒸馏算法依赖于特权信息(如标注的最终答案或执行反馈)来评估 rollout,但实际上并未利用它们来找到好的 rollout。如果你的模型无法自行偶然发现成功的轨迹,RL 只会停滞不前。
在这篇文章中,我们提出一个问题:我们能否利用特权信息来主动采样 RL 算法仅通过计算量就希望偶然发现的那些 rollout? 换句话说,如何让 RL 中的采样变得更“幸运”?
我们描述了教学强化学习(pedagogical RL) 的早期实验,这是一种教模型自学的范式,旨在生成不仅正确,而且每一步对于其自身学习而言都是合理且有用的 rollout。具体来说,我们定义了一个尖峰感知教学奖励(spike-aware pedagogy reward),使用它来 RL 训练模型作为一个自教师,然后通过惊奇门控模仿(surprisal-gated imitation) 将教学指导同化到模型中。
我们在两个推理任务上评估了 LLM,并与 GRPO、在策略自蒸馏以及其他离策略自蒸馏方法进行了比较。我们发现教学 RL 学习速度更快,并且相对性能提升高达 40%。我们分享这些早期结果,旨在鼓励学界考虑超越纯粹在策略学习的目标编辑范式,我们认为后者正成为瓶颈。
TL;DR — 在策略 RL 盲目地搜索成功,而教学 RL 教会自己变得“幸运”,即它学会了高效采样那些既合理又成功、且可供自身学习的轨迹。
1. 纯粹的在策略算法是盲目采样的
我们研究可验证的 RL 问题,其中每个提示 x 都附带特权上下文 c,例如最终答案或执行反馈。我们的目标是学习一个策略,给定 x,生成一个轨迹 \\tau = (\\tau_1,\\ldots,\\tau_T,y),其中可能包含推理标记、工具调用和最终预测 y,使得奖励 R(x,c,\\tau) 的期望值最大化。例如,当 c 是正确答案时,R 可能是一个验证答案正确性的验证器:R(x,c,\\tau) = \\mathbb{I}[y = c]。
RL 的一个关键挑战是我们没有预先给定的“理想”轨迹供学习。相反,我们必须自己采样它们。像 GRPO 这样的在策略 RL 方法用模型本身采样轨迹 \\tau \\sim \\pi_\\theta(\\cdot \\mid x),观察奖励,然后放大它偶然发现的成功动作。类似地,最近的一波在策略蒸馏方法(https://thinkingmachines.ai/blog/on-policy-distillation/)(https://arxiv.org/abs/2601.18734)(https://arxiv.org/abs/2601.19897)(https://arxiv.org/abs/2306.13649)以相同的盲目方式采样,但随后利用基于特权信息 (x, c) 的自教师来创建更密集的 token 级别训练信号。
这里的一个奇怪的低效之处在于:即使这些算法持有信息 c,它本应严格限制成功的样子,但采样器仍然像盲人一样探索。但我们首先是否有值得学习的轨迹呢?
2. 理想的采样器:最近的成功轨迹
我们可能希望从中采样的一个分布是条件于成功的策略:q_\\theta^\\star(\\tau \\mid x,c) \\propto \\pi_\\theta(\\tau \\mid x)R(x,c,\\tau)。
这个学生策略的最近的成功轨迹分布包含那些在 R(x,c,\\tau)(或 R(x,c, y))下既正确,又可学习的响应。也就是说,这些响应最接近学生在更大计算量限制下的在策略 RL 中可能生成的内容。
我们能否利用特权信息来主动采样 RL 算法仅通过计算量就希望偶然发现的这些 rollout?有几种近似最近成功轨迹采样的自然方式。
1. 拒绝采样:我们可以简单地从学生 \pi_\\theta 中采样更多。这在 pass@K 对于可负担的 K 已经不错的情况下可能有效。
2. 特权教师采样:我们可以从一个特权自教师中采样,即学生自己拥有特权上下文时的版本:\\tau \\sim \\pi_{\\theta}(\\cdot \\mid x,c)。
这增加了正确性的机会,但很可能通过捷径“作弊”,因为教师看到了 c。换句话说,我们冒的风险是:采样到的大多数轨迹满足 R(x,c,\\tau)=1,但学生极不可能产生它们,因此不可教学,即 \\pi_\\theta(\\tau \\mid x)\\ll 1。
3. 乘积采样:一种合理的近似最近成功轨迹的方法是在解码时混合学生和特权教师:
\[q_{\mathrm{mix}}(\tau_t \mid \tau_{<t},x,c) \propto \pi_\theta(\tau_t \mid \tau_{<t},x)^\delta \pi_{\theta}(\tau_t \mid \tau_{<t},x,c)^{1-\delta}.\]
本质上,这是教师推动正确性的 token 与学生拉向合理性的 token 的软交集。然而,它只是一个贪婪的手工设计的 token 级别近似,因此可能短视地忽略全局有用的轨迹,而只追求局部交集。
与其只是投入更多计算或手工设计采样器,我们现在定义教学 RL,这是一种更具可扩展性且更符合“苦涩教训”的范式:教模型去近似自身最近成功轨迹的分布。
3. 教学 RL 教模型从特权信息中自学
特权上下文 c 给模型提供了目的地,但它仍然需要推导出在没有 c 的情况下高度可解释于 \\pi_{\\theta}(\\tau \\mid x) 的轨迹 \\tau。我们如何做到这一点?
我们观察到,这不过是一个可验证的 RL 问题。因为我们可以访问 c,实际上我们可以定义一个密集的奖励信号来训练我们的自教师 \\pi_{\\theta}(\\tau \\mid x,c),使其采样出的轨迹既正确,又每一步都对当前学生可理解,因此可学习。
如果我们能够成功定义一个可学习性得分 G_\\theta(\\tau \\mid x) 来衡量 \\tau 对当前学生的合理程度,那么我们可以定义一个教学奖励为乘积 R(x,c,\\tau) G_\\theta(\\tau \\mid x),只有当 \\tau 高度可学习并且得到正确答案时,才会分配较大的奖励。
要定义 G_\\theta(\\tau \\mid x),最简单的起点之一是平均学生 token 级别惊奇度 s_t=-\\log \\pi_\\theta(\\tau_t \\mid x,\\tau_{<t})。不幸的是,一个响应可能具有较低的平均 NLL,同时却围绕一个荒谬的跳跃或捷径展开,而这些永远无法被学习。在自回归层面,即使一个不可信的 token 也可能使整个后缀变得不可达。
A. 教学 RL 需要尖峰感知奖励
我们定义一个尖峰感知的可学习性得分 G_{\\mathrm{spike}}(\\tau \\mid x),以不成比例地惩罚令人震惊的跳跃,相比于学生在该状态下更可能采取的动作。设 a_t^{\\max}=\\arg\\max_a \\pi_\\theta(a\\mid x,\\tau_{<t}) 是学生在相同前缀下最可能的下一个 token,并定义惊奇差距 d_t=\\log \\frac{\\pi_\\theta(a_t^{\\max}\\mid x,\\tau_{<t})}{\\pi_\\theta(\\tau_t\\mid x,\\tau_{<t})}。那么
\[G_{\mathrm{spike}}(\tau \mid x)= \exp\left[ -\frac{\lambda}{\beta}\log \left(\frac{1}{T}\sum_{t=1}^{T}\exp(\beta d_t)\right) \right].\]
当 \\beta \\to \\infty 时,G_{\\mathrm{spike}} 内部的惩罚趋近于最大 token 级别惊奇差距。当 \\beta \\to 0 时,趋近于平均惊奇差距。这使我们能够惩罚尖锐的、没有支持的跳跃,同时不忽略响应的整体难度。
下面的简单迷宫说明了这一点。一道垂直的墙将迷宫分成两部分,在第 4 行有一个隐藏的门,学生没有能力看到它。作弊教师利用隐藏门,产生最短路径(长度 14),但经过了一个学生分配极小概率 \\pi_\\theta \\approx e^{-8.1} 的格子。而教学教师与我们的奖励一致,将门视为锁着,采取更长但完全可达的路线(长度 22),确保每一步都在学生支持范围内。在策略 RL 盲目均匀地探索,达到较低的 \\text{pass}@1 \\approx 0.05。
(此处应有图片)
我们为每条轨迹计算 token 级别惊奇差距 d_t,并评估三个指标:平均 NLL、最大惊奇差距以及 G_{\\text{spike}} 内部在 \\beta=5 时的未指数化尖峰惩罚。结果显示,平均 NLL(1.03 vs 0.49)掩盖了作弊轨迹中单个灾难性步骤的严重性。尖峰惩罚(7.57 vs 0.63)正确地将其识别为几乎不可学习,尽管它奖励完美且路径更短。
**教学自教师训练步骤:**这个例子说明了为什么教学奖励很重要。我们现在使用这个奖励来训练教学自教师。
具体来说,我们创建基础模型的两个副本:一个教学自教师 \\pi_{\\theta_T}(\\tau \\mid x,c),它可以访问特权上下文 c;以及一个学生 \\pi_{\\theta_S}(\\tau \\mid x),它没有。教师的作用不仅是解决问题,而且要以一种对学生仍然可学习的方式来解决。
我们使用标准的 GRPO 训练教学自教师,优化信号是教学奖励。
\[\max_{\theta_T} \mathbb{E}{\tau \sim \pi{\theta_T}(\cdot \mid x,c)} \left[ r_{\mathrm{ped}}(x,c,\tau) \right].\]
其中 r_{\\mathrm{ped}}(x,c,\\tau) = R(x,c,\\tau)G_{\\mathrm{spike}}^{\\theta_S}(\\tau \\mid x)。
这里,R(x,c,\\tau) 衡量轨迹是否利用特权上下文成功,而 G_{\\mathrm{spike}}^{\\theta_S}(\\tau \\mid x) 衡量同一条轨迹在当前学生下的合理程度。在此教师训练步骤中,学生 \\pi_{\\theta_S} 保持固定,仅用于对教师 rollout 的可学习性进行评分。GRPO 训练步骤后,我们将训练过的教学教师 \\pi_{\\theta_T^*}(\\tau \\mid x,c) 记为 \\tilde{\\pi}_T,以便符号简洁。
B. 教学 RL 需要惊奇门控知识同化
在教学步骤之后,学生在教师生成的轨迹上训练。然而,即使是一个教学教师,也可能产生在当前学生下太不可能的 token。为了防止这些 token 主导更新,我们根据每个教师 token 的学生似然性降低其梯度权重,同时让易于同化的 token 保持全权重。
\[\mathcal{L}{\mathrm{assim}}(\theta_S)=\mathbb{E}{y\sim \tilde{\pi}T}\left[ \frac{1}{\sum{t=1}^{T} w_t} \sum_{t=1}^{T} w_t\,\ell_t(\theta_S) \right],\]
其中 \\ell_t(\\theta_S) =-\\log \\pi_{\\theta_S}(\\tau_t \\mid x,\\tau_{<t}) 是学生在教学教师生成的轨迹上的标准 token 级别模仿损失,而 w_t =\\sigma\\!\\left( \\kappa\\left( \\log \\pi_{\\theta{S}}(\\tau_t \\mid x,\\tau_{<t})- \\gamma \\right) \\right)。这里,w_t 在学生已经对教师 token 赋予合理概率时接近 1,在 token 高度惊奇时接近 0。
在实践中,我们迭代地应用这个同化步骤。我们首先从训练过的教学教师中采样一批轨迹,然后使用上述惊奇门控模仿损失更新学生 \\pi_{\\theta_S}(\\tau \\mid x)。在学生改进后,我们再次从 \\tilde{\\pi}_T 中采样另一批轨迹并训练学生,根据更新后的学生重新计算权重 w_t。
步骤 A 和 B 一起可以被视为模型自身高效地自我引导出轻度离策略的中间训练轨迹。
C. 我们的教学 RL 整体实例化
总体而言,完整的范式是:
- 我们训练一个特权自教师 \\pi_{\\theta_T}(\\tau \\mid x,c),使用标准 GRPO 最大化我们的尖峰感知教学奖励 R(x,c,\\tau) G_{\\text{spike}}(\\tau \\mid x),但这是一个更简单的 RL 问题,具有更密集的学习信号。
- 我们使用来自 \\mathcal{L}_{\\mathrm{assim}}(\\theta_S) 的惊奇门控模仿目标,将这个知识同化到模型 \\pi_{\\theta_S}(\\tau \\mid x) 中。
- 可选:一旦我们引导出一个合格的学生 \\pi_{\\theta_S}(\\tau \\mid x),我们可以继续使用标准 GRPO 优化它,以最大化任务奖励 R(x,c,\\tau)。
现在,我们描述这个教学 RL 范式的两组早期实验,以了解它与标准策略梯度 RL(以 GRPO 代表)、最新的在策略自蒸馏方法以及其它离策略自蒸馏方法的对比。
4. 实验 I:从 MATH 难题子集泛化
在这个实验中,我们旨在选择一个简单且能力导向的 RL 环境,其中奖励稀疏。为此,我们从 Hendrycks MATH 任务(https://arxiv.org/abs/2103.03874)中推导出一个困难的训练子集,并评估几种隔离使用特权信息方式的算法。
为此,我们刻意考察一个微小的通用型 Llama-3.2-3B 模型是否能够自学出可泛化的数学能力,尽管它在数学上的 RL 远比例如经过数学强激励中训练的现代 Qwen 模型困难。我们的困难训练子集使得基础模型的 pass@1 仅为 8% 左右。我们在 MATH 问题的标准分布上进行评估,该基准的 pass@1 为 38%,同时我们还评估了向更具挑战性的 AIME 2020–2024 数据集的域外泛化能力。下图 2 展示了在不同方法利用更多学生训练 rollout 时,对 500 个保留的 MATH 提示的评估性能。
(此处应有截图:Screenshot 2026-05-14 at 1.32.36 PM)
在该图中,基础模型实现了 38% 的 pass@1。GRPO 和在策略自蒸馏(OPSD)受限于在策略采样,因为在困难切片上训练期间,大多数 rollout 获得零奖励。直接的离策略基线通过对未训练特权教师 \\pi_\\theta(\\cdot \\mid x,c) 产生的样本进行 SFT 来学习。它效果不佳,因为其教师常常产生“正确”但远离当前学生分布的轨迹,例如由于捷径。
(此处应有截图:Screenshot 2026-05-14 at 2.13.28 PM)
上图 3 报告了每种方法在 MATH 以及更困难的 AIME 2020–2024 基准上的最终评估分数,这使我们能够衡量学习到的行为是否泛化到训练分布之外。在 MATH 领域,教学 RL 以 12% 的相对提升优于所有基线。
相似文章
@SOURADIPCHAKR18:我们描述了关于*教学RL*的早期实验:一种苦教训式的*训练*特权自我教师…
介绍了教学RL,一种范式,其中训练特权自我教师以生成正确且易于遵循的轨迹,表明这是一个相对简单的RL问题。
@lateinteraction: 你可能错过了:阅读关于Pedagogical RL的博客,与其盲目地从你的LLM中采样,不如利用用于RLVR的标签!学习…
介绍了Pedagogical RL,一种利用特权信息指导成功轨迹采样以增强LLM推理的方法,相比GRPO和在线策略蒸馏,实现了高达40%的相对增益。
@blc_16: MIT 刚刚发布了一种名为 Pedagogical RL 的新强化学习方法。主要教训 -> 正确的推理轨迹仍然可能是糟糕的训练数据...
MIT 引入了 Pedagogical RL,该方法通过惩罚令人意外的步骤来训练一个教师模型,使其为学生模型生成易于学习的轨迹,从而提高强化学习的训练效率。
@rronak_: MIT的Omar Khattab实验室再次取得突破! Pedagogical RL - 如今,RL依赖于纯熵来采样新轨迹。……
MIT研究人员提出了一种名为Pedagogical RL的新强化学习方法,该方法利用具有特权信息的教师模型和尖峰感知可学习性奖励,显著提高了样本效率和收敛速度,优于GRPO和OPSD等现有方法。
@NoahZiems: 我们最近关于Pedagogical RL的工作发表了!
一篇关于Pedagogical RL的研究论文的公告,该论文提出利用特权信息主动采样强化学习算法通常忽略的轨迹。