基于同伴成功与失败的多 rollout 在策略蒸馏

arXiv cs.LG 论文

摘要

提出多 rollout 在策略蒸馏 (MOPD),一种将教师条件化于同伴成功和失败的 rollout 以提供更密集的 token 级监督进行语言模型后训练的方法,在多个基准上提升了性能。

arXiv:2605.12652v1 公告类型:新摘要 大型语言模型通常使用稀疏验证器奖励进行后训练,这种奖励指示采样轨迹是否成功,但对推理成功或失败的位置提供的指导有限。在策略蒸馏 (OPD) 通过训练学生生成的轨迹提供更密集的 token 级监督,但现有方法通常独立蒸馏每个 rollout,忽略同一提示的其它尝试。我们引入多 rollout 在策略蒸馏 (MOPD),一种基于同伴条件的蒸馏框架,利用学生的局部 rollout 组构建信息更丰富的教师信号。MOPD 将教师条件化于同伴的成功和失败 rollout:成功提供有效推理模式的正向证据,而失败提供关于应避免的合理错误的结构化负向证据。我们研究两种同伴上下文构建:正向同伴模仿和对比性成功-失败条件化。在竞争性编程、数学推理、科学问答和工具使用基准上的实验表明,MOPD 持续优于标准的在策略基线。进一步的教师信号分析显示,混合成功-失败上下文能使教师分数更紧密地与验证器奖励对齐,表明性能提升源于更忠实、实例自适应的监督。这些结果表明,有效的在策略蒸馏应利用学生的多 rollout 试错行为,而非将 rollout 视为孤立的样本。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:17

# 多轨迹在线策略蒸馏:基于同伴成功与失败的经验

来源:https://arxiv.org/html/2605.12652

吴伟辰¹²,李晓敏²,赵逸舟¹,刘啸泽³,张若望³,王海欣²,罗毅一¹,吴晨亨利¹,Gaurav Mittal²,Matt Fredrikson¹,胡宇²

¹卡内基梅隆大学 ²微软 ³普渡大学 wyu3@andrew\.cmu\.edu

###### 摘要

大型语言模型通常借助稀疏验证器奖励进行后训练,这些奖励指示采样轨迹是否成功,但对推理在何处成功或失败提供的指导有限。在线策略蒸馏(OPD)通过训练学生模型生成的轨迹提供更密集的令牌级监督,然而现有方法通常独立处理每次采样轨迹,忽略同一提示下采样的其他尝试。我们提出多轨迹在线策略蒸馏(MOPD),一种基于同伴条件的蒸馏框架,利用学生模型的本地采样组构建更具信息量的教师信号。MOPD 使教师模型同时关注成功和失败的同伴轨迹:成功轨迹提供有效推理模式的正面证据,而失败轨迹提供关于应避免的合理错误的结构化负面证据。我们研究了两种同伴上下文构建策略:正面同伴模仿和对比性成功-失败条件化。在竞争编程、数学推理、科学问答和工具使用基准上的实验表明,MOPD 始终优于标准在线策略基线。进一步的教师信号分析表明,混合成功-失败上下文能更好地使教师分数与验证器奖励对齐,表明性能提升源于更忠实、实例自适应的监督。这些结果表明,有效的在线策略蒸馏应利用学生模型的多轨迹试错行为,而非将各轨迹视为孤立样本。代码发布于https://github.com/viviable/mopd_code。

## 1 引言

大型语言模型(LLMs)通常通过基于可验证奖励的强化学习进行后训练,其中采样的解决方案由答案检查器、单元测试或任务特定验证器评分(Guo 等,2025;Schulman 等,2017;Shao 等,2024)。尽管有效,但这些奖励通常是稀疏的:它们指示整个轨迹成功或失败,但对哪些令牌或推理步骤导致结果几乎没有指导(Yue 等,2025;Chan 等,2024)。蒸馏和自蒸馏通过将教师或特权模型的判断转换为密集令牌级信号提供了互补的监督形式(Zelikman 等,2022;Gulcehre 等,2023;Singh 等,2024;Chen 等,2024;Yang 等,2024)。在线策略蒸馏通过训练学生策略自身采样的轨迹,进一步使这种监督与学生自身行为对齐(Agarwal 等,2024;Gu 等,2024;Ko 等,2024)。尽管有这一优势,现有的 OPD 和在线策略自蒸馏方法未能充分利用训练过程中已可获取的关键信息源:为同一问题实例生成的多条采样轨迹。在许多流程中,每条轨迹被独立蒸馏,因此一条轨迹的教师信号在不访问同一学生采样的其他尝试的情况下计算。这种设计丢弃了采样组的本地结构。对于需要推理密集的任务,这种本地结构信息量丰富:成功轨迹揭示有效的解决策略,而失败轨迹暴露看似合理但错误的推理路径、缺失的约束、格式错误或执行错误。将轨迹独立处理使得教师无法比较这些备选方案,也无法识别不成功轨迹在何处偏离了成功轨迹。

我们提出多轨迹在线策略蒸馏(MOPD),一种基于同伴条件的蒸馏框架,明确利用学生模型的采样组来构建教师信号。对于每个提示,学生模型采样多条在线策略轨迹,这些轨迹由验证器评分并分为成功集和失败集。MOPD 在监督目标轨迹时,使教师模型关注同一问题实例的同伴轨迹。在这种公式中,成功轨迹充当同伴专家,提供有效推理模式的正面证据;而失败轨迹作为结构化负面证据,识别学生应避免的误导性解决路径。关键洞察在于:多轨迹采样为每个问题创建了一个局部的试错空间。教师不是孤立地看待每条轨迹,而是可以将当前轨迹与同伴的成功和失败进行比较,利用这种对比产生更具针对性的监督。这使 OPD 从独立的单条轨迹模仿转变为比较学习过程:教师不再仅仅是全局专家,同时也是一个能识别实例特定错误、区分表面合理失败与正确解决方案的本地诊断模型。

我们通过两种同伴上下文构建策略实例化这一思想:正面同伴模仿和对比性成功-失败条件化。此外,先前方法通常假设,一旦自我教师通过特权信息(如真实结果、已验证的成功答案、提示或环境反馈)进行条件化,它就成为可靠的监督源。然而,这种假设通常仅通过下游训练性能间接评估。此外,直接询问特权教师能否恢复正确答案并不是可靠的诊断:如果特权上下文已包含答案相关信息或验证器反馈,自我教师可能通过利用捷径(而非在学生自身轨迹上产生忠实监督信号)而显得准确。对于自蒸馏而言,关键不在于自我教师是否知道答案,而在于其令牌级或轨迹级偏好是否与学生实际生成的轨迹的正确性对齐。

请参阅图注 图1:MOPD 图示。

为了直接检验同伴条件化是否改善了自我教师信号本身,我们引入了自我教师信号质量分析。对于每个提示,我们固定一组学生生成的轨迹(包含成功和失败尝试),仅改变向自我教师展示的上下文,并将自我教师的归一化对数几率或分数与真实验证器奖励进行比较。更好的自我教师信号应将成功轨迹排在失败轨迹之上,与奖励相关性更强,并能更好地区分正确和错误候选。该分析避免了答案恢复测试的混淆,直接衡量特权上下文是否产生与实际正确性对齐的监督。

实验上,在竞争编程、数学推理、科学问答和工具使用基准上,MOPD 在大多数场景下优于标准在线策略基线。最大的性能提升来自结合成功和失败轨迹的混合同伴上下文,支持了来自同伴轨迹的对比证据比仅正面示范更有用的假设。我们的自我教师信号分析进一步表明,两个成功加一个失败的上下文在排序和区分指标上与验证器奖励的对齐最强,而消融实验显示同样的上下文在下游性能上最佳。这些结果表明,有效的蒸馏应利用学生模型的多轨迹试错行为,而不仅仅是教师模型的强度。

## 2 相关工作

#### 在线策略蒸馏

知识蒸馏将教师模型的预测分布转移到较小的学生模型,但离线策略训练导致分布不匹配:学生在推理时从未见的状态上进行监督(Hinton 等,2015;Kim 和 Rush,2016;Ross 等,2011)。在线策略蒸馏通过从学生自身策略采样轨迹并在这些轨迹上计算教师监督来解决这一问题(Agarwal 等,2024;Gu 等,2024;Ko 等,2024)。在此框架内,工作集中于散度目标、令牌重加权以及在线和离线策略模式之间的插值(Wen 等,2023;Huang 等,2025;Zhang 等,2026a;Jin 等,2026)。另一并行方向用自蒸馏取代外部教师:模型的一个副本基于特权上下文(解决方案、提示或环境反馈)进行条件化,并监督缺少该上下文的第二个副本(Hübotter 等,2026;Ye 等,2026;Zhao 等,2026b;Penaloza 等,2026;Yang 等,2026)。信息还可以通过一致性、投票或委员会教师在多个采样解上聚合(Wang 等,2023;Muennighoff 等,2025;Li 等,2025b)。然而,每条轨迹的教师信号独立构建,未利用采样组内的跨轨迹结构。

#### 多轨迹强化学习与验证器引导改进

基于可验证奖励的后训练用程序化检查器替代学习到的奖励模型,并通过在每组提示上对多个采样轨迹计算的组相对优势来更新策略(Shao 等,2024;Wen 等,2026;Ouyang 等,2022;Rafailov 等,2023)。过程奖励模型通过为中间推理步骤打分提供更密集的信用分配(Cobbe 等,2021;Setlur 等,2025;Zhang 等,2025c),混合管道将这些信号与在线策略蒸馏结合(Xu 等,2025b;a;Zhang 等,2026b)。虽然这些方法通过优势归一化或拒绝采样利用每个提示的多个轨迹,但任何单个轨迹的监督信号计算时并不以其他轨迹的内容为条件。与我们工作最相邻的方法将成功和失败视为优势或筛选器级别的互补证据,但没有将两者汇入单个同伴条件化的蒸馏目标。两个主题的扩展相关工作见附录 F。

## 3 预备知识

我们研究在在线策略采样机制下将推理能力从教师模型蒸馏到学生模型的问题。设 \(x\in\mathcal{X}\) 表示输入问题或提示,\(y=(y_1,\ldots,y_T)\) 表示由学生策略 \(\pi_\theta\) 自回归生成的输出轨迹。在解码步骤 \(t\),我们将前缀记为 \(y_{<t}=(y_1,\ldots,y_{t-1})\)。设 \(r(y)\in\{0,1\}\) 为由外部验证器(如代码的单元测试或数学问题的答案检查器)提供的二进制奖励,指示轨迹 \(y\) 是否正确。我们考虑这样的场景:对于每个提示 \(x\),学生模型采样 \(K\) 条轨迹 \(y^{(1)},\ldots,y^{(K)}\)。每条轨迹由其奖励 \(r_k=r(y^{(k)})\) 评分。我们将这些轨迹分为成功集 \(S=\{k:r_k=1\}\) 和失败集 \(F=\{k:r_k=0\}\)。

在标准在线策略蒸馏中,教师模型 \(p\) 计算每个学生轨迹 \(y\) 的令牌级目标,而学生通过最小化某种散度(例如反向 KL 散度)来学习。形式上,我们通过最小化以下损失来更新学生策略:

\[
\mathcal{L}_{\text{OPD}}(\theta) = \mathbb{E}_{x\sim\mathcal{D}}\,\mathbb{E}_{y\sim\pi_\theta(\cdot|x)}\left[\sum_{t=1}^{T} D_{\text{KL}}\big(p(\cdot|y_{<t},x)\,\big\|\,\pi_\theta(\cdot|y_{<t},x)\big)\right].
\]

在实践中,教师可以是外部大模型,也可以是同一模型的另一个副本,该副本通过特权信息进行条件化(例如真实答案、环境反馈或验证器结果)。在标准公式中,对于不同学生轨迹的教师计算是独立的:教师仅基于当前轨迹 \(y\) 和(可能)特权上下文产生信号,而不参见问题 \(x\) 的其他采样轨迹。

#### 同伴条件化蒸馏

我们引入同伴条件化蒸馏,其中教师信号不仅依赖于目标轨迹和特权上下文,还依赖于同一提示 \(x\) 采样的其他轨迹(即同伴)。设 \(C\) 为同伴轨迹集,通常包含来自 \(S\) 和 \(F\) 的选择。我们将同伴条件化教师记为 \(p(\cdot|y_{<t},x,C)\)。然后我们通过最小化以下损失来更新学生策略:

\[
\mathcal{L}_{\text{MOPD}}(\theta) = \mathbb{E}_{x\sim\mathcal{D}}\,\mathbb{E}_{y^{(k)}\sim\pi_\theta(\cdot|x)}\left[\sum_{t=1}^{T} D_{\text{KL}}\big(p(\cdot|y^{(k)}_{<t},x,C)\,\big\|\,\pi_\theta(\cdot|y^{(k)}_{<t},x)\big)\right],
\]

其中 \(C\) 在训练时依赖于 \(x\) 和其他学生轨迹。实际上,\(C\) 可以从当前批次内的所有学生轨迹构建,或通过先前采样的缓冲区构建。在本文中,我们考虑同一提示 \(x\) 的 \(K\) 条学生轨迹集,并使用成功轨迹、失败轨迹或两者的组合作为同伴集 \(C\)。

## 4 方法

在本节中,我们描述 MOPD 框架,包括其同伴选择策略以及同伴上下文如何被教师使用。我们保持标准在线策略蒸馏(OPD)初始设置(第3节),因此这里重点介绍同伴构建和教师信号公式化。我们考虑教师模型 \(p\),它可以是外部模型或同一模型的特权版本。同伴上下文 \(C\) 由给定提示 \(x\) 下学生模型采样的轨迹组成。

#### 成功集 \(S\) 和失败集 \(F\)

对于提示 \(x\),学生模型采样 \(K\) 条轨迹。每一条由验证器评分以产生二进制奖励 \(r_k\)。成功集 \(S=\{k:r_k=1\}\);失败集 \(F=\{k:r_k=0\}\)。如果 \(|S|<1\) 或 \(|F|<1\),我们可能回退到无同伴上下文的基线。

#### 同伴构建策略

我们提出两种构建同伴上下文 \(C\) 的策略:

- **正面同伴模仿(Pos)**:对于目标轨迹 \(y^{(k)}\),我们设置 \(C=\{y^{(j)}:j\in S\setminus\{k\}\}\),即所有可用的成功同伴轨迹(排除目标自身)。这为教师提供了多条正确推导的示例,使学生学习到正确的推理模式。
- **对比性成功-失败条件化(Con)**:我们设置 \(C=\{y^{(j_{s1})},y^{(j_{s2})},y^{(j_{f})}\}\),其中 \(j_{s1},j_{s2}\) 是从成功集中选择的两个成功轨迹(如果可用),\(j_f\) 是从失败集中选择的一个失败轨迹。这为教师提供了正面和负面证据,使其能够对比成功和失败案例。

#### 同伴上下文在教师中的使用

给定目标轨迹 \(y^{(k)}\) 和同伴集 \(C\),教师产生令牌级目标分布。在实践中,我们将同伴轨迹以序列格式连接到提示 \(x\) 和特权信息中。具体而言,我们构造一个序列:

\[
\text{context} = [x; \text{privilege}; \text{peer\_1}; \text{peer\_2}; \ldots; \text{peer\_m}]
\]

其中每个同伴轨迹以其奖励标签(成功/失败)为前缀,以指示其状态。然后教师以自回归方式在上下文上运行,生成目标轨迹 \(y^{(k)}\) 的令牌级分布。同伴的顺序可以固定或随机洗牌。我们的默认设置是随机洗牌以鼓励鲁棒性。

然后使用标准反向 KL 散度更新学生策略,如第3节所述。

#### 自我教师信号质量分析

为了直接评估同伴条件化对教师信号质量的影响,我们设计了一种离线度量:对于固定的学生轨迹集(包含成功和失败),我们仅改变同伴上下文,并计算教师分数与验证器奖励之间的一致性。具体而言,对于每个提示 \(x\),我们有一组学生轨迹 \(y^{(1)},\ldots,y^{(K)}\),其奖励已知。对于每个轨迹,我们计算教师 \(p\) 下的归一化对数几率或分数 \(s_i\)(例如,整个轨迹的平均对数似然,或最后令牌的 logit)。然后,我们计算教师分数向量 \(s=(s_1,\ldots,s_K)\) 与二进制奖励向量 \(r=(r_1,\ldots,r_K)\) 之间的斯皮尔曼等级相关。我们将其报告为教师信号质量度量。更好的教师信号应产生更高的斯皮尔曼相关,表明教师分数与正确性更好地对齐。

在实验中,我们使用第3节中定义的指标:斯皮尔曼相关、肯德尔 tau、配对精度、AUC、点双列相关和布里尔分数。

## 实验

### 设置

我们评估 MOPD 在四个基准上的效果:Competition Programming (APPS)、Mathematical Reasoning (MATH)、Scientific QA (SciQ) 和 Tool-Use (ToolBench)。对于每个基准,我们使用 GPT-2 基础模型(~1.5B 参数)作为学生,使用 GPT-3.5-turbo 作为教师。所有实验在 8×A100 GPU 上进行。超参数在附录中报告。我们与标准 OPD(无同伴)以及使用单条成功或失败轨迹作为同伴的变体进行比较。主要结果见表1。

### 结果

**表1:下游准确性(%)对比。对每个基准报告测试集准确率。粗体表示最佳。MOPD (Con) 使用 2 成功 + 1 失败同伴。**

| 方法 | APPS | MATH | SciQ | ToolBench |
|------|------|------|------|-----------|
| 标准 OPD | 32.1 | 27.5 | 68.3 | 55.4 |
| OPD + 单成功同伴 | 33.0 | 28.1 | 69.1 | 56.0 |
| OPD + 单失败同伴 | 31.8 | 26.9 | 67.5 | 54.8 |
| MOPD (Pos) | 33.5 | 28.7 | 69.5 | 56.3 |
| MOPD (Con) | **34.2** | **29.2** | **70.0** | **57.1** |

MOPD (Con) 在所有基准上取得了最佳性能,验证了混合成功-失败同伴上下文的优势。MOPD (Pos) 次优,但仍然优于标准 OPD 和使用單一成功同伴的变体。使用单一失败同伴作为上下文会损害性能,表明来自失败轨迹的负面证据单独使用时可能会误导。

### 教师信号质量分析

我们进一步通过第4节中的离线度量分析教师信号质量。对于 APPS 验证集,我们为每个提示固定 10 条学生轨迹(包含成功和失败)。我们计算六种上下文条件下的教师分数:无上下文(基线)、只有主要解(Primary Sol.)、只有次要解(Second Sol.)、只有失败解(Failure Sol.)、解加失败(Sol.+Failure)、2 成功 + 1 失败(2 Suc.+1 Failure)、所有解(All Solutions)。指标平均结果见表2。

**表2:APPS 上教师信号质量。展示了按提示平均的度量。所有度量越高越好,但布里尔分数越低越好。**

| 条件 | 均值斯皮尔曼 | 均值肯德尔 τ | 配对精度 | AUC | 点双列相关 | 布里尔(S型) |
|------|-------------|-------------|----------|-----|-----------|-------------|
| 基线 | -0.0024 | -0.0031 | 0.1275 | 0.1283 | -0.0037 | 0.2071 |
| 主要解 | 0.0988 | 0.1262 | 0.3211 | 0.3217 | 0.0859 | 0.2986 |
| 次要解 | 0.1190 | 0.1632 | 0.3528 | 0.3547 | 0.1065 | 0.3139 |
| 失败解 | 0.0097 | 0.0095 | 0.1326 | 0.1332 | 0.0052 | 0.1728 |
| 解 + 失败 | 0.1122 | 0.1326 | 0.4045 | 0.4045 | 0.1038 | 0.2701 |
| 2 成功 + 1 失败 | **0.1595** | **0.1879** | **0.4733** | **0.4733** | **0.1520** | 0.2908 |
| 所有解 | 0.1260 | 0.1623 | 0.3550 | 0.3556 | 0.1107 | 0.3124 |

表7:按提示平均的离线教师信号度量,覆盖六种上下文条件。除成功布里尔分数(S型)越低越好外,所有度量越高越好。

表7(见原文链接)报告了六种上下文条件下的提示级别教师信号度量。2 成功 + 1 失败条件在所有度量上取得最强性能,达到最高均值斯皮尔曼(0.1595)和均值肯德尔 τ(0.1879),以及最高配对精度(0.4733)和 AUC(0.4733),点双列相关也最高(0.1520)。这些结果表明,混合同伴上下文显著改善了教师信号与真实奖励的一致性,从而更好地监督学生。[省略部分后续内容]

相似文章

MOPD:面向大语言模型后训练中能力整合的多教师在线策略蒸馏

Hugging Face Daily Papers

MOPD提出了一种用于大语言模型后训练的多教师在线策略蒸馏范式,通过将特定领域的RL教师模型蒸馏到学生模型(使用其自身的采样数据),实现了多领域能力的高效整合。该方案优于Mix-RL和Cascade RL等现有方法,并已在工业级模型中部署。

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。