传递接力棒:轨迹中继在策略蒸馏

arXiv cs.CL 论文

摘要

提出中继在策略蒸馏(Relay-OPD),通过在检测到的交接触发点让教师短暂接管以纠正推理轨迹,解决了在策略蒸馏中的前缀失败问题。在数学推理基准上实现一致改进,并将训练轨迹长度减少超过50%。

arXiv:2607.26057v1 公告类型:新 摘要:在策略蒸馏(OPD)将令牌级监督建立在学生自身的轨迹上,但存在前缀失败问题:一旦学生陷入错误的推理方向,后续所有生成都会建立在这个偏差之上,产生错误导向的延续,从而引发不可靠的监督并浪费计算资源。我们识别了教师与学生在失败前缀上的延续不对称性——教师倾向于重新引导,而学生则沿原方向继续——并将其转化为无需标签的交接触发点,从而提出中继在策略蒸馏(Relay-OPD)。在训练过程中,Relay-OPD 通过在检测到的触发点让教师短暂接管以生成教师段,之后学生恢复并基于最终轨迹进行优化,从而构建中继轨迹。有限的中继预算将干预集中在关键早期位置,同时限制对学生策略的偏离。以 Qwen3-4B-Instruct-2507 为教师、Qwen3-0.6B/1.7B-Non-Thinking 为学生,在八个数学推理基准上,Relay-OPD 在每个基准上均取得最佳或次佳结果,在 1.7B 模型上平均优于标准 OPD 5.73%,优于最强基线 FastOPD 1.49%,在 0.6B 模型上也取得一致提升。训练轨迹长度减少超过50%。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:56

# 传递接力棒:轨迹接力式在线策略蒸馏
来源:https://arxiv.org/html/2607.26057
Haolei Xu¹,², Xiaowen Xu²¹¹, Haiwen Hong²¹¹, Zixuan Ni¹, Hongxing Li¹,², Yiwen Qiu¹, Weiming Lu¹, Yongliang Shen¹
¹ 浙江大学,² 阿里巴巴集团Yuvion团队
\{xuhaolei, luwm, syl\}@zju\.edu\.cn
honghaiwen\.hhw@alibaba\-inc\.com
GitHub: https://github.com/zju-real/Relay-OPD
项目: https://zju-real.github.io/Relay-OPD/

###### 摘要

在线策略蒸馏 (OPD) 在 student 自身轨迹上提供 token 级别的监督,但存在前缀失败问题:一旦 student 走上错误的推理方向,所有后续生成都在该偏离基础上构建,产生方向错误的延续,从而引发不可靠的监督并浪费计算资源。我们发现在失败前缀上存在一种师生延续不对称性:teacher 倾向于重新引导方向,而 student 会沿着原方向继续。我们将这种不对称性转化为接力式在线策略蒸馏 (Relay-OPD) 中一种无标签的交接触发机制。训练过程中,Relay-OPD 通过在检测到的触发点让 teacher 短暂接管,生成一段 teacher 阶段,然后 student 恢复生成并在所得轨迹上进行优化,从而构建接力轨迹。有限的接力预算将干预集中在关键早期位置,同时限制与 student 策略的偏离。以 Qwen3-4B-Instruct-2507 为 teacher,Qwen3-0.6B/1.7B-Non-Thinking 为 student,在八个数学推理基准上,Relay-OPD 在每个基准上都取得了最佳或次佳结果,对于 1.7B student,相比标准 OPD 平均提升 +5.73%,相比最强基线 FastOPD 平均提升 +1.49%,0.6B 模型也有一致的提升。训练轨迹长度减少超过 50%。

参见图注
图 1: (a) Relay-OPD 案例:在检测到的交接触发点,teacher 偏向于反思标记 (But, 74.4%),而 student 会沿着当前方向继续 (So, 50.6%);一段简短的 teacher 阶段纠正了推理,student 恢复生成并得到正确答案。(b) OPD 与 Relay-OPD 的差异。(c) 整体性能。

## 1 引言

将强模型的能力有效迁移到弱模型已成为大型语言模型后训练中的核心挑战 (Yang et al., 2025a (https://arxiv.org/html/2607.26057#bib.bib31); Xu et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib29); Zeng et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib35); Xiao et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib27))。与监督微调和离线知识蒸馏 (Hinton et al., 2015 (https://arxiv.org/html/2607.26057#bib.bib11); Kim & Rush, 2016 (https://arxiv.org/html/2607.26057#bib.bib15)) (两者均依赖 teacher 生成的数据)不同,在线策略蒸馏 (OPD) (Agarwal et al., 2024 (https://arxiv.org/html/2607.26057#bib.bib1); Lu & Lab, 2025 (https://arxiv.org/html/2607.26057#bib.bib20)) 让 student 根据自身策略生成轨迹。然后 teacher 在 student 实际访问的前缀上提供密集的 token 级别指导。由于监督始终基于 student 自身的状态分布,OPD 有效缓解了训练-推理分布偏移,并在强到弱蒸馏中显示出明显的收益。然而,student 自身的轨迹不可避免地包含其失败。在长链推理 (Jaech et al., 2024 (https://arxiv.org/html/2607.26057#bib.bib13); Guo et al., 2025 (https://arxiv.org/html/2607.26057#bib.bib8)) 中,这会导致前缀失败 (Li et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib18); Fu et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib6); Xie et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib28)):一旦 student 早期就走上错误方向,所有后续生成都在该偏离基础上构建 (图 1 (https://arxiv.org/html/2607.26057#S0.F1)(b))。由此产生的长而错误的延续会引发不可靠甚至有害的监督,并浪费大量训练计算。先前的工作从多个角度解决前缀失败问题,每个都有结构性的局限。固定长度截断 (ESR, FastOPD) (Ziheng et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib38); Zhang et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib36)) 在刚性位置截断 rollout,而不管推理实际在何处失败。离线重写 (TRD) (Jiang et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib14)) 仅在 rollout 完成后修复轨迹,修复结果往往留下可见的痕迹。Token 级别混合 (SKD) (Xu et al., 2025 (https://arxiv.org/html/2607.26057#bib.bib30)) 基于通用的分布不一致性在 teacher 和 student 之间切换,而非基于推理方向失败的明确信号。目前缺少一种能够在线运行、在失败出现时立即纠正,并且能根据推理状态本身决定干预位置的机制。

在失败的 student 前缀上,teacher 和 student 的后续生成方式出现分歧 (图 1 (https://arxiv.org/html/2607.26057#S0.F1)(a);完整案例见附录 E.1 (https://arxiv.org/html/2607.26057#A5.SS1)):teacher 倾向于停止、重新审视推理并重定向,而 student 倾向于沿着同一错误方向继续。这种分歧在生成过程中是可观察的,无需任何标签、验证器或奖励模型,并且它标记了 student 推理出错的位置。我们将这样的位置称为交接触发点。为了弄清楚应如何处理触发点,我们进行了轨迹干预实验:在每个触发点让 teacher 短暂接管,并改变干预的持续时间和时机。这种干预的两个特性尤为突出 (图 2 (https://arxiv.org/html/2607.26057#S1.F2))。首先,修正可以非常局部:仅替换每个触发点处的单个反思标记,使得 teacher token 仅占所有生成 token 的 0.35%,就能将准确率从 27.73 提升到 34.96 (+7.23%;图 2(a) (https://arxiv.org/html/2607.26057#S1.F2.sf1)),并且 teacher 接管同样缩小了 teacher–student 差距 (图 2(b) (https://arxiv.org/html/2607.26057#S1.F2.sf2))。其次,干预的价值是前载的:保持干预长度固定,但将其从最早触发点推迟到较晚触发点,准确率从 41.99 降至 33.98,再降至 29.49。Teacher–student 差距解释了为何时机至关重要。随着生成进行,该差距会缩小(无论 student 单独运行还是 teacher 完成轨迹),因此后期接管无法有效重定向。

参见图注
(a)
参见图注
(b)
图 2: 初步轨迹干预实验。Qwen3-4B-Instruct-2507 (teacher) 和 Qwen3-1.7B-Non-Thinking (student) 在 128 个 DAPO-Math-17K 英文样本上;交接标准与主要实验一致。(a) 准确率 (mean@4) 和 teacher token 比例随 teacher 生成段落数 L 变化;周期延迟 r 表示在下次接管前跳过 r 个连续有效触发点。(b) Teacher–student 差距按响应 token 位置(在 L=3 干预下)计算,为每个位置区间内平均 token 级别优势(定义见 §3.1 (https://arxiv.org/html/2607.26057#S3.SS1))的绝对值。

一个清晰的设计原则浮现出来:前缀失败可以通过在检测到的失败点进行早期、局部的 teacher 干预来解决,在错误方向在轨迹中变得根深蒂固之前。这给训练方法留下两个问题:teacher 应该在何时接管,以及如何让这些接管不将轨迹拉离 student 自身策略太远?我们提出接力式在线策略蒸馏 (Relay-OPD),该算法将 student 生成与简短的 teacher 接管交替进行,接管发生在推理首次出错的位置。当 student 滚动其轨迹时,Relay-OPD 监控每个前缀以检测交接触发点:即 teacher 会重定向推理而 student 会继续当前路线的状态。当触发点被激活时,teacher 生成一段简短的 teacher 阶段,将推理拉回正轨,然后将控制权交还给 student (图 1 (https://arxiv.org/html/2607.26057#S0.F1)(b))。接力预算限制这些阶段的数量和长度,将修正集中在前缀失败产生的早期位置,同时保持轨迹接近 student 自身策略。然后,student 在生成的接力轨迹上进行蒸馏,与标准在线策略蒸馏完全一致。我们的贡献如下:(1) 我们在失败推理前缀上识别出一种师生延续不对称性,并通过轨迹干预实验表明,修正前缀失败仅需早期、局部的 teacher 干预,teacher token 低至 0.35%。(2) 我们提出 Relay-OPD,将该不对称性转化为无标签的交接触发点和预算化的接力 rollout,并将 student 和 teacher 生成统一到单个推测性解码引擎中。(3) 在八个数学推理基准和两种 student 规模上,Relay-OPD 在 1.7B student 上相比标准 OPD 提升 +5.73%,相比 FastOPD 提升 +1.49%,同时将平均训练轨迹长度减少超过 50%。

## 2 相关工作

### 2.1 在线策略蒸馏

在线策略蒸馏从 student 中采样轨迹,由 teacher 在 student 实际访问的前缀上对每个 token 评分 (Agarwal et al., 2024 (https://arxiv.org/html/2607.26057#bib.bib1); Gu et al., 2024 (https://arxiv.org/html/2607.26057#bib.bib7));与在 teacher 生成数据上的离线训练 (Hinton et al., 2015 (https://arxiv.org/html/2607.26057#bib.bib11); Kim & Rush, 2016 (https://arxiv.org/html/2607.26057#bib.bib15)) 相比,它将监督扎根于 student 自身状态分布,实现更快更强的迁移,并已成为后训练流程的标准 (Yang et al., 2025a (https://arxiv.org/html/2607.26057#bib.bib31); Lu & Lab, 2025 (https://arxiv.org/html/2607.26057#bib.bib20))。最近的扩展涵盖跨模型家族的蒸馏 (Patiño et al., 2025 (https://arxiv.org/html/2607.26057#bib.bib22))、无法获取 logit 的黑盒 teacher (Ye et al., 2025 (https://arxiv.org/html/2607.26057#bib.bib33)),以及模型自身上下文或特权知识的自蒸馏 (Yang et al., 2025b (https://arxiv.org/html/2607.26057#bib.bib32); Hübotter et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib12); Shenfeld et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib25); Zhao et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib37); Penaloza et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib23))。

### 2.2 前缀失败

将监督完全扎根于 student 轨迹也引入了 student 的失败。当 teacher 和 student 的推理模式不兼容时,蒸馏收益会下降 (Li et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib18)),并且随着 student 前缀偏离 teacher 支持的状态,后续监督变得不可靠 (Fu et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib6); Xie et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib28))。这些效应在长链推理中最为明显,早期的方向偏差会自回归地累积成广泛的错误延续。现有的补救措施直接干预轨迹:ESR 和 FastOPD (Ziheng et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib38); Zhang et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib36)) 以固定长度截断 rollout 以丢弃后期低价值监督,TRD (Jiang et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib14)) 通过 teacher 离线重写 student 轨迹,SKD (Xu et al., 2025 (https://arxiv.org/html/2607.26057#bib.bib30)) 根据分布一致性逐 token 混合 teacher 和 student 生成。

## 3 方法

本节首先回顾标准在线策略蒸馏 (§3.1 (https://arxiv.org/html/2607.26057#S3.SS1)),然后介绍 Relay-OPD 的交接触发点、接力轨迹构建和优化目标 (§3.2 (https://arxiv.org/html/2607.26057#S3.SS2)),最后描述其高效实现 (§3.3 (https://arxiv.org/html/2607.26057#S3.SS3))。

### 3.1 在线策略蒸馏

设 \(x \sim \mathcal{D}\) 表示训练提示,\(\pi_\theta\)、\(\pi_{\bar{\theta}}\) 和 \(\pi_T\) 分别表示当前 student 策略、旧 student 策略和 teacher 策略。在每个训练迭代中,标准 OPD 首先使用旧 student 策略生成一条在线策略轨迹:
\[ y = (y_1, \ldots, y_N) \sim \pi_{\bar{\theta}}(\cdot \mid x). \tag{1} \]
令 \(h_t = (x, y_{<t})\) 为前缀。

### 3.2 Relay-OPD

我们提出 Relay-OPD,该方法在 student 生成过程中插入短暂的 teacher 接管,以修正早期推理错误。

#### 交接触发点

我们将交接触发点定义为一个位置,在该位置:
- teacher 认为需要重新思考(生成反思标记,例如 “But” 或 “Wait”);
- student 会继续当前方向(其 top-K 中不包含任何反思标记)。

该条件无需任何标签即可计算。

#### 接力轨迹构建

一旦检测到触发点,teacher 生成一段固定长度的“教师阶段”(例如 L 个 token 或段落),然后控制权交还给 student。整个过程受接力预算 (M, L) 限制,其中 M 是最大接管次数,L 是每次接管的长度。

#### 优化目标

student 在最终接力轨迹上最小化与 teacher 的 KL 散度,与标准 OPD 类似。

### 3.3 高效实现

我们将 teacher 和 student 生成统一到一个推测性解码引擎中,在触发点之前由 student 主导,在触发点后切换到 teacher,从而避免显式的模型切换开销。

## 4 实验

### 4.1 设置

**模型**:Teacher: Qwen3-4B-Instruct-2507; Student: Qwen3-0.6B-Non-Thinking 和 Qwen3-1.7B-Non-Thinking。

**基准**:八个数学推理基准(GSM8K, MATH-500, DAPO-Math-17K 等)。

**基线**:标准 OPD, FastOPD, TRD, SKD, ESR。

### 4.2 主要结果

| 方法 | 1.7B (平均) | 0.6B (平均) |
|------|-------------|-------------|
| 标准 OPD | 基线 | 基线 |
| FastOPD | +4.24% | +3.12% |
| TRD    | +2.81% | +1.95% |
| SKD    | +3.67% | +2.44% |
| Relay-OPD (Ours) | +5.73% | +4.18% |

### 4.3 消融实验

- **接管长度**:较短的接管(例如 1 个 token)足以修正大部分错误。
- **接管时机**:早期接管优于后期接管。
- **预算**:较小的 M 和 L 已能取得显著收益。

### 4.4 效率分析

Relay-OPD 将平均训练轨迹长度减少超过 50%,同时准确率提升,实现了更好的计算-质量权衡。

## 5 结论

我们提出了 Relay-OPD,通过早期、局部的 teacher 干预解决在线策略蒸馏中的前缀失败问题。实验表明,该方法在多个推理基准上优于现有方法,同时显著降低训练成本。

## 致谢

略。

## 参考文献

[略,保留原引用格式]

---

(附录内容)

## 附录 A 实验细节

## 附录 B 提示模板

### B.1 标准 OPD 提示

```
<|system|>请逐步推理,并将最终答案放在 \boxed{} 内。<|im_end|>
<|user|>{problem}<|im_end|>
<|assistant|>
```

### B.2 TRD 重写提示

我们采用原始 TRD 论文 (Jiang et al., 2026 (https://arxiv.org/html/2607.26057#bib.bib14)) 中的重写提示,用户内容如下:

**TRD 重写提示**
你的任务是重写你的数学解答。
**问题:** {problem}
**你的初始解答:** {initial_response}
**指令:**
1. 保留原始解答的整体结构和推理路径
2. 识别并修正计算或逻辑错误
3. 保留正确的中间步骤和有价值的工作
4. 只输出重写后的解答

## 附录 C 算法与基线

### C.1 Relay-OPD 算法

Relay-OPD 的接力 rollout 构建过程见算法 1。

**算法 1** 接力 Rollout 构建

1: 输入:提示 \(x\),student 策略 \(\pi_{\bar{\theta}}\),teacher 策略 \(\pi_T\),反思标记集 \(\mathcal{R}\),交接 top-K,接力预算 \((M, L)\)
2: 输出:接力轨迹 \(z\)
3: 初始化 \(z \leftarrow ()\),接管计数 \(j \leftarrow 0\),状态 \(s \leftarrow \mathsf{S}\)
4: **while** 既未到达 EOS 也未达到最大长度 **do** ▷ 任一事件进入终止状态 \(\bot\)
5:     // Student 草案与交接检测
6:     设置前缀 \(h \leftarrow (x, z)\) 并采样 student 草案 token \(a^S \sim \pi_{\bar{\theta}}(\cdot \mid h)\)
7:     计算 teacher argmax \(a^T \leftarrow \arg\max_{v} \pi_T(v \mid h)\) 和 student top-K 集合 \(\mathcal{K}_S(h) \leftarrow \operatorname{TopK}_K(\pi_{\bar{\theta}}(\cdot \mid h))\)
8:     评估交接条件 \(\phi(h) \leftarrow \mathbf{1}[a^T \in \mathcal{R}] \cdot \mathbf{1}[\mathcal{K}_S(h) \cap \mathcal{R} = \varnothing]\)
9:     **if** \(s = \mathsf{S}\) and \(\phi(h) = 1\) and \(j < M\) **then**
10:        // 进入 teacher 阶段
11:        \(s \leftarrow \mathsf{T}\)
12:        接管计数 \(j \leftarrow j + 1\)
13:        teacher 阶段剩余长度 \(l \leftarrow L\)
14:    **end if**
15:    **if** \(s = \mathsf{T}\) **then**
16:        // Teacher 生成
17:        采样 teacher token \(a \sim \pi_T(\cdot \mid h)\)
18:        \(z \leftarrow z + [a]\)
19:        \(l \leftarrow l - 1\)
20:        **if** \(l = 0\) **then**
21:            \(s \leftarrow \mathsf{S}\) // 回到 student
22:        **end if**
23:    **else**
24:        // Student 生成
25:        采样 student token \(a \sim \pi_{\bar{\theta}}(\cdot \mid h)\)
26:        \(z \leftarrow z + [a]\)
27:    **end if**
28: **end while**
29: **return** \(z\)

### C.2 基线实现

(略)

## 附录 D 更广泛的影响与局限性

(略)

## 附录 E 补充分析

### E.1 完整交接案例

表 9 (https://arxiv.org/html/2607.26057#A5.T9) 展示了在完成答案块的前缀上 teacher 和 student 的下一 token 分布。¹¹Token 字符串以 tokenizer 的字节级表示形式出现,将每个字节映射为可打印字符:Ġ 表示前导空格,^aľ 是对勾符号(例如 ✓)的前两个 UTF-8 字节,其最终字节将由后续 token 完成。Teacher 意图终止生成:其 top-1 token 是序列结束标记 <|im_end|>,概率为 73.7035%。Student

相似文章

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。

通过近未来引导弥合在线蒸馏中的推理轨迹

arXiv cs.CL

本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。