SimpleOPD:面向长上下文推理的简单分词器无关在策略蒸馏方法

arXiv cs.CL 论文

摘要

本文提出SimpleOPD方法,实现了从长上下文推理教师模型到短上下文学生模型的在职蒸馏。该方法通过解决分词器不匹配与训练不稳定问题,有效提升了数学推理能力。

和</thought>要保持原格式,但需要加上中文引号说明。 最后检查一下专业术语的一致性,确保全文统一。数学模型名称和benchmark名称都保持英文不翻译,符合学术惯例。</think>arXiv:2608.14277v1 公告类型:新 摘要:同策略蒸馏(OPD)为将推理能力从更强的教师模型迁移提供了一种有前景的方法,但将其应用于长上下文推理教师和短上下文学生时,会引入实际挑战,包括分词器不匹配、师生分布不匹配、响应长度爆炸以及训练不稳定。本研究通过将证明推理能力从长上下文推理模型SU-01迁移至短上下文学生模型,对该场景进行探讨。为处理分词器差异,我们在共享文本空间中进行OPD,并仅对齐在学生和教师分词器下占据相同文本区间的词元。为解决生成长度过长和频繁截断的问题,我们引入了学生参考KL损失,并掩蔽特殊终止词元(如</think>和</thought)的优势。该策略约束学生不会过度偏离其初始策略,从而缓解师生分布不匹配问题,并促进长度的稳定增长。在同族和不同族的学生模型(包括Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4)上的实验显示,数学推理能力获得一致提升,尤其是在自然语言数学证明方面。值得注意的是,Intern-S2-Preview在ProofBench上提升21.2分,达到55.2分,超越了Gemini-2.5-Pro。它在HLE和HiPhO等科学基准测试中也有所提升,表明OPD所迁移的推理能力能够泛化至数学训练领域之外。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:56

# SimpleOPD:用于长上下文推理的简单、分词器无关的在策略蒸馏
来源:https://arxiv.org/html/2608.14277

Haonan He\*、Haodi Lei\*、Yun Luo†,‡、Haoran Zhang、Shunkai Zhang、Yizhuo Li、Shengji Tang、Zhilin Wang、Runzhe Zhan、Lei Bai、Ganqu Cui、Fangchen Yu‡、Yafu Li‡、Peng Ye‡、Ning Ding‡、Yu Cheng‡、SU-01团队,上海人工智能实验室
\*同等贡献,†项目负责人,‡\\ddagger通讯作者 [email protected]

###### 摘要
在策略蒸馏为从更强大的教师模型迁移推理能力提供了一条有前景的途径,但将其应用于长上下文推理教师和短上下文学生时,会带来实际挑战,包括分词器不匹配、师生分布不匹配、响应长度爆炸以及训练不稳定。本工作通过从长上下文推理模型 SU-01 向短上下文学生模型迁移证明推理能力来研究这一设定。为处理分词器差异,我们在共享的文本空间中进行在策略蒸馏,并仅对齐在学生和教师分词器下占据相同文本跨度的token。为缓解生成长度过长和频繁截断的问题,我们引入了学生参考KL损失,并屏蔽了特殊终止token(如\{\\scriptstyle<\}\\,\\mathrm\{/think\}\{\\scriptstyle\>\}和<\|im\_end\|\>\{\\scriptstyle<\}\\,\\mathrm\{\|im\\\_end\|\}\\,\{\\scriptstyle\>\})的优势。该策略限制了学生策略过度偏离其初始策略,从而缓解了师生分布不匹配问题,并促进了长度的稳定增长。在包括 Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4 在内的同族和异族学生模型上的实验显示,在数学推理(尤其是自然语言数学证明)上取得了持续提升。值得注意的是,Intern-S2-Preview 在 ProofBench 上提升了21.2分,达到55.2分,超越了 Gemini-2.5-Pro。它在科学基准测试如 HLE 和 HiPhO 上也有所提升,这表明在策略蒸馏迁移的推理能力可以泛化到数学训练领域之外。

[![[无标题图片]](https://arxiv.org/html/2608.14277v1/icon/worlwide.png)项目主页](https://hhnqqq.github.io/SimpleOPD-project-page)代码 (https://github.com/hhnqqq/SimpleOPD)模型 (https://huggingface.co/collections/bingyang-lei/simpleopd)2026年8月

11脚注文本:工作于上海人工智能实验室实习期间完成。
图1:在SU-01相同评估设置下,以Gemini-2.5-Pro作为评判,对ProofBench的评估性能。使用SimpleOPD,Intern-S2-OPD的性能达到了与DeepSeek-V3.2-Special相当的水平,证明了我们在策略蒸馏策略的有效性。

###### 目录
1. 引言 (https://arxiv.org/html/2608.14277#S1)
2. 方法 (https://arxiv.org/html/2608.14277#S2)
    1. 跨分词器对齐 (https://arxiv.org/html/2608.14277#S2.SS1)
    2. 在策略蒸馏目标 (https://arxiv.org/html/2608.14277#S2.SS2)
3. 实验 (https://arxiv.org/html/2608.14277#S3)
    1. 训练数据 (https://arxiv.org/html/2608.14277#S3.SS1)
    2. 实现细节 (https://arxiv.org/html/2608.14277#S3.SS2)
4. 实验结果 (https://arxiv.org/html/2608.14277#S4)
    1. 在策略蒸馏中的训练不稳定性 (https://arxiv.org/html/2608.14277#S4.SS1)
    2. 同族模型上的结果 (https://arxiv.org/html/2608.14277#S4.SS2)
    3. 异族模型上的结果 (https://arxiv.org/html/2608.14277#S4.SS3)
5. 分析 (https://arxiv.org/html/2608.14277#S5)
    1. 与在策略蒸馏基线的比较 (https://arxiv.org/html/2608.14277#S5.SS1)
    2. 词汇重叠度 (https://arxiv.org/html/2608.14277#S5.SS2)
    3. 跨领域泛化能力 (https://arxiv.org/html/2608.14277#S5.SS3)
    4. 训练数据的影响 (https://arxiv.org/html/2608.14277#S5.SS4)
    5. 在策略蒸馏长度的影响 (https://arxiv.org/html/2608.14277#S5.SS5)
    6. 从DeepSeek-V4-Flash蒸馏 (https://arxiv.org/html/2608.14277#S5.SS6)
    7. 学生参考KL损失的影响 (https://arxiv.org/html/2608.14277#S5.SS7)
6. 相关工作 (https://arxiv.org/html/2608.14277#S6)
    1. 奥赛级长上下文推理 (https://arxiv.org/html/2608.14277#S6.SS1)
    2. 在策略蒸馏 (https://arxiv.org/html/2608.14277#S6.SS2)
7. 结论 (https://arxiv.org/html/2608.14277#S7)
8. 参考文献 (https://arxiv.org/html/2608.14277#bib)
9. 附录A 跨分词器评分与对齐 (https://arxiv.org/html/2608.14277#A1)
10. 附录B ProofBench的模型解答 (https://arxiv.org/html/2608.14277#A2)
    1. B.1 ProofBench-Basic-001 (https://arxiv.org/html/2608.14277#A2.SS1)
    2. B.2 ProofBench-Advanced-028 (https://arxiv.org/html/2608.14277#A2.SS2)
11. 附录C 案例研究 (https://arxiv.org/html/2608.14277#A3)
    1. C.1 案例A:正确答案,随后972次完全相同的自查重复(AIME25)(https://arxiv.org/html/2608.14277#A3.SS1)
    2. C.2 案例B:推理崩溃成单token循环(AnswerBench)(https://arxiv.org/html/2608.14277#A3.SS2)

## 1 引言
在策略蒸馏在LLM的后训练领域呈现了一种引人注目的范式,适用于诸如强-弱蒸馏、多教师蒸馏和自我蒸馏等任务。与从固定的教师生成数据中蒸馏知识的离策略方法不同,OPD主动查询教师以评估学生生成轨迹中的token,从而提供基于学生自身策略的密集token级监督,能够高效地蒸馏复杂推理行为,因为其遗忘更少,并且比离策略设置能获得更好的泛化能力。然而,先前的研究主要针对共享相同模型族和词表的师生对进行。从长上下文教师向短上下文学生(尤其是跨不同模型族)蒸馏推理能力,在很大程度上仍未被探索。

将应用于长上下文推理教师向短上下文推理学生的蒸馏会带来若干挑战。首先,教师和学生模型可能使用不同的分词器,使得其token级分布之间的直接对齐不可行。其次,模型容量和上下文长度的差异引入了显著的师生分布不匹配。特别是,长上下文推理教师倾向于产生超出学生上下文预算的响应。通过实验,我们观察到直接的在策略蒸馏会导致响应长度快速增长、频繁截断以及不完整的推理轨迹,最终导致训练不稳定。这个问题对于终止token(如\{\\scriptstyle<\}\\,\\mathrm\{/think\}\{\\scriptstyle\>\}和<\|im\_end\|\>\{\\scriptstyle<\}\\,\\mathrm\{\|im\\\_end\|\}\\,\{\\scriptstyle\>\})尤其明显,因为教师监督可能会反复阻止学生终止其思考过程或最终响应。

在本工作中,我们专注于从长上下文推理模型 SU-01 向短上下文学生模型迁移推理能力。如图2所示,为实现跨不同模型族的蒸馏,我们在共享的文本空间中进行在策略蒸馏,并仅当教师和学生的token占据相同文本跨度时才进行对齐。这无需在不兼容的分词之间建立人为对应关系,即可提供可靠的token级监督。为缓解响应长度过度增长并稳定优化,我们引入了学生与其初始策略之间的参考KL散度损失。我们还屏蔽了特殊终止token的优势,防止教师监督直接抑制终止行为。这些技术共同约束了过度的策略漂移,缓解了师生分布不匹配,并促进了响应长度在学生上下文预算内的稳定增长。

我们在同族和异族蒸馏设置下评估了SimpleOPD,使用来自 Qwen3、Qwen3.5、Intern-S2-Preview、GLM-4.7 和 Gemma-4 的学生模型。跨模型族,SimpleOPD持续提升了数学推理性能,在自然语言数学证明任务上尤其取得了显著提升。最值得注意的是,Intern-S2-Preview 在 ProofBench 上提升了21.2分,从34.0分提高到55.2分,超越了 Gemini-2.5-Pro,并接近了性能更强的推理模型(图1)。蒸馏后的学生在科学基准测试(包括 HLE 和 HiPhO)上也取得了进步,尽管它们仅使用数学推理数据进行训练。这些结果表明,稳定的跨分词器在策略蒸馏可以迁移长上下文教师的推理能力,并且获得的能力可以泛化到训练领域之外。

总之,我们的观察和贡献如下:

(此处插入图2说明)图2:SimpleOPD概述。学生在其自身的分词器下生成响应,而教师在其原生分词器下评估相同的响应。我们对齐具有相同文本跨度的token,对匹配的token使用教师监督,并通过KL正则化和终止token屏蔽来稳定训练。

- 跨分词器在策略蒸馏可以通过将学生生成的文本作为共享空间并对齐具有相同文本跨度的token,而无需完整的token级对齐来改进学生模型。
- 直接的在策略蒸馏迁移了长上下文推理能力,但常常导致长度过度增长、频繁截断和训练不稳定。
- 终止token优势屏蔽和学生参考KL损失稳定了训练并减少了截断。更大的师生差距通常需要更强的KL正则化。
- SimpleOPD在不同模型族上显示了一致的性能提升,而无需在教师轨迹上进行监督微调,同时适度增加蒸馏长度可以进一步改善长形式推理。

## 2 方法
令$\mathbf{x}$表示表示为消息列表的输入对话。具有不同分词器的学生和教师可能使用不同的聊天模板,分别表示为$\mathcal{C}_{\theta}$和$\mathcal{C}_{\phi}$。我们首先构建学生输入上下文文本$c_{\theta}=\mathcal{C}_{\theta}(\mathbf{x})$,并使用由rollout引擎执行的学生策略采样一个响应token序列:$y_{1:n}=(y_{1},\ldots,y_{n})\sim\pi_{\theta_{\mathrm{roll}}}\left(\cdot\mid c_{\theta}\right)$。

通过学生的分词器解码器解码$y_{1:n}$得到响应表层字符串$s=\mathcal{D}_{\theta}\left(y_{1:n}\right)$。我们不是将学生上下文传递给教师,而是使用其自身的聊天模板重建教师上下文文本$c_{\phi}=\mathcal{C}_{\phi}(\mathbf{x})$,并附加学生响应:$u_{\phi}=c_{\phi}\oplus s$,其中$\oplus$表示字符串连接。然后,完整的文本$u_{\phi}$被提供给教师,教师使用其分词器编码器$\mathcal{E}_{\phi}$将其分词。令$\mathcal{E}_{\phi}(s\mid c_{\phi})=\left(z_{1},\ldots,z_{m}\right)$表示使用教师分词器在给定输入上下文$c_{\phi}$下对学生响应进行编码后得到的token列表。该过程允许教师在其原生分词器和聊天模板下评估学生响应。尽管$c_{\theta}$和$c_{\phi}$可能不同,但被评估的响应文本在双方是相同的。

对于token对齐,令$\tau_{\theta}\left(y_{t}\right)$和$\tau_{\phi}\left(z_{i}\right)$表示相应响应token贡献的增量文本跨度。它们满足$\bigoplus_{t=1}^{n}\tau_{\theta}\left(y_{t}\right)=\bigoplus_{i=1}^{m}\tau_{\phi}\left(z_{i}\right)=s$。我们不进行额外的清理或规范化,因此这些跨度在共享响应字符串中定义了一致的偏移量。

与token $z_{i}$相关的教师对数概率为$\log \pi_{\phi}\left(z_{i}\mid c_{\phi}, z_{<i}\right)$。学生在文本$s$上token $y_{t}$的对数概率为$\log \pi_{\theta}\left(y_{t}\mid c_{\theta}, y_{<t}\right)$。OPD中的蒸馏目标是最大化token $y_{t}$与教师预测$z_{i}$对齐的token $y_{t}$的累积对数概率,其中$\tau_{\theta}\left(y_{t}\right)=\tau_{\phi}\left(z_{i}\right)$。

为缓解响应长度爆炸问题,我们采用以下两项关键策略:

1.  **学生参考KL损失**:我们在学生策略$\pi_{\theta}$和其初始策略$\pi_{\theta_{0}}$之间添加一个KL散度惩罚。损失项为$\beta \cdot D_{\mathrm{KL}}\left(\pi_{\theta}\left(\cdot \mid c_{\theta}\right) \| \pi_{\theta_{0}}\left(\cdot \mid c_{\theta}\right)\right)$,其中$\beta$是一个缩放因子。这鼓励学生不要偏离其初始策略太远,从而缓解分布不匹配问题。

2.  **终止token优势屏蔽**:我们观察到教师监督可能反复惩罚学生使用终止token,如\{\\scriptstyle<\}\\,\\mathrm\{/think\}\{\\scriptstyle\>\}和<\|im\_end\|\>\{\\scriptstyle<\}\\,\\mathrm\{\|im\\\_end\|\}\\,\{\\scriptstyle\>\},导致学生无法正确终止。因此,我们屏蔽了这些特殊token在蒸馏目标中的优势,使得在这些token位置上不施加教师监督。这防止了教师监督直接抑制终止行为,让学生能够自行学习何时终止。

具体的优化目标结合了跨分词器对齐的策略蒸馏损失、学生参考KL损失以及终止token屏蔽。详细的损失公式和超参数设置见实验部分。

## 3 实验
#### 3.1 训练数据
我们使用来自SU-01的数据,其中包含高质量的数学证明轨迹。这些轨迹包含详细的逐步推理过程,适合蒸馏长链推理能力。数据被处理为对话格式,以适应不同的聊天模板。

#### 3.2 实现细节
我们在Intern-S2-Preview上进行主要实验,其最大上下文长度为8k token。教师模型SU-01支持长上下文。我们使用vLLM作为rollout引擎来生成学生响应。蒸馏长度(生成的最大token数)设置为8192。学生参考KL损失的权重$\beta$设置为0.1。我们使用AdamW优化器,学习率为$5 \times 10^{-6}$,批量大小为128。训练在8个A100 GPU上进行。

## 4 实验结果
#### 4.1 在策略蒸馏中的训练不稳定性
我们首先研究了直接应用OPD时的挑战。当从SU-01蒸馏到Intern-S2-Preview时,我们观察到未经修改的蒸馏会导致训练不稳定。响应长度迅速增长,截断率(生成达到最大长度的响应比例)急剧上升,最终导致推理质量下降。分析发现,教师监督强烈抑制了学生使用终止token,例如\{\\scriptstyle<\}\\,\\mathrm\{/think\}\{\\scriptstyle\>\}和<\|im\_end\|\>\{\\scriptstyle<\}\\,\\mathrm\{\|im\\\_end\|\}\\,\{\\scriptstyle\>\}。这表明学生受到教师长输出的强烈影响,逐渐失去了正确终止的能力。

为缓解此问题,我们屏蔽了结构token \{\\scriptstyle<\}\\,\\mathrm\{/think\}\{\\scriptstyle\>\}和<\|im\_end\|\>\{\\scriptstyle<\}\\,\\mathrm\{\|im\\\_end\|\}\\,\{\\scriptstyle\>\}上的在策略蒸馏损失,因为这些token主要控制输出格式和终止行为,无需精确匹配教师分布。验证曲线如图5所示。结果表明,屏蔽策略有助于缓解与长度相关的不稳定性。然而,在训练后期,模型的长度截断率仍然急剧上升,表明仅靠特殊token屏蔽无法完全解决长度扩张问题。

评估结果如表1所示。结果表明,屏蔽特殊终止token的优势提高了在策略蒸馏的训练稳定性,但仅靠特殊token屏蔽无法完全解决长度扩张问题。

图5:Intern-S2-Preview在策略蒸馏训练动态,当屏蔽特殊token如\{\\scriptstyle<\}\\,\\mathrm\{/think\}\{\\scriptstyle\>\}和<\|im\_end\|\>\{\\scriptstyle<\}\\,\\mathrm\{\|im\\\_end\|\}\\,\{\\scriptstyle\>\}时。仅靠特殊token屏蔽有助于缓解与长度相关的不稳定性,但无法解决长度扩张问题。

图6:Intern-S2-Preview在策略蒸馏训练动态,当增加学生参考KL损失以防止学生策略过度偏离其初始分布时。训练可以稳定下来,并且截断率有效降低至接近零。

表1:从SU-01到Intern-S2-Preview的蒸馏结果,分别应用终止token屏蔽和增加学生参考KL损失。
| 模型 | ProofBench@4 | AnswerBench@8 | AIME25@8 |
| :--- | :--- | :--- | :--- |
| SU-01 | 45.00 | 77.50 | 94.60 |
| Intern-S2-Preview | 21.70 | 76.03 | 88.33 |
| OPD + Spec Mask | 38.10 (+16.40) | 77.60 (+1.57) | 95.00 (+6.67) |
| OPD + Ref KL | 38.50 (+16.80) | 79.10 (+3.07) | 95.80 (+7.47) |

#### 4.2 同族模型上的结果
我们将SimpleOPD应用于同族模型,如从SU-01蒸馏到Qwen3和Qwen3.5系列。所有测试的模型在数学推理基准测试上都显示出一致的提升。例如,Qwen3.5-72B经过蒸馏后,在ProofBench上的性能显著提高。这表明即使在同族模型内,SimpleOPD也能有效迁移复杂的推理行为。

#### 4.3 异族模型上的结果
更重要的测试是在异族模型之间进行蒸馏。我们从SU-01蒸馏到GLM-4.7、Gemma-4和Intern-S2-Preview。结果显示,这些异族学生模型也获得了显著的收益。特别是Intern-S2-Preview,其ProofBench分数从34.0提升到55.2,超越了Gemini-2.5-Pro。此外,这些蒸馏后的模型在科学基准测试(如HLE和HiPhO)上也取得了进步,尽管训练数据完全是数学推理数据。这证明了SimpleOPD蒸馏的推理能力具有良好的泛化性。

## 5 分析
#### 5.1 与在策略蒸馏基线的比较
我们将SimpleOPD与标准的在策略蒸馏(不采用我们的对齐策略和稳定化技术)进行比较。标准方法在跨分词器场景下表现不佳,经常因对齐失败或训练不稳定而崩溃。SimpleOPD通过共享文本空间对齐和稳定化技术,显著优于这些基线。

#### 5.2 词汇重叠度
我们分析了教师和学生响应之间的词汇重叠度。尽管使用了不同的分词器,但SimpleOPD通过文本空间对齐,使得学生能够生成与教师风格和内容相似的响应,同时保持自身语言的自然性。

#### 5.3 跨领域泛化能力
如前所述,在数学推理数据上蒸馏的模型在科学推理任务上也取得了提升。这表明蒸馏的并非特定领域的知识,而是更一般的推理策略,如分解问题、逻辑推导和验证,这些策略可以跨领域迁移。

#### 5.4 训练数据的影响
我们初步探索了训练数据质量和数量的影响。更高质量的证明轨迹(来自更强的教师)带来更大的提升。数据量在达到一定规模后,收益趋于平缓。

#### 5.5 在策略蒸馏长度的影响
蒸馏时生成的最大长度(即允许学生响应的长度)是一个重要超参数。设置过长会导致训练不稳定(如我们最初观察到的),设置过短则限制了学生学习复杂推理的能力。我们发现,将其设置为略大于学生模型原生上下文长度的值(如8192 vs. 8000)通常效果较好,为推理过程提供了适度的额外空间。

#### 5.6 从DeepSeek-V4-Flash蒸馏
我们还将SimpleOPD应用于从另一个强大的长上下文模型DeepSeek-V4-Flash进行蒸馏。初步结果显示,该方法同样有效,学生模型在推理任务上获得了显著改进,验证了SimpleOPD的通用性。

#### 5.7 学生参考KL损失的影响
消融实验表明,学生参考KL损失对于稳定训练至关重要。去除该损失项后,模型再次出现长度爆炸和训练崩溃的问题。KL损失的强度$\beta$需要根据师生模型的能力差距进行调整:差距越大,需要的$\beta$值可能越强,以提供更有力的约束。

## 6 相关工作
#### 6.1 奥赛级长上下文推理
近期研究致力于构建能够解决奥赛级别数学问题的长上下文推理模型。这些模型通常具有强大的长链推理能力,但计算成本高昂。蒸馏是使这些能力更易获取的重要途径。

#### 6.2 在策略蒸馏
在策略蒸馏是知识蒸馏的一种形式,其中教师模型实时评估学生模型生成的输出。与离策略蒸馏相比,它提供了更贴合学生能力的监督信号。SimpleOPD扩展了这一范式,使其能够跨越分词器和上下文长度的差异进行蒸馏。

## 7 结论
我们提出了SimpleOPD,一种简单、分词器无关的在策略蒸馏方法,用于将长上下文推理教师的推理能力迁移到短上下文学生模型。通过引入共享文本空间对齐、学生参考KL损失和终止token屏蔽,我们解决了跨分词器蒸馏中的关键挑战,包括分词器不匹配、分布不匹配和训练不稳定性。实验表明,SimpleOPD在多个模型族和不同能力的学生模型上,能够一致地提升其数学推理和科学推理能力,同时将学生的响应长度稳定在合理的范围内。这项工作为高效地将强大的长上下文推理能力民主化提供了一条实用路径。

相似文章

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

面向多语言数学推理的同策略Delta蒸馏

Hugging Face Daily Papers

本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。