偏离时回溯:缓解大语言模型推理蒸馏中的双重暴露偏差
摘要
本文介绍了一种名为Motab的新型大语言模型推理蒸馏流水线,通过动态监控学生生成并在偏离时回溯到安全状态并借助教师干预,同时缓解离策略和在线策略暴露偏差,取得了约3%的平均性能提升。
arXiv:2605.19433v1 公告类型:新提交
摘要:大语言模型(LLM)通过长思维链(CoT)在复杂推理任务中取得了显著成功,但其巨大的计算开销阻碍了实际部署。大语言模型推理蒸馏通过将推理能力从强大的教师模型迁移到紧凑的学生模型来解决这一问题。然而,现有的蒸馏范式面临一个基本困境。典型的离策略蒸馏严格使用教师生成的黄金轨迹,由于训练分布与学生生成的推理上下文不匹配而产生暴露偏差,导致长思维链推理中的错误级联。为了解决这个问题,在线策略蒸馏允许学生探索自己的轨迹,但我们证明它本质上引入了互逆的反向暴露偏差:当教师模型基于学生生成的次优上下文时,也难提供正向指导。为了解决这一双重暴露偏差问题,我们提出了MOTAB(偏离时回溯监控轨迹),一种新的大语言模型推理蒸馏流水线。具体来说,MOTAB根据自适应安全边界动态监控学生的在线策略生成。当生成偏离并超过此阈值时,MOTAB回溯到最后一个安全状态,并利用教师干预纠正路径。这种方法本质上容忍学生的轻微错误以缓解暴露偏差,同时防止次优上下文以避免反向暴露偏差。在LIMO-v2和AceReason数据集上的大量实验表明,MOTAB有效缓解了双重暴露偏差,在推理任务中取得了约3%的平均性能提升。
查看缓存全文
缓存时间: 2026/05/20 08:25
# 当它偏离时回溯:缓解LLM推理蒸馏中的双重暴露偏差
来源:https://arxiv.org/html/2605.19433
王兵¹,²,³ 闫少天³ 陈晨³ 刘开元⁴ 范思楠⁴ 李希明¹,²,⁶\* 苗瑞³,⁵ 元晓松¹,²,³ 沈占明³,⁴ 叶杰平³
¹吉林大学计算机科学与技术学院
²吉林大学符号计算与知识工程教育部重点实验室
³阿里巴巴通义实验室
⁴浙江大学计算机科学与技术学院
⁵吉林大学人工智能学院
⁶RIKEN先进智能项目中心
\{wangbing1416,zjushenchen,liximing86\}@gmail.com
###### 摘要
大型语言模型(LLM)通过长思维链(CoT)在复杂推理任务中取得了显著成功,但其巨大的计算开销阻碍了实际部署。LLM推理蒸馏通过将推理能力从强大的教师模型迁移至紧凑的学生模型来解决这一问题。然而,现有蒸馏范式面临一个根本性困境。典型的离策略蒸馏严格使用教师生成的黄金轨迹,因训练分布与学生生成的推理上下文不匹配而导致暴露偏差,进而在长思维链推理中引发错误级联。为解决此问题,在策略蒸馏允许学生探索自身轨迹,但我们证明其本质上引入了相反的逆向暴露偏差:当以学生生成的次优上下文为条件时,教师模型也难以提供正向引导。为解决这一双重暴露偏差问题,我们提出**当它偏离时回溯监测轨迹(Motab)**,一种新的LLM推理蒸馏流水线。具体而言,Motab动态监测学生模型在策略生成的轨迹,并设置自适应安全边界。当生成过程偏离并超出该阈值时,Motab回溯至最后一个安全状态,并借助教师干预纠正轨迹方向。该方法内在容忍学生轻微错误以缓解暴露偏差,同时避免次优上下文以规避逆向暴露偏差。在LIMO-v2和AceReason数据集上的大量实验表明,Motab有效缓解了双重暴露偏差,在推理任务中平均性能提升约3%。
## 1 引言
近年来,各种大型语言模型(LLM),例如DeepSeek [11],在需要多步思维链(CoT)[38,34,43,46]的复杂推理任务中展现出卓越能力。尽管效果显著,但在实际应用中部署这些最先进的模型仍计算密集,这促使采用知识蒸馏将其推理能力迁移至更小、更快的的学生模型,即LLM推理蒸馏[1,43,42]。通常,以往的工作大多遵循离策略蒸馏范式[12,27]:教师模型针对一组复杂问题生成大量推理轨迹;这些轨迹随后通过启发式流水线[21,10,14]进行筛选,并用于学生模型的有监督微调。然而,这种离策略方法在实践中面临暴露偏差问题[1,41]。具体来说,在训练阶段,学生模型只使用教师提供的“黄金”轨迹进行优化;而推理时,学生模型面对的是自己生成的次优上下文。这种不匹配必然导致错误级联,尤其在长思维链推理轨迹中[42]。
为缓解该问题,社区近期提出另一种范式,即在策略蒸馏[1,18]。具体而言,学生模型生成自身的推理轨迹,然后通过教师模型提供的密集反馈(例如token概率[1,9,17])进行引导。尽管该方法通过暴露学生自身的推理时轨迹有效消除了暴露偏差,但在本工作中,我们正式且实验性地证明在策略蒸馏也引入了相应的逆向暴露偏差挑战。类比地,当学生生成次优的在策略轨迹作为上下文时,教师模型往往会抑制这些token,难以提供正向监督信号[8]。如图1和图2的实验证据所示,当以学生生成的在策略轨迹为条件时,教师模型与学生模型的下一token概率分布之间始终存在差异,并且教师模型在离策略上下文与在策略上下文下的分布之间的差异随序列长度增加而持续扩大。
因此,为专门解决这些双重暴露偏差,理想的蒸馏数据集应覆盖学生模型自身的次优在策略数据分布以缓解暴露偏差,同时教师模型需在相对准确的学生生成上下文中提供监督以规避逆向暴露偏差,这造成了一个明显的困境。
为实现这些目标,我们提出一种新的LLM推理蒸馏方法,即当它偏离时回溯监测轨迹(Motab)。具体来说,Motab持续监测学生模型的在策略轨迹,并设置自适应安全边界(例如基于教师生成token的熵)。一旦生成步骤超过此阈值,Motab通过信用分配策略回溯至最后一个安全状态,教师模型在此干预以引导后续生成。因此,该方法利用安全边界容忍次优的在策略轨迹,鼓励模型暴露自身错误,从而缓解暴露偏差。当学生模型偏离时,Motab通过回溯识别高质量的在策略上下文,使教师模型能够提供引导,有效解决逆向暴露偏差。
为评估Motab的性能,我们使用Qwen3-32B [43]和gpt-oss-120b [28]作为教师模型,在LIMO-v2 [45]和AceReason [6]数据集的问题上利用Motab生成蒸馏数据,并对三种不同的学生模型进行全参数微调。实验结果表明,我们的方法在复杂推理任务上平均提升约3%的性能,并有效缓解了双重暴露偏差。我们的源代码已发布在仓库 https://github.com/wangbing1416/MOTAB。
总之,我们的贡献可总结为以下三点:
- • 我们正式且实验性地总结了现有离策略和在策略蒸馏方法中存在的根本困境,即双重暴露偏差问题。
- • 为解决此偏差,我们引入Motab,一种新的推理蒸馏框架,它在自适应安全边界内监测学生生成的在策略轨迹,并在学生偏离时回溯至最后一个安全点。
- • 大量实验结果表明,我们的方法一致地提升了LLM推理性能并缓解了双重暴露偏差。
## 2 双重暴露偏差研究
本节我们将正式定义并实验性研究LLM推理蒸馏中的双重暴露偏差。这些偏差的详细理论分析见附录A。
### 2.1 双重暴露偏差的形式化定义
LLM推理及其蒸馏的任务描述。我们将LLM推理过程形式化为自回归序列生成任务。给定初始问题 \(\mathbf{q}\),策略LLM \(\boldsymbol{\pi}\) 生成推理轨迹,包含一系列推理步骤 \(\mathcal{Y} = (\mathbf{y}_1, \mathbf{y}_2, \dots, \mathbf{y}_L)\)。在任意步骤 \(l\),推理上下文 \(\mathbf{s}_l\) 定义为问题与先前生成前缀的拼接:\(\mathbf{s}_l = [\mathbf{q}, \mathbf{y}_{<l}]\)。推理的通常目标是最大化正确推理路径的概率 \(\log \boldsymbol{\pi}(\mathcal{Y} \mid \mathbf{q})\)。
在LLM推理蒸馏中,我们有一个强大的教师模型 \(\boldsymbol{\pi}_T\) 和一个轻量级学生模型 \(\boldsymbol{\pi}_S\)。已有两种主要范式:
**离策略蒸馏** 使用教师生成的固定数据集 \(D_T = \{(\mathbf{q}, \mathcal{Y}^T)\}\),其中 \(\mathcal{Y}^T \sim \boldsymbol{\pi}_T(\cdot \mid \mathbf{q})\),通过下式优化学生模型:
\[
J_{\text{off}} = \mathbb{E}_{(\mathbf{q}, \mathcal{Y}^T) \sim D_T} \left[ - \log \boldsymbol{\pi}_S(\mathcal{Y}^T \mid \mathbf{q}) \right].
\]
在策略蒸馏 使用学生模型自身的生成,并通过教师模型的密集反馈(例如KL散度)提供监督:
\[
J_{\text{on}} = \mathbb{E}_{\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_S}} \sum_l D_{\text{KL}} \left( \boldsymbol{\pi}_T(\cdot \mid \mathbf{s}_{l-1}) \parallel \boldsymbol{\pi}_S(\cdot \mid \mathbf{s}_{l-1}) \right).
\]
其中 \(d^{\boldsymbol{\pi}}\) 表示在策略 \(\boldsymbol{\pi}\) 下的状态分布。
双重暴露偏差。理想情况下,我们希望蒸馏目标同时满足两个条件:
(1) **覆盖性**:训练数据应覆盖学生自身的在策略分布 \(d^{\boldsymbol{\pi}_S}\),以避免训练与推理上下文之间的不匹配(暴露偏差)。
(2) **有效性**:教师模型应在状态 \(\mathbf{s}_{l-1}\) 下提供可靠的监督信号,即教师分布应接近推理目标。然而,在策略蒸馏中,教师上下文中学生状态的次优性导致逆向暴露偏差。
我们形式化地定义暴露偏差和逆向暴露偏差如下:
暴露偏差:由于离策略蒸馏 \(J_{\text{off}}\) 中的状态仅来自教师分布 \(\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_T}\),而推理时 \(\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_S}\),当 \(d^{\boldsymbol{\pi}_T} \neq d^{\boldsymbol{\pi}_S}\) 时,蒸馏损失忽略学生模型推理时可能路径的误差,导致偏差。
逆向暴露偏差:在策略蒸馏 \(J_{\text{on}}\) 使用学生状态 \(\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_S}\),覆盖了推理分布,但有效性条件被违反:当学生生成次优上下文时,\(\boldsymbol{\pi}_T(\cdot \mid \mathbf{s}_{l-1})\) 可能远非理想教师分布,导致学生从不可靠信号中学习。
为系统地阐述这一点,我们为推理蒸馏定义理想目标 \(J_{\text{ideal}}\):
\[
J_{\text{ideal}} = \mathbb{E}_{\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_S}} \mathbb{E}_{\mathbf{y}_l^* \sim \boldsymbol{\pi}^*} \left[ - \log \boldsymbol{\pi}_S(\mathbf{y}_l^* \mid \mathbf{s}_{l-1}) \right],
\]
其中 \(\boldsymbol{\pi}^*\) 是理想推理策略,满足有效性条件(即 \(\mathbf{s}_{l-1}\) 来自学生分布且推理正确)。然而在实践中,\((d^{\boldsymbol{\pi}_S}, \boldsymbol{\pi}^*)\) 的组合是未知的,我们只能从可用的教师分布 \(\boldsymbol{\pi}_T\) 中近似。标准知识蒸馏(SKD)中使用的常见近似是:
\[
J_{\text{SKD}} = \mathbb{E}_{\mathbf{s}_{l-1} \sim d_{\text{mix}}} \mathbb{E}_{\mathbf{y}_l^T \sim \boldsymbol{\pi}_T(\cdot \mid \mathbf{s}_{l-1})} \left[ - \log \boldsymbol{\pi}_S(\mathbf{y}_l^T \mid \mathbf{s}_{l-1}) \right],
\]
其中 \(d_{\text{mix}} = \alpha d^{\boldsymbol{\pi}_S} + (1-\alpha) d^{\boldsymbol{\pi}_T}\) 是混合流。然而,这种混合方法存在 **覆盖性差距**(暴露偏差)和 **有效性差距**(逆向暴露偏差),正如图1和2所证实的。
### 2.2 暴露偏差的实验验证
**离策略蒸馏中的暴露偏差** 我们通过测量两个分布之间的期望KL散度来量化暴露偏差:
\[
\Delta_{\text{exp}} = \mathbb{E}_{\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_S}} D_{\text{KL}} (\pi^*( \cdot \mid \mathbf{s}_{l-1}) \parallel \boldsymbol{\pi}_S(\cdot \mid \mathbf{s}_{l-1})) - \mathbb{E}_{\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_T}} D_{\text{KL}} (\pi^*( \cdot \mid \mathbf{s}_{l-1}) \parallel \boldsymbol{\pi}_S(\cdot \mid \mathbf{s}_{l-1})).
\]
正 \(\Delta_{\text{exp}}\) 表示在策略学生状态下的KL散度高于离策略教师状态下的KL散度,反映了暴露偏差。我们使用GPT-oss-120b [28]作为教师模型,Qwen3-32B [43]作为学生模型,并在LIMO-v2数据集上的问题评估 \(\Delta_{\text{exp}}\)。如图2所示,暴露偏差明显存在且随序列长度增加而累积。
**在策略蒸馏中的逆向暴露偏差** 我们通过检测教师模型在离策略与在策略上下文下的分布一致性来量化逆向暴露偏差:
\[
\Delta_{\text{rev}} = \mathbb{E}_{\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_S}} D_{\text{KL}} (\boldsymbol{\pi}_T(\cdot \mid \mathbf{s}_{l-1}) \parallel \boldsymbol{\pi}_T^*(\cdot \mid \mathbf{s}_{l-1})).
\]
如图1所示,逆向暴露偏差始终为正,且当学生偏离正确推理路径时显著增大。
## 3 方法
### 3.1 自适应安全边界监测
为识别学生推理何时偏离可接受路径,我们提出一种自适应安全边界,由教师导向的价值函数参数化:
\[
V_T(\mathbf{s}_{l-1}, \mathbf{y}_l^S) = \log \boldsymbol{\pi}_T(\mathbf{y}_l^S \mid \mathbf{s}_{l-1}) + \alpha H\left(\boldsymbol{\pi}_T(\cdot \mid \mathbf{s}_{l-1})\right),
\]
其中 \(H(\cdot)\) 是熵,\(\alpha > 0\) 是缩放因子。若 \(V_T(\mathbf{s}_{l-1}, \mathbf{y}_l^S) \geq \gamma(\mathbf{s}_{l-1})\),则该步骤被视为安全,状态正常转移至 \(\mathbf{s}_l = [\mathbf{s}_{l-1}, \mathbf{y}_l^S]\)。此机制保证学生逻辑上合理(尽管风格上可能不同)的探索得以保留。
### 3.2 通过信用分配进行状态回溯
当学生生成违反安全边界时(即 \(V_T < \gamma(\mathbf{s}_{l-1})\)),检测到关键逻辑崩溃。然而,直接替换当前步骤 \(\mathbf{y}_l^S\) 是短视的,因为逻辑错误通常有延迟(例如,步骤 \(l-2\) 建立的错误前提在步骤 \(l\) 才表现为数学矛盾)。此外,强制教师从有缺陷状态 \(\mathbf{s}_{l-1}\) 进行纠正违反了有效性条件,会触发逆向暴露偏差。为解决此问题,Motab 采用信用分配策略 [25,29] 回溯至安全分叉步骤。具体而言,我们计算沿历史轨迹的步进时间差误差 \(\delta_k\) [33,40] 以识别逻辑偏离教师安全流形的精确时刻:
\[
\delta_k = V_T(\mathbf{s}_{k-1}, \mathbf{y}_k^S) - V_T(\mathbf{s}_{k-2}, \mathbf{y}_{k-1}^S), \quad \forall k \in \{1, \dots, l\}.
\]
安全步骤 \(l^*\) 被识别为具有最严重 oracle 值退化的节点,并严格约束前驱状态保持安全:
\[
l^* = \arg\min_{k \leq l} (\delta_k) \quad \text{s.t.} \quad V_T(\mathbf{s}_{l^*-2}, \mathbf{y}_{l^*-1}^S) \geq \gamma(\mathbf{s}_{l^*-2}).
\]
通过定位 \(l^*\),Motab 将推理过程严格回滚至最后一个纯净上下文 \(\mathbf{s}_{l^*-1}\)。这从结构上使教师远离任何分布外次优步骤,确保后续教师监督不受逆向暴露偏差污染。
### 3.3 离策略轨迹拼接
确定安全前缀 \(\mathbf{s}_{l^*-1}\) 后,查询教师策略 \(\boldsymbol{\pi}_T\) 以生成有效的离策略纠正后缀 \(\mathcal{Y}_{l^*:T}^T\):
\[
\mathcal{Y}_{l^*:T}^T \sim \boldsymbol{\pi}_T(\cdot \mid \mathbf{s}_{l^*-1}).
\]
由于 \(\mathbf{s}_{l^*-1}\) 属于教师的有效支持流形,\(\boldsymbol{\pi}_T\) 提供高度自信且准确的引导。为构建用于微调的最终轨迹,我们并非直接使用 \([\mathbf{s}_{l^*-1}, \mathcal{Y}_{l^*:T}^T]\),而是无缝拼接学生的次优探索、显式语义转换和教师修正。具体而言,我们保留学生至不安全步骤 \(l\) 的完整有缺陷轨迹作为负面暴露。附加一个离散的语义修正 token 记为 [REV](例如 "However"),以异步方式将纯净修正拼接至有缺陷上下文:
\[
\boldsymbol{\tau}_{\text{SFT}} = \left[\mathbf{q}, \mathcal{Y}_{1:l}^S\right] \oplus \texttt{[REV]} \oplus \mathcal{Y}_{l^*:T}^T.
\]
在微调过程中,通过让学生模型以次优在策略状态为条件来预测 [REV] 并输出从 \(l^*\) 开始的正确步骤,学生明确学习到:(1) 在其自身生成分布内稳健运行(缓解暴露偏差),(2) 识别自身的逻辑漂移,(3) 使用有效的 oracle 目标进行自我修正(绕过逆向暴露偏差)。
### 3.4 与理想目标的理论对齐
为从理论上验证 Motab,我们展示其与 Eq. (3) 中理想目标 \(J_{\text{ideal}}\) 的一致性,并说明它如何解决 Eq. (4) 中 SKD 固有的覆盖性和有效性差距。在 Motab 中,学生策略通过动态拼接轨迹上的最大似然估计进行优化。期望经验损失 \(J_{\text{Motab}}(\boldsymbol{\pi}_S)\) 可分解为依赖于自适应边界的分段形式:
\[
J_{\text{Motab}}(\boldsymbol{\pi}_S) = \mathbb{E}_{\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_S}} \mathbb{E}_{\mathbf{y}_l^S \sim \boldsymbol{\pi}_S} \Big[ \mathbb{I}_{[V_T \geq \gamma(\mathbf{s})]} \left[ -\log \boldsymbol{\pi}_S(\mathbf{y}_l^S \mid \mathbf{s}_{l-1}) \right] + \mathbb{I}_{[V_T < \gamma(\mathbf{s})]} \mathbb{E}_{\mathcal{Y}^T \sim \boldsymbol{\pi}_T(\cdot \mid \mathbf{s}_{l^*-1})} \left[ -\log \boldsymbol{\pi}_S(\texttt{[REV]} \oplus \mathcal{Y}^T \mid \mathbf{s}_{l-1} \oplus \mathbf{y}_t^S) \right] \Big].
\]
通过比较 Eq. (11) 与 \(J_{\text{ideal}}\),我们证明 Motab 严格满足两个前提条件:与 SKD 将状态限制在窄混合分布 \(d_{\text{mix}}\) 不同,Eq. (11) 严格在 \(\mathbf{s}_{l-1} \sim d^{\boldsymbol{\pi}_S}\) 上操作;同时,对于违反安全边界的情况,它使用来自有效安全前缀 \(\mathbf{s}_{l^*-1}\) 的教师修正,满足有效性条件。因此,Motab 同时解决了覆盖性差距和有效性差距,提供了理论保证的双重暴露偏差缓解。相似文章
用于LLM推理的自适应教师暴露自蒸馏方法
自适应教师暴露自蒸馏(ATESD)通过可学习的策略控制器和折扣学习进度奖励动态调整教师向学生展示参考推理的比例,从而提升LLM推理能力。在数学基准上的实验表明,该方法相较于现有自蒸馏和强化学习基线均取得了一致改进。
通过近未来引导弥合在线蒸馏中的推理轨迹
本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。
面向Lean定理证明的LLM反馈蒸馏
提出反馈蒸馏(Feedback Distillation),一种利用来自LLM的token级监督来改进复杂推理的训练方法,在Lean 4定理证明上进行了评估。该方法比GRPO更好地保持了多样性,且两种方法互补。
在策略自蒸馏中尊重自不确定性以实现高效LLM推理
本文提出了EGRSD和CL-EGRSD,这是在策略自蒸馏方法,通过教师熵对令牌级监督进行加权,以改善大语言模型推理准确性-长度的权衡,并在Qwen3-4B和Qwen3-8B上进行了评估。
通过混合策略蒸馏进行推理压缩
本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。