更好的起点,更好的终点:压缩推理的自举迭代自推理蒸馏

arXiv cs.CL 论文

摘要

提出了BIRD,一种两阶段自推理蒸馏方法,该方法在策略训练之前自举简洁的推理轨迹,在MATH-500和AIME基准测试上实现了更强的精度-效率权衡。在Qwen3-8B上,准确率从86.2%提升至92.0%,同时平均响应长度从3,099个token降至1,115个token。

arXiv:2607.15736v1 Announce Type: new 摘要:大型推理模型通常通过长思维链轨迹来解决问题,但其中大量计算耗费在冗余推导、重复自我验证和不会改善最终答案的绕路上。现有的在策略自蒸馏方法通过将学生模型匹配到其自身rollout采样前缀上的简洁副本,来降低这一成本。我们表明该目标存在初始化瓶颈。由于监督仅应用于已访问的前缀,从冗长的基模型开始训练会将KL损失置于常含噪声、冗余或已偏离轨道的上下文中。在这些区域,简洁教师只能提供局部修正,而学生继续探索高效推理者应避免的轨迹。本文提出BIRD(自举迭代自推理蒸馏),一种在策略训练之前改善rollout分布的两阶段自推理蒸馏方法。BIRD首先在简洁性指令下从基模型采样简洁解,仅保留答案正确的轨迹,并进行轻量级提示切换SFT步骤。这些轨迹在简洁性指令下生成,但在原始任务提示下学习,从而将指令诱导的简洁性转变为默认推理行为。从该预热模型开始,BIRD随后应用具有简洁自教师的在策略反向KL散度蒸馏,此时基于更清晰且信息更丰富的前缀。在Qwen3系列模型上,BIRD在MATH-500和AIME基准测试中实现了比提示方法和冷启动在策略蒸馏更强的精度-效率权衡。在Qwen3-8B上,它将MATH-500准确率从86.2%提升至92.0%,同时将平均响应长度从3,099个token降至1,115个token。这些结果突显了前缀支持作为高效推理蒸馏的核心因素。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:34

# 更好的起点,更好的终点:用于压缩推理的自举迭代自推理蒸馏

###### 摘要

大型推理模型通常通过长思维链(CoT)轨迹来解决问题,但其中大量计算消耗在冗余推导、重复自我验证和不会改进最终答案的绕路上。现有的在线策略自蒸馏方法通过将学生模型与从其自身 rollout 采样的前缀上的自身简洁副本进行匹配来降低这一成本。我们表明,该目标存在初始化瓶颈。由于监督仅应用于已访问的前缀,从冗长的基础模型进行训练会将KL散度损失置于通常噪声大、冗余或已偏离正轨的上下文中。在这些区域中,简洁教师只能提供局部修正,而学生模型会继续探索高效推理器应避免的轨迹。在本文中,我们提出了BIRD(自举迭代自推理蒸馏),这是一种两阶段自推理蒸馏方法,它能在在线策略训练之前改进rollout分布。BIRD首先在简洁指令下从基础模型采样简洁解决方案,仅保留答案正确的轨迹,并执行轻量级提示切换SFT步骤。轨迹是在简洁指令下生成的,但在原始任务提示下学习,从而将指令引发的简洁性转化为默认推理行为。从该热身模型出发,BIRD随后应用在线策略逆KL蒸馏,配合简洁自教师,此时作用于更清晰、信息更丰富的prefix上。在Qwen3系列模型上,BIRD在MATH-500和AIME基准测试中实现了比提示方法和冷启动在线策略蒸馏更强的准确率-效率权衡。在Qwen3-8B上,它将MATH-500准确率从86.2%提升至92.0%,同时将平均响应长度从3,099个token减少至1,115个token。这些结果凸显了prefix支持是高效推理蒸馏的一个核心因素。

关键词:大型语言模型,思维链,在线策略自蒸馏

参见图1 (https://arxiv.org/html/2607.15736#S0.F1)说明:Prefix支持决定了在线策略KL监督应用于何处。冷启动OPSD和热启动OPSD使用相同的简洁教师构建方式,但它们诱导出不同的学生rollout。从基础模型开始会使KL损失暴露在噪声或偏离轨道的prefix上,此时下一token目标可能分散且对压缩无用。BIRD首先应用SFT自举,将已访问的prefix转向更清晰的推理上下文。然后,相同的prefix局部KL目标在更尖锐的教师目标上进行评估,并达到更高的压缩前沿。

## 1 引言

思维链(CoT)推理已成为大型语言模型的核心能力,使得通过显式的中间步骤来解决复杂问题成为可能[wei2022chain, huang2026cfms]。然而,这种能力也使得推理成本大幅增加。推理轨迹通常跨越数千个token,并且包含大量冗余,包括重复推导、重新审视结论以及过度自我验证[zhao2025revisiting, li2026making, chiang2024over, zhang2026llms, wei2025stop]。在许多情况下,这些额外计算对最终答案贡献甚微,使得推理长度成为高效部署的主要障碍。推理压缩通过缩短生成的轨迹同时保持并理想情况下提高任务准确率来解决这个问题。

最近的工作探索了实现这一目标的几条途径。无训练方法通过简洁提示、早停或自我纠正在推理时控制推理过程[renze2024benefits, yang2025dynamic, wu2026intern]。基于RL的方法引入长度敏感奖励以阻止不必要的token[aggarwal2025l1, wan2026mitigating, li2026stepwise, li2026leash]。基于SFT的方法模仿从静态数据集收集的压缩轨迹,通常使用外部模型作为轨迹生成器[xia2025tokenskip, zhang2026chain, ma2025cot, fan2026ctrlcot]。从分布匹配的角度来看,这些方法可以视为将模型转向更简洁推理分布的不同方式[zhang2026llms, wei2025stop, zhang2026pointcot]。在线策略自蒸馏(OPSD)提供了一种自包含的替代方案,其中模型本身在简洁指令条件下充当动态简洁教师[zhao2026self, sang2026crisp]。这消除了在蒸馏过程中对外部教师的需求,表明简洁推理行为已经潜在于基础模型中。

然而,一个关键限制在于OPSD应用其监督的支撑区域。目标是prefix局部的:在每次更新时,学生首先采样一个rollout,KL损失仅在该rollout访问的prefix y_{<t} 上进行评估[agarwal2024policy, zhang2026opsdl]。因此,简洁教师并非在一个抽象的高质量解决方案空间上被查询,而是在当前学生产生的具体部分轨迹上被查询。当从冗长的基础模型开始训练时,这些早期轨迹通常充满噪声、冗余且不可靠[sui2025stop, zhao2026rosd]。一旦某个prefix已经包含绕路、不必要的自我检查或不正确的中间步骤,教师就必须基于该已降级的上下文进行条件化。由此产生的信号可以在局部纠正下一个token,但它仍然锚定在高效推理器应避免的轨迹区域上。

这就产生了冷启动prefix支持瓶颈。冷启动OPSD和热启动OPSD可能使用相同的简洁教师构建方式,但它们将教师暴露于不同的prefix分布。如图1 (https://arxiv.org/html/2607.15736#S0.F1) 所示,冷启动训练将KL目标置于继承自基础模型冗长rollout的prefix上。更好的初始化会在在线蒸馏开始之前改变学生的rollout支持,使得相同的KL目标能够在更短、更可靠、信息更丰富的推理上下文中运作。因此,核心问题不仅在于如何构建一个简洁教师,还在于如何使学生访问那些教师能提供有用压缩信号的prefix。BIRD(自举迭代自推理蒸馏)正是围绕这一观察设计的。该方法保持简洁自教师不变,而是重塑教师被查询的rollout分布。它首先在正确性过滤的自生成简洁轨迹上执行轻量级基于LoRA的离线自举[hu2022lora]。这些轨迹是在简洁指令下从基础模型采样的,但在原始任务提示下学习。这种提示切换将指令引发的简洁性转化为默认推理行为,而非推理时的产物。从该热身模型开始,OPSD将prefix局部KL更新集中在更清晰的推理上下文上,而不是冷启动rollout产生的噪声或偏离轨道的prefix。

在Qwen3系列模型[yang2025qwen3]和DeepSeek-R1-Distill-Llama[guo2025deepseek]上进行的实验,跨越MATH-500、AIME 2024和AIME 2025基准测试,在准确率-效率权衡方面显示出一致的改进。与提示方法和冷启动OPSD相比,BIRD产生更短的轨迹,同时保持或提高准确率。训练动态进一步表明,冷启动OPSD收敛到较低的压缩前沿,并且通过更长时间优化也无法弥合差距。随着模型规模的增大和跨模型家族迁移,收益变得更加强劲,突显了prefix支持是在线策略推理压缩中的一个核心因素。贡献总结如下:

- •据我们所知,本文首次将冷启动prefix支持瓶颈确定为在线策略推理压缩中的一个关键失败模式,其中prefix局部KL监督应用于冗长、冗余或偏离轨道的学生轨迹。
- •我们为OPSD制定了一个支撑放置原则:简洁自教师的有效性不仅取决于其定义的目标分布,还取决于该目标被查询的rollout prefix。
- •我们引入了BIRD,一种自举迭代推理蒸馏方法,它使用正确性过滤的简洁轨迹来热启动学生,然后在更清晰、信息更丰富的prefix支持上执行OPSD。
- •在Qwen3和DeepSeek-R1-Distill-Llama上跨越MATH-500、AIME 2024和AIME 2025的大量实验表明,BIRD始终优于提示方法和冷启动OPSD的准确率-效率前沿。

## 2 相关工作

### 2.1 带长度惩罚的强化学习

基于RL的方法通过重塑奖励空间来鼓励压缩。L1 [aggarwal2025l1] 使用GRPO将推理模型条件化到目标长度,实现可控推理深度。DiPO [wan2026mitigating] 从自生成推理统计中推导出难度信号,并用其调节长度惩罚。SwAP [li2026stepwise] 基于在线策略log概率改进应用步级自适应惩罚,将惩罚集中于低重要性推理步骤。Leash [li2026leash] 自适应调整长度惩罚,使得大型推理模型能够在保持准确率的同时缩短输出。这些方法直接优化准确率-效率权衡,但其有效性依赖于奖励设计,并且通常需要仔细调整惩罚强度以平衡正确性和简洁性。

### 2.2 在压缩思维链上进行监督微调

基于SFT的方法在收集的[tang2026、guo2026、wang2026]或离线构建的[zhang2026pointcot, zhang2025not, zhang2026not]压缩推理轨迹上进行训练。TokenSkip [xia2025tokenskip] 学习识别并跳过低重要性推理token。V-Skip [zhang2026chain] 使用视觉锚定信息瓶颈进行选择性token剪枝。CoT-Valve [ma2025cot] 识别控制推理长度的参数空间方向,而 CtrlCoT [fan2026ctrlcot] 将语义抽象与逻辑保持剪枝相结合。该系列的主要优势在于其简单性,因为所需的压缩行为由训练数据明确指定。其局限性在于潜在的分布不匹配:学生是在静态轨迹上训练的,这些轨迹可能与其在推理时生成的轨迹不同。

### 2.3 在线策略自蒸馏

OPSD [zhao2026self] 将教师条件化于真实答案,提高了相对于RL的样本效率。TIP [xu2026tip] 进一步从token重要性角度研究在线策略蒸馏,在训练中赋予信息量更大的token更高权重。FiRe-OPD [li2026filter] 重新思考了OPD优化的粒度,首先过滤低质量轨迹,然后根据学习价值对保留轨迹内的token进行软重加权。CRISP [sang2026crisp] 表明,仅靠简洁指令即可作为教师上下文,消除了在蒸馏过程中对真实答案的需求。然而,现有的OPSD方法主要关注教师构建或token加权,而较少关注实际应用蒸馏的prefix支持。

## 3 方法

### 3.1 预备知识与分布匹配视角

一个具有参数θ的语言模型π_θ定义了token序列上的条件分布。给定输入提示x,模型自回归地生成输出序列 y = (y_1, y_2, ..., y_T)。在解码步骤t,下一个token的分布取决于原始提示和先前生成的prefix y_{<t},后者代表了当前的部分推理状态。完整响应的概率分解为:

π_θ(y|x) = ∏_{t=1}^T π_θ(y_t | x, y_{<t}), (1)

其中 y_{<t} = (y_1, ..., y_{t-1}) 表示生成到位置 t-1 的prefix。这种prefix条件化的视角对于具有扩展生成轨迹的推理模型尤为重要。中间token不仅是表面实现,还决定了后续推理步骤和最终答案生成的上下文。

在推理任务中,y通常包含一个推理轨迹r后跟一个最终答案a。因此,推理压缩可以视为修改π_θ(y|x),以倾向于更短、更直接的轨迹,同时保持正确性。我们使用分布匹配作为统一的正式视角。设π_target表示由推理时控制、奖励塑造、离线轨迹或动态自教师诱导的简洁目标分布。压缩可以写为:

min_θ D(π_θ, π_target), (2)

其中各种方法不仅在于如何构建π_target,也在于匹配损失在何处评估有所不同。

参见图2 (https://arxiv.org/html/2607.15736#S0.F2)说明:BIRD概述。阶段1从每个问题的一个自生成简洁轨迹构建静态目标,通过真实答案验证进行过滤,并应用提示切换SFT。轨迹是在简洁指令 x+c 下生成的,但在原始提示 x 下学习。这种离线自举将学生从可能包含绕路和自检的冷prefix支持,转移到更简洁、直接且在轨的热支持。阶段2然后从该热启动执行prefix局部逆KL自蒸馏,仅使用简洁教师作为动态目标,不使用真实答案。

算法1 BIRD:自举迭代自推理蒸馏

输入:基础模型 π_θ₀,数据 D,指令 c

输出:压缩模型 π_θ*

1:阶段1:自举简洁prefix支持

2:
D_filtered ← ∅
3:for each (x_i, GT_i) ∈ D do

4:
采样 y_i ∼ π_θ₀(·| x_i, c)
5:
提取 â_i = answer(y_i)
6:
if â_i = GT_i then
7:
ỹ_i ← Truncate(y_i, T_SFT)
8:
D_filtered ← D_filtered ∪ {(x_i, ỹ_i)}
9:
end if
10:end for

11:
θ_SFT ← LoRA-SFT(θ₀, D_filtered; (x_i + c) → x_i)
12:设置 θ ← θ_SFT
13:阶段2:热启动在线策略自蒸馏

14:
θ̄ ← StopGrad(θ)
15:for training step k = 1, 2, ..., K do

16:
if k mod M = 0 then
17:
θ̄ ← StopGrad(θ)
18:
end if
19:
采样一个批次 B ⊂ D
20:
for each x_i ∈ B do
21:
采样学生rollout y_i ∼ π_θ(·| x

相似文章

基于策略蒸馏的推理递归自我改进

arXiv cs.CL

本文提出一个递归框架,通过动态协同进化和自我精炼简洁学习来改进基于策略的自我蒸馏,以增强推理能力。在Qwen3-8B模型上跨数学基准展示了显著提升。

通过混合策略蒸馏进行推理压缩

arXiv cs.AI

本文提出了混合策略蒸馏(MPD),这是一个将大教师模型的简洁推理行为转移到更小规模的学生模型的框架,在提升性能的同时,将令牌(token)使用量最多降低了27.1%。

压缩-蒸馏:面向高效知识蒸馏的推理轨迹压缩

Hugging Face Daily Papers

本文提出在知识蒸馏前对推理轨迹进行压缩,以降低计算成本和推理长度。实验表明存在准确率与效率的权衡:压缩轨迹保留了原始轨迹最多96%的准确率,同时每token效率提升高达18倍。

通过推理空间压缩的结构化理由蒸馏

arXiv cs.CL

本文提出了 D-RPC,一种通过将推理路径压缩为可复用库,从而将大型语言模型的推理能力蒸馏给较小模型的方法,该方法在数学和常识基准测试中实现了更好的性能和一致性。

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

Hugging Face Daily Papers

提出反自蒸馏(AntiSD),该方法逆转自蒸馏中的知识转移方向,以提高数学推理的效率和准确率,在4B到30B参数的多个模型上,用2-10倍更少的训练步数达到GRPO基线的准确率,最终准确率最高提升11.5个百分点。