在线自蒸馏中Thinking Collapse的诊断与缓解
摘要
本文识别了大型语言模型在On-Policy Self-Distillation中的'Thinking Collapse'现象,其特点是中间推理步骤的减少,并提出了AD-OPSD控制框架,通过将高风险抑制令牌锚定到参考先验来缓解这种崩溃。该方法在数学基准测试上实现了高达+4.1%的绝对平均准确率提升。
arXiv:2607.10805v1 公告类型:新
摘要:在线自蒸馏(On-Policy Self-Distillation, OPSD)已成为增强和对齐大型语言模型的关键范式。然而,在复杂推理任务中,OPSD反而降低了下游性能。本文系统性地研究了这一病理现象,并识别出一个严重的优化陷阱,我们称之为 **Thinking Collapse** —— 模型原生中间推理行为的急剧下降,通过epistemic-token密度(每千令牌ET)测量。通过基于熵的梯度掩码和令牌级目标分析,我们表明这种崩溃是由高学生熵决策分支处的激进教师梯度触发的,其中学生认知令牌经常被压制为教师非认知目标,并且高度集中在高逐点师生散度区域。为了解决这一优化病理,我们提出了 **AD-OPSD**(自适应双视角在线自蒸馏),一种鲁棒的控制框架,动态调节自蒸馏目标。AD-OPSD通过一个非对称逐点散度门,将高风险抑制的沙盒令牌选择性锚定到来自冻结基模型的参考先验,从而保留原生思考能力,同时保持OPSD的错误纠正能力。在竞争性数学基准测试上的大量实验表明,AD-OPSD在不同模型规模和数据集上,相比标准OPSD平均准确率绝对提升了高达 **+4.1%**。进一步分析表明,AD-OPSD缓解了思考崩溃,并鲁棒地泛化到不同的训练后范式。
查看缓存全文
缓存时间: 2026/07/14 04:22
# 诊断与缓解策略内自蒸馏中的思维崩溃 来源:https://arxiv.org/html/2607.10805 彭柯钦1,李晨1,欧阳元新1,袁衍成2∗,丁亮3 1北京航空航天大学2香港理工大学3阿里巴巴集团 keqin\.peng@buaa\.edu\.cn liangding\.liam@gmail\.com ###### 摘要 策略内自蒸馏(OPSD)已成为增强和对齐大型语言模型(LLM)的关键范式。然而,在复杂推理任务中,OPSD 反而会降低下游性能。在本文中,我们系统地研究了这一病态现象,并识别出一个我们定义为**思维崩溃**的严重优化陷阱——即模型原生中间推理行为的急剧下降,以认知性标记密度(每千词认知性标记数)衡量。通过基于熵的梯度掩码和词元级目标分析,我们表明这种崩溃是由高学生熵决策分支处的激进教师梯度触发的,在这些分支中,学生的认知性标记经常被抑制为教师的非认知性目标,并且高度集中在高逐点师生散度区域。为了解决这一优化病理问题,我们提出了**自适应双视角 OPSD(AD-OPSD)**,一个动态调节自蒸馏目标的鲁棒控制框架。AD-OPSD 选择性地将通过一个非对称逐点散度门函数从冻结基模型导出的参考先验锚定到高抑制风险的沙箱词元上,从而在保留 OPSD 纠错能力的同时,保持原生的思考能力。在竞争性数学基准上的大量实验表明,在不同的模型规模和数据集上,AD-OPSD 相对于标准 OPSD 的绝对平均准确率提升高达 **+4.1%**。进一步的分析表明,AD-OPSD 缓解了思维崩溃,并能鲁棒地泛化到不同的后训练范式。 诊断与缓解策略内自蒸馏中的思维崩溃 彭柯钦1,李晨1,欧阳元新1,袁衍成2∗,丁亮3††thanks:通讯作者。1北京航空航天大学2香港理工大学3阿里巴巴集团 keqin\.peng@buaa\.edu\.cn liangding\.liam@gmail\.com ## 1 引言 近年来,策略内自蒸馏(OPSD)已成为增强和对齐大型语言模型的关键范式 (Zhao et al., 2026; Shenfeld et al., 2026; Hübotter et al., 2026)。通过将教师模型的以真实结果为条件的策略内目标分布蒸馏到学生策略在其自身采样轨迹上的分布,OPSD 避免了非策略模仿的暴露偏差和强化学习的稀疏奖励瓶颈。这种密集的词元级监督在通用对齐和偏好调整任务中取得了显著成功。然而,当应用于复杂推理任务时,OPSD 反而会降低下游性能 (Kim et al., 2026b; Kaur et al., 2026)。先前的研究将这种退化归因于对认知性言语化过程的抑制 (Kim et al., 2026b) 或在高熵决策点的相关“分支抑制” (Kaur et al., 2026)。然而,这些工作主要记录了经验性症状;这种抑制在**何处**以及**为何**发生的基本机制仍不清楚,这使得如何在**不**损失 OPSD 纠错能力的情况下解决这个优化陷阱仍然是一个未解决的挑战。 在本文中,我们系统地研究了这一病态现象,识别出一个我们定义为**思维崩溃**的严重优化陷阱——即模型原生中间推理步骤的急剧下降,以每千个生成词元中的认知性标记数(每千词认知性标记数)衡量。为了理解其机制,受 Wang 等人 (2026) 和 Xu 等人 (2026) 关于推理更新和关键决策分支大量集中在高熵词元小集合上的发现启发,我们提出了一种基于熵的梯度掩码诊断实验,以定位思维崩溃的空间边界。我们发现,对高学生熵词元进行梯度掩码能显著恢复思维密度,但也暴露了一个校正权衡。具体来说,仅对学生熵前 20% 的词元进行自蒸馏梯度掩码,就能将模型的原始思维密度从 OPSD 崩溃后的 7.9 恢复到 9.8(每千词认知性标记数),但仍无法恢复下游准确率。此外,我们进行了初始化时的微观词元级差异变迁分析,发现了一个实质性的 top-1 目标差异:学生预测的 top-1 认知性标记被教师的非认知性标记强行抑制。最后,在主动抑制区域($\log P_s > \log P_t$)内绘制学生的认知空间,发现原生思考步骤密集集中在高逐点散度区域,这支持了将逐点师生散度作为抑制风险的鲁棒指标。 为了解决这一优化病理问题,我们提出了**自适应双视角 OPSD(AD-OPSD)**,一个动态调节自蒸馏目标的鲁棒控制框架。AD-OPSD 摒弃二值词元掩码,采用一种连续的、非对称的软门控机制。在一个局部高熵沙箱内,它通过一个 sigmoid 逐点 KL 门函数,选择性地将高抑制风险的词元锚定到从冻结基模型导出的参考先验上。这动态地保护了模型在主动抑制下的原生探索性推理路径,同时允许教师在事实性词元上的标准校正梯度以完整强度传播。在多个竞争性基准上的大量实验表明,AD-OPSD 能持续恢复思维密度,并在不同模型规模和数据集上,相较于标准 OPSD 带来高达 **+4.1%** 的绝对平均准确率提升。进一步的讨论证实,AD-OPSD 缓解了思维崩溃,并能鲁棒地泛化到不同的后训练对齐配置,例如学生非思考设置。 总之,我们的**贡献**主要有三点: - • 我们通过多尺度证据链诊断了推理型 OPSD 中的**思维崩溃**:基于熵的梯度掩码将失败定位到高学生熵决策分支;词元级目标分析揭示了初始化时严重的学生认知性标记→教师非认知性标记差异;逐点散度映射识别了用于实时干预的高风险抑制区域。 - • 我们提出了 **AD-OPSD**,这是一个学生端、词元级的后训练框架,它通过一个非对称的逐点散度门函数,动态地将高风险抑制词元锚定到冻结的基模型参考先验上,从而在保留教师校正监督的同时,维持原生的探索性推理。 - • 在竞争性数学基准和多种模型家族上的广泛评估表明,AD-OPSD 缓解了思维崩溃,恢复了思维密度,并相较于标准 OPSD 取得了高达 **+4.1%** 的绝对平均准确率提升,且能鲁棒地泛化到非思考的对齐配置中。 ## 2 OPSD 中的思维崩溃 尽管策略内自蒸馏(OPSD)在标准对齐任务中被证明非常有效,但将其应用于推理模型却揭示了一种矛盾性的性能退化。先前的研究 (Kim et al., 2026b; Kaur et al., 2026) 将这种退化追溯到对认知性言语化或分支词元的抑制。受这些开创性发现的启发,我们引入**思维密度**这一量化指标来表示模型的探索性**思考强度**,并研究这种行为在不同自蒸馏配置下如何变化。具体来说,虽然先前文献常测量生成轨迹中认知性标记(ET)的绝对数量 $E(y) = \sum_t \text{count}(t, y)$,但该原始计数对序列长度变化高度敏感。为了建立一个鲁棒的、与长度无关的模型底层思考强度代理指标,我们正式将**思维密度**定义为每 1,000 个生成词元中认知性标记的频率: 思维密度 $= \frac{\sum_{t \in \mathcal{T}} \text{count}(t, y)}{L(y)} \times 1000$ (1) 其中 $L(y)$ 是序列总长度,$\mathcal{T}$ 代表 10 个认知性标记的集合,作为规划、不确定性外化和回溯的指标 (Kim et al., 2026b): $\mathcal{T} = \{ \text{wait}, \text{hmm}, \text{perhaps}, \text{maybe}, \text{actually}, \text{alternatively}, \text{seems}, \text{might}, \text{likely}, \text{check} \}$ (2) 为了实证验证自蒸馏对思维密度的影响,我们在 AIME25 基准上使用不同的 OPSD 配置训练 Qwen3-1.7B,包括思考学生/思考教师(T/T)和非思考学生/思考教师(NT/T)设置。实证结果如图 1 所示,揭示了一个严重的优化病理现象。标准 OPSD(T/T)严重抑制了学生的思维密度——从基线的 10.3(每千词认知性标记数)急剧崩溃至 7.9——同时导致下游准确率从 38.1% 下降至 33.9%(-4.2% 的退化)。相反,在训练期间禁用学生思考(NT/T)则能在评估时保持健康的思维密度 11.1,使得准确率攀升至 42.2%(相较于基线提升 +4.1% 的绝对提升)。这种紧密的关联强烈表明,OPSD 的推理退化与**思维崩溃**这一病理现象密切相关,该现象抑制了模型的探索性中间推理步骤。 图 1 说明:Qwen3-1.7B 在 AIME25 上不同 OPSD 蒸馏模式下的准确率与思维密度(每千词认知性标记数)。学生思考模式(T/T)下的策略内自蒸馏严重损害了推理性能,这与思维密度的急剧崩溃高度相关。 尽管图 1 中 NT/T 取得了最强的准确率,但它引入了一个跨模式蒸馏因素:非思考学生向思考教师学习。这使得难以确定观察到的增益是来自 OPSD 本身还是来自模式级迁移。相比之下,T/T 使学生和教师处于相同的思考模式,从而为诊断 OPSD 如何直接影响模型自身的推理轨迹提供了一个更清晰的设置。因此,我们随后的诊断分析将聚焦于 T/T,因为它揭示了 OPSD 抑制模型内在探索和回溯行为时的核心失效模式。 ## 3 诊断思维崩溃的原因 虽然第 2 节确立了推理型 OPSD 中思维崩溃的经验存在,但这种抑制在**何处**以及**为何**发生的基本机制仍不清楚。为了揭示这一病理现象的根本原因,我们通过三个分析阶段进行了系统、多尺度的诊断研究: - • **基于熵的梯度掩码(第 3.1 节)**:我们在反向传播过程中根据学生熵进行目标词元掩码,以空间上隔离和定位思维崩溃的主要区域。 - • **词元级差异分析(第 3.2 节)**:我们分析初始化时的静态目标分布,以研究关键决策分支处认知性标记上的微观目标差异。 - • **逐点散度映射(第 3.3 节)**:我们研究逐点 KL 散度的统计特性,以考察其与思维崩溃的相关性,并验证其作为动态引导指标的潜力。 这一诊断路线图直接揭示了思维崩溃的底层优化病理,为我们提出的自适应双视角 OPSD(AD-OPSD)框架提供了经验基础。 图 2 说明:**综合 OPSD 诊断**:词元级掩码与微观目标差异。子图 (a) 和 (b) 展示了基于熵的掩码下的 OPSD 性能(左:思维密度,右:准确率%)。子图 (c) 显示了初始化时(步骤 0)按学生熵百分位数降序排列下的累积学生 ET 计数(左,蓝色曲线)和累积 ET 到非 ET 目标差异变迁次数(右,橙色曲线)。两个掩码图均包含基线和标准 OPSD(未掩码)作为参考基线。 ### 3.1 通过基于熵的梯度掩码定位思维崩溃 为了研究思维崩溃在生成序列中发生于何处以及如何发生,我们分析了 OPSD 性能和思维密度对目标词元掩码的响应。在推理模型中,只有一小部分词元表现出高熵,作为关键决策分支将模型导向不同的推理路径 (Wang et al., 2026)。受此启发,我们从学生熵 $H(y_i \mid y_{<i})$ 的角度研究 OPSD 动态。我们假设,在反向传播过程中屏蔽这些高熵(“分支”)词元上的自蒸馏梯度,将阻止教师在这些关键决策点进行强制修改,从而保留学生的原生思考结构。 为此,我们在 OPSD 训练中实施了一个基于熵的掩码方案。具体而言,在每次前向传播后,我们计算学生模型的逐词元熵值 $H(y_i \mid y_{<i})$,然后根据预设的百分位数阈值有选择地将梯度归零(即掩码)。我们测试了不同的百分位数:$k \in \{10\%, 20\%, 30\%, 40\%, 50\%\}$,这些百分位数移除了具有最高学生熵的前 $k$% 的梯度。我们使用 Qwen3-1.7B 在 AIME25 上测量了掩码实验的结果。 如图 2(a) 和 2(b) 所示,掩码策略呈现出一种权衡: - • **恢复思维密度**:即使是对前 10% 高熵词元进行最小程度的掩码,也能将思维密度从标准 OPSD 的 7.9(每千词认知性标记数)显著提升至 9.1。随着掩码比例的增加,思维密度逐步提高,在掩码比例为 50% 时达到 10.5——几乎完全恢复了基线 10.3(每千词认知性标记数)的水平。 - • **未能恢复下游准确率**:然而,这种思维密度的恢复并未转化为更好的推理性能。当掩码比例为 10% 时,准确率仅为 31.2%,远低于未掩码 OPSD 的 33.9%。即使在掩码比例为 50% 时,准确率也仅为 34.9%,仍低于未经训练基线的 38.1%。 这些实验揭示了 OPSD 中的一个关键权衡:标准的 OPSD 通过抑制模型自身的高熵思考步骤来纠正错误——移除这些步骤恢复原生思维结构,但也移除了依赖这些结构进行校正的机制。当所有区域的校正都被保留,而仅移除高熵区域时(如在完整学生熵掩码中对低熵区域进行的校正),其效果类似于标准的 OPSD。相反,当校正仅聚焦于高熵区域(如在掩码中对高熵区域进行的校正)时,其性能通常更差,因为这集中介入了模型最关键的推理分支。这一观察表明:虽然基于熵的区域标定了思维密码被抑制的位置,但从本质上讲,整个序列中无处不在的修正才是主导因素。因此,单一的掩码策略过于粗糙——它同时移除了有问题的抑制性梯度和有益的校正梯度。这激发了在保护原生思维的同时保留校正能力的精细化需求。 ### 3.2 初始化时的词元级目标差异 在基于熵的梯度掩码从空间上定位了思维崩溃的区域之后,我们现在从语义角度进行平行诊断:检查在主动抑制区域(即高学生熵词元)中,教师为学生设置了何种目标。这种微观观察探讨了一个关键问题:教师的非认知性目标是否直接取代了学生的认知性标记(ET)? 具体而言,我们将词元分为两组:认知性标记(ET)和非认知性标记(Non-ET)。在每次自蒸馏迭代中,我们在初始化时(步骤 0)比较学生和教师的 top-1 预测。当教师的最高概率词元(代表“蒸馏目标”)与学生不同时,我们记录一个**目标差异**。尤其重要的是**学生 ET→教师非 ET** 的类型,其中学生预测的认知性标记被教师强加的非认知性标记目标所抑制。 为了从经验上验证教师的抑制性梯度如何影响高熵区域中的认知性标记,我们在 Qwen3-1.7B 上进行了训练前对 OPSD 进行单次评估。关注初始化步骤(步骤 0)可以捕获模型在受到自蒸馏影响前的原生行为和目标,从而清晰地定位自蒸馏抑制的起点。 如图 2(c) 所示,累积学生 ET 计数(蓝色曲线)和累积学生 ET→教师非 ET 差异(橙色曲线)均按递减的学生熵百分位绘制。关键发现是: - • **认知性标记集中分布**:学生 ET 的分布高度向顶部百分位倾斜。**前 20% 高熵词元**包含了模型中**总 ET 的约 80%**。 - • **严重的目标差异**:**总学生 ET→教师非 ET 差异的约 90%** 出现在相同的顶部 20% 词元中。 这些发现为理解抑制机制提供了关键见解。在初始化时,仅在顶部 20% 的高熵词元处,就有约八成的学生 ET 被教师产生的非认知性标记目标所抑制。这种教师强制修改的直接证据——在学生原生探索性推理步骤上覆盖非思考性目标——明确指出了思维崩溃的起点。然后,这种抑制通过标准的 OPSD 训练动态加剧并固化,导致在完整的 OPSD 训练中观察到思维密度崩溃。这一发现与图 2(a) 中的梯度掩码结果一致,其中掩码高熵词元恢复了思维密度。然而,它也使第 3.1 节观察到的准确率困境更加复杂:虽然掩码阻止了抑制,但它也阻止了教师在这些关键决策点进行有意义的纠错。 ### 3.3 主动抑制区域内的逐点散度映射 为了进一步将抑制定位到具体的认知性标记实例,我们分析了主动抑制区域($P_s > P_t$)内的逐点 KL 散度 $C_i = \log P_s - \log P_t$。逐点 KL 作为一个高度鲁棒的抑制风险引导指标,使 AD-OPSD 能够通过保护高逐点散度区域来保护关键的思考步骤。 为了验证逐点 KL 散度贡献 $C_i$ 是否可以作为一个鲁棒的代理指标来定位这些高风险抑制区域,我们仅关注前 20% 学生熵内的主动抑制区域($P_s > P_t$,即 $\log P_s - \log P_t > 0$)。我们按逐点 KL $C_i$ 降序对这些词元进行排序,并将其划分为从 10% 到 100% 的标准 10% 区间切片。得到的局部 ET 密度和累积 ET 覆盖率如图 3 所示。经验分布表明,认知性标记(ET)异常密集地集中在高逐点散度区域内,这在数学上验证了 $C_i$ 是一个强大的实时抑制风险指标: - • **高散度区间内密集的 ET 集中**:如图 3 所示,局部 ET 密度在最高的逐点 KL 区间内单调且显著更高,代表了一个被严重抑制的思考区域。具体而言,局部 ET 密度在最高的前 10% 区间达到峰值 7.9%,然后稳定下降至 10%–20% 区间的 6.9%,20%–30% 区间的 6.1%,并在最低区间降至 3.5% 以下。这种鲜明对比表明,高逐点散度区域自然聚集了高密度的认知性标记。 - • **高召回率的累积覆盖率**:同时,累积覆盖率曲线在开始阶段呈现出陡峭的、近乎线性的增长。具体而言,仅前 10% 的逐点 KL 区间就捕获了该主动抑制区域内所有生成认知性标记的 15.6%,而前 20% 的最高区间捕获了相似文章
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。
@agarwl_: 自蒸馏方法目前对思维模型无效 https://arxiv.org/abs/2603.24472 https://openreview.net/forum?i…
本文研究了为何自蒸馏会降低大语言模型的推理能力,发现它会抑制认知性言语化(不确定性表达),导致数学推理任务中的性能下降高达40%。
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
提出反自蒸馏(AntiSD),该方法逆转自蒸馏中的知识转移方向,以提高数学推理的效率和准确率,在4B到30B参数的多个模型上,用2-10倍更少的训练步数达到GRPO基线的准确率,最终准确率最高提升11.5个百分点。
@sheriyuo: Qwen Tongyi Lab提出RLCSD,一个关于同策略自蒸馏的简单但重要的批评。他们的关键观察是…
Qwen Tongyi Lab提出RLCSD以解决同策略自蒸馏中的风格漂移问题,该问题中学习信号集中在风格标记上,而非任务关键推理标记。他们的方法使用对比监督来聚焦于任务相关标记,在推理基准测试中取得了相较先前方法一致的改进。