SMOPD: 用于脏历史多轮在策略自蒸馏的选择性令牌熵掩蔽

arXiv cs.LG 论文

摘要

SMOPD是一种仅使用损失的稳定方法,用于多轮在策略自蒸馏,通过选择性令牌熵掩蔽来提高脏历史设置下的准确性,并展示了在Qwen3模型上的改进。

arXiv:2608.14647v1 公告类型:新 摘要:脏历史轨迹使得多轮在策略自蒸馏(OPSD)变得脆弱:一旦学生产出错误的中间回复,后续轮次就会基于该回复,而均匀蒸馏可能会在携带少量纠正信号的令牌上浪费损失。我们引入了SMOPD(在策略蒸馏的选择性掩蔽),一种用于多轮OPSD的仅使用损失的稳定方法。对于每个生成的中间轮回复,SMOPD根据学生熵对令牌位置进行排序,并从裁剪的广义Jensen-Shannon蒸馏损失中移除最低熵的20%;最终答案和完全保留损失保持不变。此设计针对令牌级别的不确定性,而非粗糙的轨迹结果,不增加参数,且推理时零开销。我们将SMOPD与一种正确性缩放变体进行比较,该变体使用最终答案正确性乘以一个常见的分离可靠性代理。在使用Qwen3模型的LiC上,SMOPD在单种子1.7B、4B和8B比较中,SHARDED视图准确性提高了1.0-2.5个百分点,一个小的4B多种子检查显示平均SHARDED增益为+1.7pp,优于基线(双尾p = 0.022)。在没有掩蔽的情况下,添加结果标量在1.7B时有害(-4.0pp),并且当与掩蔽结合时,仍依赖于规模(在4B时+1.3pp,在1.7B时中性,在8B时-0.5pp)。这些存档的聚合结果表明,在评估的脏历史OPSD设置中,令牌级别的不确定性比标量最终答案正确性更可靠的稳定信号,同时将因果机制测试和更广泛的基准验证留给未来工作。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:19

# SMOPD:基于选择性Token熵掩码的脏历史多轮在策略自蒸馏
来源:https://arxiv.org/html/2608.14647

###### 摘要
脏历史轨迹会导致多轮在策略自蒸馏(OPSD)变得脆弱:一旦学生模型生成错误的中间回复,后续轮次将以此错误回复为条件,而均匀蒸馏会在承载较少纠正信号的token上浪费损失。我们提出SMOPD(选择性在策略蒸馏掩码),一种仅通过损失稳定的多轮OPSD方法。对于每个生成的中间轮次回复,SMOPD根据学生熵对token位置进行排序,并从裁剪的广义Jensen-Shannon蒸馏损失中移除最低熵的20%;最终答案轮损失和完全保留损失保持不变。这种设计针对token级不确定性而非粗粒度轨迹结果,不增加任何参数,且推理时零开销。我们将SMOPD与一个正确性缩放变体进行比较,后者使用最终答案正确性乘以公共分离的可靠性代理。在LiC基准上使用Qwen3模型测试时,SMOPD在单种子1.7B、4B和8B对比中,将SHARDED视图准确率提高了1.0-2.5个百分点;一个小规模4B多种子检查显示,相比基线平均SHARDED增益为+1.7个百分点(双尾p=0.022)。在1.7B模型中,不加掩码时添加结果标量是有害的(-4.0个百分点),即使与掩码结合,其效果也随模型规模变化(4B时+1.3个百分点,1.7B时中性,8B时-0.5个百分点)。这些汇总结果表明,在评估的脏历史OPSD设置中,token级不确定性是比粗粒度最终答案正确性更可靠的稳定信号,而因果机制测试和更广泛的基准验证留待未来工作。

## 1引言
大型语言模型(LLM)正越来越多地部署在多轮交互场景中——聊天、工具使用和协作问题解决——这些场景要求模型在多次交换中保持连贯性。为此类场景训练LLM颇具挑战:监督微调需要在每一轮进行昂贵的人类示范,而单轮评估对多轮性能的指示性较差(Dubois等,2024;Madaan等,2024)。在策略自蒸馏(OPSD)已成为多轮训练的有效范式。模型生成自身的轨迹(在策略轨迹),而冻结的EMA教师在干净、单轮上下文中提供蒸馏目标。MAIGO(Zheng等,2026a)通过一种历史清理机制实现了这一点,将教师与学生生成的错误隔离,加上单轮保留分支以防止灾难性遗忘。然而,一个根本挑战仍然存在:脏历史。在多轮轨迹生成期间,学生会在各轮次中累积错误。每个中间回复都为下一个提示创建条件,形成复合失真,将学生拉离参考分布。先前工作提出了针对单轮设置的各种技术——RL稳定性(PPO裁剪)、偏好优化(DPO、KTO)和蒸馏特定稳定性(REOPOLD、EOPD)——但其中任何一种是否适用于多轮OPSD仍是一个开放问题。在此背景下,我们定义了一个特定、可重用的脏历史OPSD稳定组件:基于百分位的学生熵选择,应用于中间轮次损失内。我们称这个熵掩码变体为SMOPD(选择性在策略蒸馏掩码)。选择规则最接近REOPOLD的熵引导动态采样;我们的贡献是将其置于多轮干净教师/脏学生GJS蒸馏损失中,并与粗粒度轨迹结果加权进行直接比较。我们研究了两种干预措施:
1. **Token级熵掩码**:从GJS蒸馏损失中掩码低熵(过度自信)的token。直觉是:当学生为某个token分配高置信度时,该token贡献的学习信号很少,并且可能代表在脏历史下形成的过度自信错误。
2. **结果引导的正确性缩放**:当最终答案不正确时,用一个标量乘以公共可靠性代理以提升中间轮次的权重;当正确时则降低权重。直觉是:失败的轨迹可能携带更多关于脏历史污染发生位置的信息性信号;成功的轨迹则可学习的内容较少。
我们在LiC多轮基准上,使用三个模型规模(Qwen3-1.7B、4B、8B)的系统性消融实验对两者进行了评估。我们的发现是:
- 熵掩码是我们证据中最一致的正向信号:在评估的模型规模上,它将SHARDED视图准确率提高了1.0-2.5个百分点,且不增加额外参数和推理开销。
- 结果正确性缩放在不使用掩码时会降低性能,与掩码结合时效果不一:不使用掩码时,SHARDED降低4.0个百分点。与掩码结合时,结果随模型规模变化:1.7B时中性,4B时+1.3个百分点(双尾p=0.101;方向性单尾p=0.0504),8B时-0.5个百分点。这种组合不能可靠地优于仅使用掩码。
- 对于4B模型,熵掩码的可靠性证据最强:在200步时,熵掩码带来的相对增益仍为正,且4B多种子比较显示SHARDED平均增益为+1.7个百分点,种子间差异很小。
我们的结果为多轮OPSD提供了一个实用的起点:优先考虑token级不确定性(基于熵的token选择),然后再添加粗粒度的结果信号。熵掩码的简单性使其易于在OPSD流程中测试。
总之,我们的贡献是:
- 我们引入了SMOPD,一个仅通过损失的选择性掩码组件,它将基于百分位的token级熵选择应用于具有脏历史轨迹和GJS中间轮次损失的多轮OPSD。
- 我们分析了token级置信度作为损失掩码的动机,并将这一机制假设与汇总的准确率证据分开。
- 通过在三个模型规模上的消融,我们发现在评估的设置中,熵掩码将多轮准确率提高了1.0-2.5个百分点,而基于正确性的结果缩放——在单轮RL风格设置中有效——在这些实验中无法可靠迁移。
- 我们提供了一个小规模的4B多种子检查,支持熵掩码信号,并表明结果标量的效果在不同规模上仍不确定。
- 我们指出了一个方法学问题——单种子OPSD实验中的虚假大效应——并提出了实用的评估建议。

## 2相关工作
**表1**:与密切相关OPD/OPSD稳定方法的定位比较。表1是本文的主要定位工具。关键区别在于范围:SMOPD是MAIGO风格干净教师/脏学生训练家族内的一个狭窄的损失侧干预,而不是更广泛OPD框架或更丰富结果引导信用分配方法的替代品。

#### 多轮OPSD。
OPSD在学生生成的轨迹上训练,同时EMA教师提供参考logits(Zhao等,2026a)。MAIGO(Zheng等,2026a)通过清理教师历史并保留完全视图能力,将这一思想扩展到多轮LiC。我们使用相同的干净教师/脏学生动机,但平均所有符合条件的中间轮次损失,并研究GJS损失内的选择性掩码。相邻的自我改进和自我蒸馏路线包括自我奖励和自我对弈训练、SDFT、上下文条件OPD、OPD经验性失败分析、反思性OPSD以及可靠性感知的自我蒸馏框架。

#### 稳定信号。
单轮RLHF和偏好优化依赖于KL风格约束或偏好衍生奖励;G-OPD和ExOPD将OPD与密集KL约束RL联系起来。Token级OPD方法更接近我们的机制:REOPOLD在细化期间选择高熵学生token;EOPD使用熵切换KL方向;AOPD通过优势区域改变token级学习模式;DRKL研究反向KL的过度自信。我们将基于百分位的学生熵选择应用于脏历史中间轮次,其中百分位是在每个生成的回复内计算,而非跨批次计算。

#### 结果与基准背景。
过程奖励提供步骤级反馈,但需要额外监督。结果引导方法如OGLS-SD和SCOPE使用更丰富的引导或双路径加权;CREDIT认为粗粒度轨迹结果不足以用于OPD信用分配。我们的结果变体有意较弱:一个标量正确性依赖的乘数应用于公共可靠性加权的中间轮次损失。我们在LiC上进行评估,其配对的完全/分片视图协议直接测量了MAIGO所针对的多轮性能下降。MT-Bench提供了互补的多轮评估,但缺乏这种配对视图控制。

#### 熵信号。
熵正则化在强化学习中是标准的,最近的LLM工作将熵动态与推理多样性和探索联系起来。相比之下,SMOPD将熵用作中间轮次蒸馏的逐token选择信号,而非全局正则化器。

## 3动机:多轮OPSD中的Token级置信度
脏历史OPSD在学生生成的中间轮次上平均逐token的GJS损失,但回复中的token信息量并不相等。低熵位置通常对应可预测的延续、格式化或局部承诺的选择;高熵位置更常标记决策点,如运算符、变量绑定或逻辑连接词。在脏历史下,当先前的学生错误进入上下文后,置信度也可能变得不准确。因此,SMOPD将熵掩码视为一个稳定性假设:保留更可能需要纠正的不确定token位置,并从中间轮次损失中移除最低熵的位置。我们使用每个回复的百分位数而非全局阈值,因为熵尺度在不同任务、轮次和训练阶段会发生变化。在报告的所有实验中,β=0.8在每个生成的中间轮次回复内保留最高熵的80% token。下面的汇总结果检验了这一规则是否提高了准确率;它们本身并不能证明token级的因果机制。

## 4方法
我们采用MAIGO启发的干净教师/脏学生框架(Zheng等,2026a):学生模型πθ生成带有脏历史的多轮轨迹,而冻结的EMA教师πEMA在干净、单轮上下文中产生token级logits——中间轮次仅看到用户轮次u1,...,ut,而答案轮看到规范的完全视图规格f。我们的实现与MAIGO在两个方面有意不同:它平均一个轨迹中所有符合条件的中间轮次,而不是采样一个符合条件的轮次作为单轮估计器;并且它使用§4.3中的分离可靠性代理作为公共中间轮次权重。结果引导变体用一个最终答案正确性标量乘以该代理。图1总结了熵掩码进入训练循环的位置。请参见图注。
**图1:多轮OPSD中的熵掩码**。学生生成脏历史轨迹;EMA教师在干净上下文中对相同的生成回复token进行评估。熵掩码仅应用于中间轮次的GJS损失,而答案轮和完全保留RKL损失保持未掩码状态。

### 4.1预备知识
给定学生在第t轮生成的包含token y1,...,yN的回复,在位置i的逐token损失计算为学生分布p_student^i = πθ(· | c_i^dirty)与教师分布p_teacher^i = πEMA(· | c_i^clean)之间的散度,其中c_i^dirty和c_i^clean分别表示脏历史和干净历史上下文。**Token对齐与教师强制**:对于每个生成的学生回复,学生和教师分布都在相同的token序列y1,...,yN上进行评估。上下文不同,但监督位置相同:学生分布以包含先前学生回复的脏前缀为条件,而教师分布则在对应干净上下文下,对学生生成的延续进行教师强制。这避免了独立生成的教师和学生回复之间的可变长度对齐;散度在每个生成的token位置上,基于共享词汇表按位置计算。

**广义Jensen-Shannon散度**:对于中间轮次,我们使用系数β_mid=0.5的GJS:
GJS(p_student^i, p_teacher^i) = β_mid * D_KL(p_teacher^i || m) + (1 - β_mid) * D_KL(p_student^i || m)
其中m = β_mid * p_teacher^i + (1 - β_mid) * p_student^i。

相似文章

基于同伴成功与失败的多 rollout 在策略蒸馏

arXiv cs.LG

提出多 rollout 在策略蒸馏 (MOPD),一种将教师条件化于同伴成功和失败的 rollout 以提供更密集的 token 级监督进行语言模型后训练的方法,在多个基准上提升了性能。

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

潜在同策略自蒸馏 (LOPD)

Hugging Face Daily Papers

本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。