当教师误导:虚假信号感知的在线策略蒸馏
摘要
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。
查看缓存全文
缓存时间: 2026/08/06 05:49
论文页面 - 当教师误导:伪信号感知的在线策略蒸馏
Source: https://huggingface.co/papers/2608.03632
摘要
在线策略蒸馏(On-Policy Distillation,OPD)通过使用密集的token级教师信号来监督学生采样的轨迹,从而转移教师能力。近期的选择性OPD方法通过优先处理那些置信度高、信息量大或可学习的信号来改进这一过程。然而,这些假设忽略了语言模型的一个基本失败模式:其token级判断可能由与输入无关的语言先验、格式惯例或刻板推理模板驱动,而非任务特定的证据。我们将这类与优化相关但输入基础薄弱的监督称为OPD中的伪信号(spurious signals),它们可能产生较大的梯度,但对任务改进方向的贡献甚微。为缓解这一问题,我们提出SA-OPD,一个伪信号感知的在线策略蒸馏(Spurious-Signal-Aware On-Policy Distillation)框架,它基于输入基础性和优化影响来识别并过滤具有误导性的token级监督。SA-OPD引入了一个轻量级的输入基础性代理,用于估计token级蒸馏信号是否真正依赖于输入。然后它仅过滤那些同时表现出低输入基础性和极端蒸馏差异的token,从而移除高影响的伪更新,并实现细粒度的OPD优化。在大型语言模型(LLM)和视觉-语言模型(VLM)设置上的大量实验表明,SA-OPD持续优于Vanilla OPD和有竞争力的选择性方法。这些结果确立了输入基础性作为OPD监督选择的一个关键维度,并提供了一种简单有效的策略来缓解伪更新。
查看arXiv页面 (https://arxiv.org/abs/2608.03632) 查看PDF (https://arxiv.org/pdf/2608.03632) GitHub1 (https://github.com/jjjyinuo/SA-OPD) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03632)
在您的agent中获取此论文:
hf papers read 2608\.03632
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2608.03632,即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2608.03632,即可从此页面链接到该数据集。
引用此论文的Spaces0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2608.03632,即可从此页面链接到该Space。
包含此论文的集合1
相似文章
揭秘 On-Policy Distillation:角色、病理与调控
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
SG-OPD:通过符号一致性门控和分阶段教师采样的符号门控在线策略蒸馏
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。
你的老师在这里帮不了你:对抗在线策略蒸馏中的监督保真度衰减
识别了在线策略蒸馏中的监督保真度衰减(SFD),即随着学生序列变长,教师监督质量下降,并提出了前瞻组奖励(LGR)以缓解SFD,从而提升数学和代码基准测试的性能。