当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers 论文

摘要

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。

在线策略蒸馏(OPD)通过用密集的词元级教师信号监督学生采样的轨迹,来迁移教师能力。最近的选择性 OPD 方法通过优先处理那些置信度高、信息量大或可学习的信号来改进这一过程。然而,这些假设忽略了语言模型的一个基本失败模式:其词元级判断可能由与输入无关的语言先验、格式约定或刻板的推理模板所驱动,而非任务特有的证据。我们将这种与优化相关但输入依据较弱的监督称为 OPD 中的虚假信号,它们可能产生大梯度,但对任务改进方向的贡献却很小。为了缓解这一问题,我们提出了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它根据输入依据性和优化影响来识别并过滤误导性的词元级监督。SA-OPD 引入了一个轻量级的输入依据性代理,用于估计词元级蒸馏信号是否真正依赖于输入。然后,它仅过滤那些同时表现出低输入依据性和极端蒸馏差异的词元,从而移除高影响的虚假更新,实现细粒度的 OPD 优化。在大型语言模型(LLM)和视觉语言模型(VLM)两种设置上的大量实验表明,SA-OPD 始终优于 Vanilla OPD 和具有竞争力的选择性方法。这些结果确立了输入依据性作为 OPD 监督选择的关键维度,并为缓解虚假更新提供了简单有效的策略。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:49

论文页面 - 当教师误导:伪信号感知的在线策略蒸馏

Source: https://huggingface.co/papers/2608.03632

摘要

在线策略蒸馏(On-Policy Distillation,OPD)通过使用密集的token级教师信号来监督学生采样的轨迹,从而转移教师能力。近期的选择性OPD方法通过优先处理那些置信度高、信息量大或可学习的信号来改进这一过程。然而,这些假设忽略了语言模型的一个基本失败模式:其token级判断可能由与输入无关的语言先验、格式惯例或刻板推理模板驱动,而非任务特定的证据。我们将这类与优化相关但输入基础薄弱的监督称为OPD中的伪信号(spurious signals),它们可能产生较大的梯度,但对任务改进方向的贡献甚微。为缓解这一问题,我们提出SA-OPD,一个伪信号感知的在线策略蒸馏(Spurious-Signal-Aware On-Policy Distillation)框架,它基于输入基础性和优化影响来识别并过滤具有误导性的token级监督。SA-OPD引入了一个轻量级的输入基础性代理,用于估计token级蒸馏信号是否真正依赖于输入。然后它仅过滤那些同时表现出低输入基础性和极端蒸馏差异的token,从而移除高影响的伪更新,并实现细粒度的OPD优化。在大型语言模型(LLM)和视觉-语言模型(VLM)设置上的大量实验表明,SA-OPD持续优于Vanilla OPD和有竞争力的选择性方法。这些结果确立了输入基础性作为OPD监督选择的一个关键维度,并提供了一种简单有效的策略来缓解伪更新。

查看arXiv页面 (https://arxiv.org/abs/2608.03632) 查看PDF (https://arxiv.org/pdf/2608.03632) GitHub1 (https://github.com/jjjyinuo/SA-OPD) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03632)

在您的agent中获取此论文:

hf papers read 2608\.03632

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的README.md中引用arxiv.org/abs/2608.03632,即可从此页面链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2608.03632,即可从此页面链接到该数据集。

引用此论文的Spaces0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2608.03632,即可从此页面链接到该Space。

包含此论文的集合1

相似文章

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。