影响导向蒸馏:解决采样令牌在线策略蒸馏中的多样性瓶颈
摘要
本文提出影响导向自适应在线策略蒸馏(IDA-OPD),以解决采样令牌在线策略蒸馏中的多样性瓶颈,在无需全词汇表教师数据的情况下增强推理模型中的多样性传递。
查看缓存全文
缓存时间: 2026/09/03 03:52
论文页面 - 影响力导向蒸馏:解决采样token在线策略蒸馏中的多样性瓶颈
来源:https://huggingface.co/papers/2608.29846
摘要
影响力导向自适应在线策略蒸馏(Influence-Directed Adaptive On-Policy Distillation)通过选择性保留熵扩展更新并使用自适应优势收缩替代熵收缩更新,改进了推理模型蒸馏中的多样性传递。
采样token在线策略蒸馏(OPD)使用学生生成的token高效地将能力从教师传递到学生,仅需获取采样token的教师概率。然而,它常遭遇多样性蒸馏失败的问题:学生的pass@1提升,但pass@k却停滞不前,未能继承教师的多样性。为解释此现象,我们引入了一阶局部熵影响(First-Order Local Entropy Influence),这是一种带符号的一阶代理指标,它将每次更新的熵效应解耦为教师-学生对数概率差值与学生局部概率结构,并从经验上将熵收缩与负影响位置联系起来。基于此,我们提出了影响导向自适应在线策略蒸馏(IDA-OPD):它不依赖于代价高昂的全词汇表前向KL目标,而是保留熵扩展更新,并使用散度自适应优势收缩替代熵收缩更新,且仅需教师的采样token对数概率。在面向推理的蒸馏实验中,IDA-OPD一致性地提升了pass@k,通过蒸馏继承了教师的多样性,在严格更低的成本下匹配了最强的教师信息方法,并广泛维持了原始OPD的pass@1性能,且无需全词汇表的教师信息。
查看arXiv页面 (https://arxiv.org/abs/2608.29846) 查看PDF (https://arxiv.org/pdf/2608.29846) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.29846)
在你的代理中获取此论文:
hf papers read 2608.29846
没有最新的CLI? curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.29846以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.29846以从本页面链接。
引用此论文的空间0
没有空间链接此论文
在空间README.md中引用arxiv.org/abs/2608.29846以从本页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。
同策略Delta蒸馏(OPD^2)
本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。
当教师误导:虚假信号感知的在线策略蒸馏
本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。