影响导向蒸馏:解决采样令牌在线策略蒸馏中的多样性瓶颈

Hugging Face Daily Papers 论文

摘要

本文提出影响导向自适应在线策略蒸馏(IDA-OPD),以解决采样令牌在线策略蒸馏中的多样性瓶颈,在无需全词汇表教师数据的情况下增强推理模型中的多样性传递。

采样令牌在线策略蒸馏(OPD)使用学生生成的令牌高效地将能力从教师转移到学生,仅需对采样令牌计算教师概率。然而,它常遭受多样性蒸馏失败:学生的pass@1提升而pass@k停滞,未能继承教师的多样性。为解释此现象,我们引入一阶局部熵影响,这是一种有符号的一阶代理量,将每次更新的熵效应解耦为教师-学生对数概率差和学生的局部概率结构,并通过经验将熵收缩与负影响位置联系起来。受此启发,我们提出影响导向自适应在线策略蒸馏(IDA-OPD):它不依赖于昂贵的全词汇表前向KL目标,而是保留熵扩展更新,同时用散度自适应优势收缩替换熵收缩更新,仅使用教师的采样令牌对数概率。在面向推理的蒸馏实验中,IDA-OPD一致地提升pass@k,通过蒸馏继承教师的多样性,以严格更低的成本匹配最强的教师信息方法,并广泛维持原始OPD的pass@1,所有这些都无需全词汇表教师信息。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:52

论文页面 - 影响力导向蒸馏:解决采样token在线策略蒸馏中的多样性瓶颈

来源:https://huggingface.co/papers/2608.29846

摘要

影响力导向自适应在线策略蒸馏(Influence-Directed Adaptive On-Policy Distillation)通过选择性保留熵扩展更新并使用自适应优势收缩替代熵收缩更新,改进了推理模型蒸馏中的多样性传递。

采样token在线策略蒸馏(OPD)使用学生生成的token高效地将能力从教师传递到学生,仅需获取采样token的教师概率。然而,它常遭遇多样性蒸馏失败的问题:学生的pass@1提升,但pass@k却停滞不前,未能继承教师的多样性。为解释此现象,我们引入了一阶局部熵影响(First-Order Local Entropy Influence),这是一种带符号的一阶代理指标,它将每次更新的熵效应解耦为教师-学生对数概率差值与学生局部概率结构,并从经验上将熵收缩与负影响位置联系起来。基于此,我们提出了影响导向自适应在线策略蒸馏(IDA-OPD):它不依赖于代价高昂的全词汇表前向KL目标,而是保留熵扩展更新,并使用散度自适应优势收缩替代熵收缩更新,且仅需教师的采样token对数概率。在面向推理的蒸馏实验中,IDA-OPD一致性地提升了pass@k,通过蒸馏继承了教师的多样性,在严格更低的成本下匹配了最强的教师信息方法,并广泛维持了原始OPD的pass@1性能,且无需全词汇表的教师信息。

查看arXiv页面 (https://arxiv.org/abs/2608.29846) 查看PDF (https://arxiv.org/pdf/2608.29846) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.29846)

在你的代理中获取此论文:

hf papers read 2608.29846

没有最新的CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.29846以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.29846以从本页面链接。

引用此论文的空间0

没有空间链接此论文

在空间README.md中引用arxiv.org/abs/2608.29846以从本页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

同策略Delta蒸馏(OPD^2)

Hugging Face Daily Papers

本文提出同策略Delta蒸馏(OPD^2),一种新的蒸馏奖励——差异信号,该信号捕捉教师模型与其基础模型在推理调优前的差异,为迁移推理能力提供更直接的信号。在数学、科学和代码基准上的实验表明,OPD^2始终优于传统的同策略蒸馏。

当教师误导:虚假信号感知的在线策略蒸馏

Hugging Face Daily Papers

本文介绍了 SA-OPD,一种虚假信号感知的在线策略蒸馏框架,它基于输入依据性和优化影响过滤误导性的词元级教师监督,从而提升 LLM 和 VLM 的蒸馏性能。