1%的令牌或许已足够:探讨在线策略蒸馏中的梯度估计
摘要
本文提出了一种信息效率比(IER),用于优化稀疏在线策略蒸馏中的令牌选择,证明仅使用1%的令牌就能达到与全面监督相当的性能。
查看缓存全文
缓存时间: 2026/09/22 07:26
论文页 - 1%的Token可能已足够:论基于策略蒸馏中的梯度估计
来源:https://huggingface.co/papers/2609.24432
摘要
稀疏的基于策略蒸馏(OPD)将教师监督分配给学生生成轨迹中的一小部分Token子集。然而,当有用的教师指导通过采样的下一个Token来估计其梯度时,可能会产生带有噪声的更新。我们在信息几何框架下研究了固定前缀下的这一估计问题,并提出了一种基于信号-噪声分解的信息-效率比(IER)。IER表征了在最优标量基线下相对的梯度估计误差。通过候选集近似,可以基于IER及其与现有有用性分数的组合进行Token选择,同时保留采样的反向KL训练目标。在数学和医学推理任务上,添加IER在多种设置下提升了现有选择器的性能,当Token预算仅为0.1%~1%时,稀疏配置匹配甚至超越了不进行Token选择的完整OPD。这些结果支持在分配稀疏监督时,需同时考虑有用性和梯度估计可靠性。我们的代码已开源:https://github.com/BruceSheng1202/IER-OPD。
查看arXiv页面 (https://arxiv.org/abs/2609.24432) 查看PDF (https://arxiv.org/pdf/2609.24432) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.24432)
在您的智能体中获取此论文:
hf papers read 2609.24432
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 (0)
没有模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2609.24432 以从此页链接。
引用此论文的数据集 (0)
没有数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2609.24432 以从此页链接。
引用此论文的Spaces (0)
没有Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2609.24432 以从此页链接。
包含此论文的收藏夹 (0)
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页链接。
相似文章
影响导向蒸馏:解决采样令牌在线策略蒸馏中的多样性瓶颈
本文提出影响导向自适应在线策略蒸馏(IDA-OPD),以解决采样令牌在线策略蒸馏中的多样性瓶颈,在无需全词汇表教师数据的情况下增强推理模型中的多样性传递。
策略内蒸馏真的在蒸馏吗?从嘈杂教师到自我改进
本文分析了策略内蒸馏,揭示其主要通过抑制低概率token而非依赖教师指导来实现改进,并提出了无需监督的OPSA方法,显著提升了推理性能。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。