1%的令牌或许已足够:探讨在线策略蒸馏中的梯度估计

Hugging Face Daily Papers 论文

摘要

本文提出了一种信息效率比(IER),用于优化稀疏在线策略蒸馏中的令牌选择,证明仅使用1%的令牌就能达到与全面监督相当的性能。

稀疏在线策略蒸馏(OPD)将教师监督分配给学生生成轨迹中的一个小令牌子集。然而,当有用教师指导的梯度从采样的下一个令牌估计时,可能导致噪声更新。我们在信息几何中固定前缀下研究此估计问题,并提出一种基于信噪分解的信息效率比(IER)。IER表征了在最优标量基线下相对梯度估计误差。一种候选集近似方法使得能够基于IER及其与现有有用性分数的组合进行令牌选择,同时保留采样的反向KL训练目标。在数学和医学推理任务中,添加IER在多种设置下改进了现有选择器,稀疏配置在令牌预算仅为0.1%--1%时匹配或超过无令牌选择的全面OPD。这些结果支持在分配稀疏监督时考虑有用性和梯度估计可靠性。我们的代码可在 https://github.com/BruceSheng1202/IER-OPD 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:26

论文页 - 1%的Token可能已足够:论基于策略蒸馏中的梯度估计

来源:https://huggingface.co/papers/2609.24432

摘要

稀疏的基于策略蒸馏(OPD)将教师监督分配给学生生成轨迹中的一小部分Token子集。然而,当有用的教师指导通过采样的下一个Token来估计其梯度时,可能会产生带有噪声的更新。我们在信息几何框架下研究了固定前缀下的这一估计问题,并提出了一种基于信号-噪声分解的信息-效率比(IER)。IER表征了在最优标量基线下相对的梯度估计误差。通过候选集近似,可以基于IER及其与现有有用性分数的组合进行Token选择,同时保留采样的反向KL训练目标。在数学和医学推理任务上,添加IER在多种设置下提升了现有选择器的性能,当Token预算仅为0.1%~1%时,稀疏配置匹配甚至超越了不进行Token选择的完整OPD。这些结果支持在分配稀疏监督时,需同时考虑有用性梯度估计可靠性。我们的代码已开源:https://github.com/BruceSheng1202/IER-OPD。

查看arXiv页面 (https://arxiv.org/abs/2609.24432) 查看PDF (https://arxiv.org/pdf/2609.24432) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.24432)

在您的智能体中获取此论文:

hf papers read 2609.24432

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 (0)

没有模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2609.24432 以从此页链接。

引用此论文的数据集 (0)

没有数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2609.24432 以从此页链接。

引用此论文的Spaces (0)

没有Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2609.24432 以从此页链接。

包含此论文的收藏夹 (0)

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页链接。

相似文章

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。

揭秘同策略蒸馏:其益处、危害及原因

Hugging Face Daily Papers

本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。

学会预见:揭示 On-Policy 蒸馏效率的解锁机制

arXiv cs.CL

本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。