当EOS Token产生分歧:理解在策略蒸馏中的长度膨胀现象
摘要
本文研究了基于策略的蒸馏如何因师生模型间EOS token不匹配而导致输出长度膨胀,并提出了一种通过聚合EOS概率来减少响应长度的纠正方法。
查看缓存全文
缓存时间: 2026/09/18 11:01
论文解读 - 当EOS标记产生分歧:理解策略内蒸馏中的长度膨胀现象
来源:https://huggingface.co/papers/2609.20511
https://huggingface.co/papers/2609.20511#%F0%9F%9A%A8-your-opd-run-may-be-penalizing-the-model-for-stopping🚨 您的策略内蒸馏运行可能在惩罚模型的停止行为
在某次Qwen3展开示例中,学生模型在生成1,094个标记后得到正确答案,随后却生成了7,098个冗余标记。我们深入探究策略内蒸馏(OPD) 为何会导致这种失败。
🔍作用机制: 基础学生模型与经过后训练的教师模型可能偏好不同的EOS标记,即使在相同的声明停止集内。基于采样标记的策略内蒸馏可能抑制学生偏好的EOS标记,却无法可靠地转移教师模型的替代方案。
💡修正方案: 对功能等效的EOS标记进行概率聚合,并将其作为统一的语义停止动作进行监督。仅匹配解码停止集并不足够。
📉实验证据: 在我们针对数学推理的Qwen3、Llama和Gemma系列实验中,该修正显著减少了响应长度与截断现象。
🧩超越EOS不匹配问题: 使用预训练K2-Horizon学生模型时,即使实施修正后,长度膨胀现象仍会在训练后期重新出现,这提示存在其他需要解释的动态机制。
💬 您在策略内蒸馏实验中是否观察到类似的终止失败案例?欢迎分享比较数据并展开讨论!
🔗项目主页 (https://uncsciml.github.io/opd-eos-website/)· 💻代码仓库 (https://github.com/UNCSciML/opd-eos)
相似文章
多教师同策略蒸馏中的行为杠杆失衡
本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。
揭秘 On-Policy Distillation:角色、病理与调控
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
@VukRosic99: 当小模型从大模型学习时,一半的教训被浪费了 设置:一个小的“学生”模型写出答案…
该论文识别了语言模型在策略蒸馏中的位置偏差,即学生模型生成的答案中后面的token接收到的监督质量下降。所提出的重要性加权在策略蒸馏(IW-OPD)根据累积漂移对修正进行加权,提高了学习速度和最终性能。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。