当EOS Token产生分歧:理解在策略蒸馏中的长度膨胀现象

Hugging Face Daily Papers 论文

摘要

本文研究了基于策略的蒸馏如何因师生模型间EOS token不匹配而导致输出长度膨胀,并提出了一种通过聚合EOS概率来减少响应长度的纠正方法。

我们研究了基于策略的蒸馏(OPD)中的长度膨胀问题,其中学生模型的响应可能会变得过长,甚至耗尽生成预算。我们将这种行为的一个重要原因归结为基础学生模型与经过后训练的教师模型之间的终止token不匹配。在Qwen3、Llama和Gemma模型家族中,即使声明的停止集相同,两个模型也可能将停止概率分配给不同的EOS token。这种不匹配可能会抑制学生模型偏好的终止行为,同时又不能可靠地传递教师模型偏好的替代选择。研究表明,仅对齐解码停止集是不够的,而将功能等效的EOS token视为共享的语义停止动作,可以显著缓解所有三个模型家族中由不匹配导致的长度膨胀。为了进一步理解终止行为在训练过程中如何演变,我们研究了不同K2-Horizon训练阶段下的OPD。这种分阶段分析表明,终止偏好在训练过程中可能发生显著变化,同时也揭示了在OPD运行后期出现的一种独特的长度膨胀现象,这种现象在终止对齐后依然存在。这些结果共同表明,终止不匹配是导致OPD长度动态变化的一个重要但并非全部的来源。我们发布了整合了所提出终止处理修正的实现代码。
查看原文
查看缓存全文

缓存时间: 2026/09/18 11:01

论文解读 - 当EOS标记产生分歧:理解策略内蒸馏中的长度膨胀现象

来源:https://huggingface.co/papers/2609.20511

https://huggingface.co/papers/2609.20511#%F0%9F%9A%A8-your-opd-run-may-be-penalizing-the-model-for-stopping🚨 您的策略内蒸馏运行可能在惩罚模型的停止行为

在某次Qwen3展开示例中,学生模型在生成1,094个标记后得到正确答案,随后却生成了7,098个冗余标记。我们深入探究策略内蒸馏(OPD) 为何会导致这种失败。

🔍作用机制: 基础学生模型与经过后训练的教师模型可能偏好不同的EOS标记,即使在相同的声明停止集内。基于采样标记的策略内蒸馏可能抑制学生偏好的EOS标记,却无法可靠地转移教师模型的替代方案。

💡修正方案: 对功能等效的EOS标记进行概率聚合,并将其作为统一的语义停止动作进行监督。仅匹配解码停止集并不足够。

📉实验证据: 在我们针对数学推理的Qwen3、Llama和Gemma系列实验中,该修正显著减少了响应长度与截断现象。

🧩超越EOS不匹配问题: 使用预训练K2-Horizon学生模型时,即使实施修正后,长度膨胀现象仍会在训练后期重新出现,这提示存在其他需要解释的动态机制。

💬 您在策略内蒸馏实验中是否观察到类似的终止失败案例?欢迎分享比较数据并展开讨论!

🔗项目主页 (https://uncsciml.github.io/opd-eos-website/)· 💻代码仓库 (https://github.com/UNCSciML/opd-eos)

相似文章

多教师同策略蒸馏中的行为杠杆失衡

arXiv cs.CL

本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。