当困惑度误导时:面向生成的混合序列模型蒸馏
摘要
本文研究了蒸馏混合序列模型中对数似然与基于生成的评估之间的差异,表明仅凭困惑度可能具有误导性。本文介绍了GenDistill,一个将Transformer蒸馏为Hybrid-KDA模型的流水线,实现了高达75%的KV缓存减少和2-4倍的首次令牌生成时间加速,同时保留了教师模型86-90%的准确率。
arXiv:2603.26556v2 公告类型:替换
摘要:通过蒸馏将预训练的Transformer转换为更高效的混合模型,为降低推理成本提供了一种有前景的方法。然而,在蒸馏模型中实现高质量的生成需要仔细联合设计学生架构和蒸馏过程。许多先前的蒸馏工作通过使用对数似然对候选答案进行排序来评估下游多项选择基准,而不要求自回归生成,这可能会掩盖模型质量的重要差异。例如,在重叠的基准上,我们展示了一个7B蒸馏模型,在对数似然评分下与教师模型几乎匹配(差距在0.2个百分点以内),但在必须自回归生成答案时,落后了20.8个百分点。
我们通过GenDistill研究了这一现象,这是一个我们设计的多阶段流水线,用于将预训练的Transformer蒸馏为高效的混合Kimi Delta注意力(Hybrid-KDA)学生模型。将其作为Qwen3-0.6B上的受控测试平台,我们系统地消融了六个设计轴(训练目标、损失掩码、训练时长、数据集选择、参数冻结和架构选择),并在对数似然和基于生成的协议下评估每个选择。我们发现,基于对数似然的评估始终低估了教师与学生之间的差距,并且在某些情况下可能颠倒设计选择的排名,因此仅基于困惑度的评估得出的结论可能具有误导性。在我们研究的因素中,数据集选择、仅完成掩码以及后训练期间冻结注意力层对生成质量的影响最大。
我们最佳的蒸馏方案,使用Hybrid-KDA模型作为学生,在知识基准上保留了教师模型86-90%的准确率,同时将KV缓存内存减少了高达75%,并在128K令牌上下文中将首次令牌生成时间提高了2-4倍。
查看缓存全文
缓存时间: 2026/07/20 09:38
# 当Perplexity说谎时:面向生成的混合序列模型蒸馏 来源:https://arxiv.org/html/2603.26556 Juan Gabriel Kostelec[juan\.gabriel\.kostelec@huawei\.com](mailto:juan\.gabriel\.kostelec@huawei\.com) 华为苏黎世研究中心,瑞士 Qinghai Guo[guoqinghai@huawei\.com](mailto:guoqinghai@huawei\.com) ACS实验室,华为技术有限公司 ###### 摘要 通过蒸馏将预训练的Transformer转换为更高效的混合模型,是降低推理成本的一种有前景的方法。然而,要在蒸馏模型中实现高质量的生成,需要仔细联合设计学生架构和蒸馏过程。许多先前的蒸馏工作通过使用对数似然对候选答案进行排序来评估下游多项选择基准,而不是要求自回归生成,这可能掩盖模型质量的重要差异。例如,在重叠的基准测试上,我们展示了一个70亿参数的蒸馏模型,在对数似然评分下几乎与其教师模型持平(差距仅0.2个百分点),但当模型必须自回归生成答案时,实际落后20.8个百分点。我们通过GenDistill(我们设计的一个多阶段流水线)研究这一现象,该流水线用于将预训练的Transformer蒸馏为高效的混合Kimi Delta注意力(Hybrid-KDA)学生模型。将其作为Qwen3-0.6B上的受控测试平台,我们系统地消融了六个设计轴(训练目标、损失掩码、训练时长、数据集选择、参数冻结和架构选择),并在对数似然和基于生成的评估协议下评估每个选择。我们发现,基于对数似然的评估始终低估了教师与学生之间的差距,并且在某些情况下会颠倒设计选择的排名,因此仅基于困惑度得出的结论可能具有误导性。在我们研究的因素中,数据集选择、仅补全掩码以及在训练后冻结注意力层对生成质量影响最大。我们最佳的蒸馏方案,使用Hybrid-KDA模型作为学生,在知识基准测试中保留了教师准确率的86-90%,同时将KV缓存内存减少了高达75%,并在128K token上下文中将首次token生成时间提升了2-4倍。 ## 1 引言 基于Transformer的语言模型因其强大的准确率和扩展性而主导现代NLP。然而,自注意力机制在序列长度n上产生O(n²)的时间和内存复杂度,实际部署中在自回归推理期间还需支付线性增长的键值(KV)缓存成本。与此同时,具有线性时间循环式计算的高效序列模型,包括状态空间模型(SSM),已成为有吸引力的替代方案。这些架构可以提供线性时间处理和在生成期间每步O(1)的内存增长(即无KV缓存),从而在长上下文场景中实现更快的解码和更小的内存占用(Gu and Dao, 2023;Yang et al., 2023;2025c;Dao and Gu, 2024)。由于从头训练大型Transformer计算成本高昂(通常需要数万亿tokens),越来越多的研究关注跨架构蒸馏:将预训练Transformer教师的能力迁移到更高效的循环学生模型中(Wang et al., 2024;Bick et al., 2025a;2024;Goldstein et al., 2025)。 尽管取得了令人鼓舞的结果,但先前将Transformer蒸馏为SSM的方法既针对困惑度进行优化,也基于困惑度进行评估,在流水线的任何阶段都没有以生成质量为目标。虽然更广泛的NLP社区早已认识到困惑度是生成质量的一个不完美代理,但在跨架构蒸馏中,这一差距尤为严重。问题的核心在于模型的评估方式。基于困惑度的评估计算每个候选答案在给定提示下的对数似然,并选择得分最高的选项,测试模型是否为正确答案分配高概率。基于生成的评估要求模型自回归地产生答案,然后通常从预期格式中解析输出或使用任务特定标准(如精确匹配答案或可执行代码)进行验证,测试模型能否生成正确的答案。 在本工作中,我们使用LM Evaluation Harness(Gao et al., 2024)进行基于困惑度的评估,使用EvalScope(ModelScope Team, 2024)进行基于生成的评估。这种区别至关重要,因为模型可能对正确答案排名很高,但无法生成它们。为了说明这种差异的严重性,我们评估了从Qwen2.5-7B-Instruct蒸馏而来的QRWKV6-7B-Instruct(Lin et al., 2025b),在两种评估协议下进行。图1对比了原始论文报告基于困惑度的结果与我们对该相同模型检查点进行基于生成的评估(完整数值见表5,附录A)。 ![参见说明文字]() 图1:QRWKV6-7B-Instruct(从Qwen2.5-7B-Instruct蒸馏)的评估协议差距,两个面板评估的是同一检查点。基于困惑度的数值(左)取自原始论文(ARC-E, ARC-C, HS, WG);基于生成的数值(右)为我们自己测算,额外包括GSM8K、HEval和IFEval。完整数值见附录A中的表5。 两种协议之间的差距是显著的。如图1所示,QRWKV6-7B-Instruct在基于PPL的评估下几乎与教师模型持平(平均差距仅0.2个百分点),但在基于生成的性能上却遭受灾难性下降(平均差距20.8个百分点)。这一模式代表了更广泛的文献现状:跨架构蒸馏流水线通常在预训练数据上进行优化,并通过基于对数似然的评估(例如LM Evaluation Harness)报告其主要下游结果(Wang et al., 2024;Bick et al., 2025a;2024;Goldstein et al., 2025)。这一差距促使我们系统性地研究,要生产具有真正生成质量的蒸馏模型需要什么条件。 虽然诸如M1(Wang et al., 2025)以及最近的MiniCPM-SALA(Team et al., 2026)等工作旨在提升蒸馏线性化模型的推理能力,但它们依赖额外的SFT和RL阶段来提高学生模型的性能。这些阶段本身可能相当庞大(例如MiniCPM-SALA中的1T tokens)。相比之下,我们研究基本的蒸馏选择本身,以及如何在无需额外持续训练的情况下最大化蒸馏模型的生成质量。 在本工作中,我们开发了GenDistill,一个多阶段蒸馏流水线,通过实证评估每个选择对学生下游指令遵循和推理性能的影响,来确定每个设计选择。然后,通过将该流水线与混合Kimi Delta注意力(Hybrid-KDA)架构配对,我们获得了最强的学生模型。我们的主要贡献是: - • 我们展示了基于困惑度的评估在跨架构蒸馏中是生成质量的一种系统性误导代理。这种分歧在我们变化的每个设计轴上一致出现,并且在0.6B和1.7B参数规模下都成立。 - • 为系统地建立这一点,我们开发了GenDistill,这是一个多阶段蒸馏流水线,其设计空间在固定教师上每次变化一个轴(训练目标、损失掩码、训练时长、数据集选择、参数冻结和架构选择)。我们将在论文发表后发布模型代码和蒸馏检查点。 - • 基于这些实证结果,我们提出了一种具体的蒸馏方案,最大化学生模型的生成质量,结合了知识蒸馏与仅补全掩码、教师对齐的指令数据以及冻结的注意力层,这与困惑度引导搜索可能选择的方案不同。 本文其余部分组织如下。第3.1节和3.2节描述了Hybrid-KDA架构和GenDistill蒸馏阶段。第4节定义了两种评估协议,其不一致性是我们研究的主题。第5节随后逐一讨论每个设计选择,并在两种协议下报告结果,其反复出现的结果是困惑度和生成存在分歧,往往颠倒哪个选择更好的判断。我们推荐的方案是在生成而非困惑度下做出选择后,该设计空间所产生的结果。 ## 2 相关工作 基于Transformer的语言模型的计算需求,促使了大量关于将预训练模型转换为次二次复杂度架构的研究。按时间顺序,这条工作线首先聚焦于基于微调的方法,直接修改注意力机制并继续使用标准语言建模目标进行训练,后来扩展到基于蒸馏的方法,将知识从Transformer教师转移到结构不同的学生模型。 早期的工作侧重于用表达性线性核替换softmax注意力层,然后对所得模型进行1-400亿tokens的微调(Chen et al., 2024;Kostelec and Guo, 2025;Zhang et al., 2024;Mercat et al., 2024)。值得注意的是,LoLCats(Zhang et al., 2025)通过一个两阶段方法实现了仅用4000万tokens的转换:2000万tokens用于注意力对齐,随后2000万tokens用于训练LoRA适配器以恢复模型性能。然而,这些方法仍然存在性能差距,特别是在MMLU等基准测试上。 更近期的研究利用多阶段蒸馏进行模型转换,通常报告学生性能显著更强。表1总结了与我们最相关的流水线。MOHAWK(Bick et al., 2024)引入了自底向上的三阶段模板:注意力矩阵方向对齐、隐藏状态对齐和端到端知识蒸馏。类似流水线由Wang等人(2024)(专注于混合模型并增加了SFT和DPO训练后阶段)、Bick等人(2025a)(将MOHAWK扩展到更大模型)以及Yang等人(2025b)(蒸馏到具有多头潜在注意力和Mamba层的混合模型中)提出。一项并行工作(Goldstein et al., 2025)提出了一个高效蒸馏过程,仅使用7亿tokens,并在下游任务上报告了最先进的结果,然而,他们专注于纯循环模型,并且和前述其他流水线一样,没有对比基于似然的评估与基于生成的评估。 表1:多阶段跨架构蒸馏流水线。GenDistill遵循与此工作线相同的自底向上对齐再蒸馏结构;其独特之处在于每个方案选择都在基于生成的评估下进行,使用了混合Kimi Delta注意力学生模型,并在教师对齐数据上进行了仅补全掩码的指令蒸馏阶段。token数量是每项工作在其自身教师和数据下报告的数值。 SSM和线性注意力模型的一个基本限制是其固定的隐藏状态大小,这可能在上下文检索任务中显著降低性能。因此,许多研究探索了混合模型以减轻这一差距。此处两种方向相关:层内混合(仅将一层内的一部分注意力头替换为SSM头)和层间混合(将整个注意力层替换为SSM层)。虽然层内混合允许更细粒度地选择保留哪些注意力头以及将哪些转换为SSM(Zuo et al., 2025;Dong et al., 2024),但这可能增加系统复杂性和推理开销,使分布式并行优化复杂化(Team et al., 2025)。对于层间混合,选择保留哪些注意力层不变至关重要,因为某些层似乎对检索性能至关重要(Bick et al., 2025b)。先前的方法统一选择注意力层(Lieber et al., 2024;De et al., 2024;Bick et al., 2024)。SMART(Yang et al., 2025b)研究了当用线性层替换注意力层时每层的敏感性(通过教师-学生KL散度的减少来衡量),然后启发式地选择层以最大化总敏感性。PostNAS(Gu et al., 2025)使用复杂的搜索过程,训练一个一次性的超级网络并使用束搜索为特定下游任务找到最优的K层。一种并行的方法提出,通过测量将教师蒸馏到混合模型后所得混合模型与原始教师模型之间输出logits的KL散度,贪婪地将注意力层加回到蒸馏后的完全线性模型中(Li et al., 2025)。 ## 3 GenDistill流水线 生产高质量的蒸馏模型需要联合设计学生架构和蒸馏过程。本节描述这两个组成部分:Hybrid-KDA学生架构(第3.1节),包括一个用于选择哪些层保留softmax注意力的束搜索方法(第3.1.1节),以及逐步将学生与教师对齐的多阶段蒸馏过程(第3.2节)。 ### 3.1 学生模型架构 为了保留预训练期间获得的基础知识,我们的学生模型直接继承预训练教师模型的大部分架构。具体来说,词表、嵌入层、层标准化
相似文章
PROOF-Gen: 从优化数据到更好的蒸馏
PROOF-Gen 提出了一种每个场景的反思优化方法,用于恢复失败的轨迹以蒸馏工具调用能力,从而提升蒸馏流程中的数据质量和模型性能。
掩码蒸馏:将思维链内化到语言模型中
掩码蒸馏是一种知识蒸馏框架,它训练学生大语言模型仅预测解决方案令牌,同时推理教师提供反馈,旨在将思维链计算内化到模型参数中。该方法显示任务相关的成功,在GSM8K上有效,但对于像Countdown这样更困难的任务需要小型脚手架。
Self-Verified Distillation:你的语言模型实则就是它自己的合成数据流水线
提出了Self-Verified Distillation方法,该方法让LLM从无标注的种子问题中生成候选解决方案,并通过基于提示的自我验证进行筛选,然后在过滤后的数据集上进行训练,从而在Qwen3模型的数学、科学和编程基准测试上取得了显著提升。
揭秘同策略蒸馏:其益处、危害及原因
本文介绍了一种无需训练的框架,用于分析推理模型在逐token级别上的蒸馏信号。研究揭示,蒸馏引导在错误推理路径上更为有效,且其效果取决于学生模型的能力及任务上下文。
可解释的推理轨迹,出人意料的结果:调查基于推理轨迹的知识蒸馏中的不匹配
本文研究了LLM中基于推理轨迹的知识蒸馏中的关键不匹配问题,揭示了语义正确的思维链推理轨迹与最终答案正确性没有可靠相关性,以及为优化模型性能而优化的推理轨迹往往对终端用户的可解释性最差。