硬币的两面:论大语言模型在策略内蒸馏中泛化的双重性
摘要
本文研究了大语言模型在策略内蒸馏中的泛化行为,表明它转移了推理行为,并且教师-学生来源对齐至关重要,多教师组合会导致能力权衡。
查看缓存全文
缓存时间: 2026/08/24 08:28
论文页面 - 枚举皆有两面:论大语言模型在线蒸馏中泛化能力的双重性
来源:https://huggingface.co/papers/2608.16647 作者:
, , , , , , , , , , , , , , ,
摘要
在线蒸馏传递的是推理行为而非特定答案,其泛化能力与师生来源一致性紧密相关,而多教师组合则会导致能力权衡。
在线蒸馏(https://huggingface.co/papers?q=On-policy%20distillation)(OPD)通过监督从学生自身策略中采样的轨迹来传递教师能力,然而其泛化行为仍鲜为人知,因为大多数研究仅在单一领域且接近训练数据的基准上评估OPD。我们进行了一项对照研究,每次仅改变一个泛化因素,从领域内分布偏移(https://huggingface.co/papers?q=distribution%20shift)到跨领域迁移(https://huggingface.co/papers?q=cross-domain%20transfer),再到多教师(https://huggingface.co/papers?q=multi-teacher)设置。我们发现OPD传递的是教师的推理行为(https://huggingface.co/papers?q=reasoning%20behavior)而非其对特定问题的答案:训练难度几乎无关紧要,即使是教师从未解决过的问题也具有价值。迁移效果强烈依赖于师生之间的来源关系:同源(https://huggingface.co/papers?q=same-origin)配对能使学生在语言、推理深度乃至其他领域都接近教师,而异源(https://huggingface.co/papers?q=cross-origin)配对则主要拟合训练分布。这种广泛的影响是一把双刃剑:由于无法通过将提示路由到领域专家来限制每位教师的影响,将它们组合在一起会导致其能力之间产生依赖于组合方式的跷跷板效应。这些结果阐明了OPD何时具有泛化能力,并为诊断多教师(https://huggingface.co/papers?q=multi-teacher)OPD提供了有益视角。
查看arXiv页面(https://arxiv.org/abs/2608.16647)查看PDF(https://arxiv.org/pdf/2608.16647)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.16647)
在您的代理工具中获取此论文:
hf papers read 2608\.16647
没有最新CLI?请执行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型的README.md中引用arxiv.org/abs/2608.16647以从本页面建立链接。
引用本文的数据集0
无数据集链接本文
在数据集的README.md中引用arxiv.org/abs/2608.16647以从本页面建立链接。
引用本文的Spaces0
无Space链接本文
在Space的README.md中引用arxiv.org/abs/2608.16647以从本页面建立链接。
包含本文的收藏0
无收藏包含本文
将本文添加到收藏(https://huggingface.co/new-collection)以从本页面建立链接。
相似文章
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
反思大语言模型在策略蒸馏 II:单个训练样本
本文研究了大语言模型的在策略蒸馏,表明单个训练查询就能实现显著的状态覆盖和对齐,表明该方法更受算法限制而非数据限制。
多教师同策略蒸馏中的行为杠杆失衡
本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。
揭秘 On-Policy Distillation:角色、病理与调控
本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。
@jiqizhixin: 如果语言模型的最佳教师不是最强的那一个呢?来自清华大学及合作者…
来自清华大学的研究人员及其合作者系统性地研究了针对大语言模型的在策略蒸馏(OPD),揭示成功需要师生共享思维模式且教师提供真正的新能力,并提出了如离策略冷启动和教师对齐提示选择等实用策略。