硬币的两面:论大语言模型在策略内蒸馏中泛化的双重性

Hugging Face Daily Papers 论文

摘要

本文研究了大语言模型在策略内蒸馏中的泛化行为,表明它转移了推理行为,并且教师-学生来源对齐至关重要,多教师组合会导致能力权衡。

策略内蒸馏(OPD)通过监督从学生自身策略中采样的轨迹来转移教师能力,但其泛化行为仍知之甚少,因为大多数研究在单一领域和接近训练数据的基准上评估OPD。我们提出一项控制研究,每次改变一个泛化因素,从领域内分布偏移到跨领域迁移和多教师设置。我们发现OPD转移的是教师的推理行为,而非其对特定问题的答案:训练难度几乎无关紧要,甚至教师从未解决的问题也有用。迁移强烈依赖于教师和学生之间的来源关系:同源配对使学生在语言、推理范围甚至其他领域上接近教师,而异源配对主要适应训练分布。这种广泛的影响是一把双刃剑:因为将提示路由到领域专家无法限制每位教师的影响,组合它们会导致能力之间的混合依赖的跷跷板效应。这些结果澄清了OPD何时泛化,并为诊断多教师OPD提供了有用的视角。
查看原文
查看缓存全文

缓存时间: 2026/08/24 08:28

论文页面 - 枚举皆有两面:论大语言模型在线蒸馏中泛化能力的双重性

来源:https://huggingface.co/papers/2608.16647 作者:

, , , , , , , , , , , , , , ,

摘要

在线蒸馏传递的是推理行为而非特定答案,其泛化能力与师生来源一致性紧密相关,而多教师组合则会导致能力权衡。

在线蒸馏(https://huggingface.co/papers?q=On-policy%20distillation)(OPD)通过监督从学生自身策略中采样的轨迹来传递教师能力,然而其泛化行为仍鲜为人知,因为大多数研究仅在单一领域且接近训练数据的基准上评估OPD。我们进行了一项对照研究,每次仅改变一个泛化因素,从领域内分布偏移(https://huggingface.co/papers?q=distribution%20shift)到跨领域迁移(https://huggingface.co/papers?q=cross-domain%20transfer),再到多教师(https://huggingface.co/papers?q=multi-teacher)设置。我们发现OPD传递的是教师的推理行为(https://huggingface.co/papers?q=reasoning%20behavior)而非其对特定问题的答案:训练难度几乎无关紧要,即使是教师从未解决过的问题也具有价值。迁移效果强烈依赖于师生之间的来源关系:同源(https://huggingface.co/papers?q=same-origin)配对能使学生在语言、推理深度乃至其他领域都接近教师,而异源(https://huggingface.co/papers?q=cross-origin)配对则主要拟合训练分布。这种广泛的影响是一把双刃剑:由于无法通过将提示路由到领域专家来限制每位教师的影响,将它们组合在一起会导致其能力之间产生依赖于组合方式的跷跷板效应。这些结果阐明了OPD何时具有泛化能力,并为诊断多教师(https://huggingface.co/papers?q=multi-teacher)OPD提供了有益视角。

查看arXiv页面(https://arxiv.org/abs/2608.16647)查看PDF(https://arxiv.org/pdf/2608.16647)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.16647)

在您的代理工具中获取此论文:

hf papers read 2608\.16647

没有最新CLI?请执行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型的README.md中引用arxiv.org/abs/2608.16647以从本页面建立链接。

引用本文的数据集0

无数据集链接本文

在数据集的README.md中引用arxiv.org/abs/2608.16647以从本页面建立链接。

引用本文的Spaces0

无Space链接本文

在Space的README.md中引用arxiv.org/abs/2608.16647以从本页面建立链接。

包含本文的收藏0

无收藏包含本文

将本文添加到收藏(https://huggingface.co/new-collection)以从本页面建立链接。

相似文章

多教师同策略蒸馏中的行为杠杆失衡

arXiv cs.CL

本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。

揭秘 On-Policy Distillation:角色、病理与调控

Hugging Face Daily Papers

本文系统研究了LLM后训练中的on-policy distillation,阐明了其作为探索催化剂的作用,并识别了Student-Teacher Mismatch和Length Exploitation等病理现象,提出了轻量级信号调控方法。