反思大语言模型在策略蒸馏 II:单个训练样本

Hugging Face Daily Papers 论文

摘要

本文研究了大语言模型的在策略蒸馏,表明单个训练查询就能实现显著的状态覆盖和对齐,表明该方法更受算法限制而非数据限制。

在策略蒸馏(OPD)将学生生成的滚动输出与来自教师的密集令牌级监督相结合。现有工作主要研究了其算法行为,而训练数据的作用尚不明确。我们通过在单个查询上训练来检验这一作用,处于数据最小化的极限。单次OPD在数百步内持续改进,并在任务领域和模型家族中恢复了完整数据OPD的大部分增益。我们通过训练过程中访问的状态以及学生与教师对齐的速率来解释这一结果。我们测量状态覆盖,即完整数据OPD访问的状态中,由查询集的滚动输出达到的比例。单个查询已经达到了\(71.5\%\),其中大部分在100步内实现。添加语义上不同的查询共同提高覆盖和验证准确性,直到16个查询达到\(98.9\%\)并匹配完整数据训练。然而,无论OPD是在一个查询还是整个数据集上训练,对齐都以相似的速度放缓,甚至一组固定的状态也需要数百步来吸收。因此,OPD是数据过量但算法匮乏的。其滚动输出迅速暴露广泛的监督,而学生吸收这些监督的速度越来越慢。状态覆盖结果扩展到多教师OPD,其中每个领域16个语义多样化的查询匹配完整数据MOPD。作为进一步的压力测试,内容轻模板和域外WildChat查询也接近真实查询基线。因此,任务内容和诱导的状态覆盖可能分离。我们希望这些发现将未来的工作导向OPD的步进效率,并促使重新审视其最近在前沿后训练中的成功背后的数据和机制。
查看原文
查看缓存全文

缓存时间: 2026/09/04 03:56

论文页面 - 重新思考大语言模型的在策略蒸馏 II:单次训练示例

来源:https://huggingface.co/papers/2609.04172 作者: , , , , , , , , , ,

摘要

在策略蒸馏能够通过快速覆盖教师状态,在单次查询的基础上改进数百步,然而学生的对齐过程依然缓慢,这表明该方法受限于算法能力而非数据不足。

在策略蒸馏 (https://huggingface.co/papers?q=On-policy%20distillation) (OPD) 将学生生成的滚动轨迹与来自教师的密集令牌级监督 (https://huggingface.co/papers?q=token-level%20supervision) 相结合。现有研究主要关注其算法行为,而数据在其中的角色尚不明确。我们在数据最小化极限条件下,通过仅用单次查询进行训练来考察这一角色。单次查询的 OPD 持续改进数百步,并在不同任务领域和模型家族中恢复了全数据 OPD 大部分的增益。我们通过训练期间访问的状态以及学生与教师的对齐速率来解释这一结果。我们衡量了状态覆盖率 (https://huggingface.co/papers?q=state%20coverage),即一组查询的滚动轨迹所能达到的、全数据 OPD 访问过状态的比例。单次查询即可达到 71.5%,其中大部分在前 100 步内完成。添加语义不同的查询可以同时提高覆盖率和验证集准确率,直至 16 个查询达到 98.9% 并匹配全数据训练。然而,无论 OPD 是在单次查询还是整个数据集上训练,其对齐过程都以相似的速度放缓,即使是固定的状态集也需要数百步才能被吸收。因此,OPD 是数据过饱和而算法能力不足。其滚动轨迹能快速暴露广泛的监督信号,而学生吸收该监督信号的能力则日益变慢。状态覆盖率的结果也延伸至多教师 OPD (https://huggingface.co/papers?q=multi-teacher%20OPD),其中每个领域 16 个语义多样的查询可以匹配全数据 MOPD。作为进一步的压力测试,内容简短的模板和域外的 WildChat 查询也能接近真实查询基线。因此,任务内容与其所诱导的状态覆盖率 (https://huggingface.co/papers?q=state%20coverage) 可能并不相关。我们希望这些发现能指引未来的工作关注 OPD 的步长效率 (https://huggingface.co/papers?q=step%20efficiency),并促使人们重新审视数据及其在前沿后训练中近期成功背后的机制。

查看 arXiv 页面 (https://arxiv.org/abs/2609.04172) 查看 PDF (https://arxiv.org/pdf/2609.04172) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.04172)

在您的智能助手中获取本文:

hf papers read 2609\.04172

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

Thinking-Space/UltraData-IF-1.5B 文本生成 • 2B • 4分钟前更新 (https://huggingface.co/Thinking-Space/UltraData-IF-1.5B)

引用本文的数据集0

没有关联本文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2609.04172 以从此页面链接。

引用本文的空间0

没有关联本文的空间

在空间 README.md 中引用 arxiv.org/abs/2609.04172 以从此页面链接。

包含本文的收藏夹1

相似文章

学会预见:揭示 On-Policy 蒸馏效率的解锁机制

arXiv cs.CL

本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。

超越 GRPO 与策略内蒸馏:语言模型后训练的经验性“稀疏至稠密”奖励原则

Hugging Face Daily Papers

本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。