反思大语言模型在策略蒸馏 II:单个训练样本
摘要
本文研究了大语言模型的在策略蒸馏,表明单个训练查询就能实现显著的状态覆盖和对齐,表明该方法更受算法限制而非数据限制。
查看缓存全文
缓存时间: 2026/09/04 03:56
论文页面 - 重新思考大语言模型的在策略蒸馏 II:单次训练示例
来源:https://huggingface.co/papers/2609.04172 作者: , , , , , , , , , ,
摘要
在策略蒸馏能够通过快速覆盖教师状态,在单次查询的基础上改进数百步,然而学生的对齐过程依然缓慢,这表明该方法受限于算法能力而非数据不足。
在策略蒸馏 (https://huggingface.co/papers?q=On-policy%20distillation) (OPD) 将学生生成的滚动轨迹与来自教师的密集令牌级监督 (https://huggingface.co/papers?q=token-level%20supervision) 相结合。现有研究主要关注其算法行为,而数据在其中的角色尚不明确。我们在数据最小化极限条件下,通过仅用单次查询进行训练来考察这一角色。单次查询的 OPD 持续改进数百步,并在不同任务领域和模型家族中恢复了全数据 OPD 大部分的增益。我们通过训练期间访问的状态以及学生与教师的对齐速率来解释这一结果。我们衡量了状态覆盖率 (https://huggingface.co/papers?q=state%20coverage),即一组查询的滚动轨迹所能达到的、全数据 OPD 访问过状态的比例。单次查询即可达到 71.5%,其中大部分在前 100 步内完成。添加语义不同的查询可以同时提高覆盖率和验证集准确率,直至 16 个查询达到 98.9% 并匹配全数据训练。然而,无论 OPD 是在单次查询还是整个数据集上训练,其对齐过程都以相似的速度放缓,即使是固定的状态集也需要数百步才能被吸收。因此,OPD 是数据过饱和而算法能力不足。其滚动轨迹能快速暴露广泛的监督信号,而学生吸收该监督信号的能力则日益变慢。状态覆盖率的结果也延伸至多教师 OPD (https://huggingface.co/papers?q=multi-teacher%20OPD),其中每个领域 16 个语义多样的查询可以匹配全数据 MOPD。作为进一步的压力测试,内容简短的模板和域外的 WildChat 查询也能接近真实查询基线。因此,任务内容与其所诱导的状态覆盖率 (https://huggingface.co/papers?q=state%20coverage) 可能并不相关。我们希望这些发现能指引未来的工作关注 OPD 的步长效率 (https://huggingface.co/papers?q=step%20efficiency),并促使人们重新审视数据及其在前沿后训练中近期成功背后的机制。
查看 arXiv 页面 (https://arxiv.org/abs/2609.04172) 查看 PDF (https://arxiv.org/pdf/2609.04172) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.04172)
在您的智能助手中获取本文:
hf papers read 2609\.04172
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
Thinking-Space/UltraData-IF-1.5B 文本生成 • 2B • 4分钟前更新 (https://huggingface.co/Thinking-Space/UltraData-IF-1.5B)
引用本文的数据集0
没有关联本文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2609.04172 以从此页面链接。
引用本文的空间0
没有关联本文的空间
在空间 README.md 中引用 arxiv.org/abs/2609.04172 以从此页面链接。
包含本文的收藏夹1
相似文章
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。
硬币的两面:论大语言模型在策略内蒸馏中泛化的双重性
本文研究了大语言模型在策略内蒸馏中的泛化行为,表明它转移了推理行为,并且教师-学生来源对齐至关重要,多教师组合会导致能力权衡。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。
分布视角下的 SFT、RL 与 On-Policy Distillation(19 分钟阅读)
本文从分布视角分析语言模型的后训练方法,对比 SFT、RL 和 On-Policy Distillation 如何重塑模型分布,及其对灾难性遗忘等现象的影响。
超越 GRPO 与策略内蒸馏:语言模型后训练的经验性“稀疏至稠密”奖励原则
本文提出了一种用于语言模型后训练的经验性“稀疏至稠密”奖励原则,主张应使用稀疏奖励配合稀缺的标注数据进行教师模型发现,并使用稠密奖励通过蒸馏进行学生模型压缩。作者证明,这种连接稀疏强化学习与策略内蒸馏的分阶段方法,在数学基准测试中优于在部署规模模型上直接运行 GRPO 的效果。