论同策略蒸馏的几何结构
摘要
本文刻画了大语言模型中同策略蒸馏(OPD)独特的参数空间动力学,表明其具有松弛的非主方向更新和子空间锁定特性,从而与监督微调和基于可验证奖励的强化学习区分开来。
查看缓存全文
缓存时间: 2026/06/09 08:43
论文页面 - 关于在线策略蒸馏的几何结构
来源:https://huggingface.co/papers/2606.07082
摘要
在线策略蒸馏展现出独特的参数空间动态特性,其特点包括松弛的主更新和子空间锁定,形成了一种区别于监督微调和带可验证奖励的强化学习的独特几何模式。
在线策略蒸馏 (https://huggingface.co/papers?q=On-policy%20distillation)(OPD)越来越多地被用于改进大语言模型的推理能力,但其训练动态仍未被充分理解。我们描述了OPD更新在参数空间 (https://huggingface.co/papers?q=parameter%20space) 中的轨迹,并将其与监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning)(SFT)和带可验证奖励的强化学习 (https://huggingface.co/papers?q=reinforcement%20learning)(RLVR)进行了比较。一系列参数空间诊断方法 (https://huggingface.co/papers?q=parameter-space%20diagnostics) 一致地将OPD置于松弛的非主方向(off-principal)区域:与SFT相比,其更新影响更少的权重,并且更强烈地避开主方向;而与RLVR相比,其约束则不那么严格。除了这种静态局部化,OPD还表现出子空间锁定 (https://huggingface.co/papers?q=subspace%20locking):其累积更新迅速进入一个狭窄的低维通道。将训练限制在训练早期形成的更新子空间 (https://huggingface.co/papers?q=update%20subspace) 内,可以保持OPD的性能,但会显著降低SFT,表明该锁定子空间对OPD在功能上是足够的。控制实验进一步表明,稀疏化更新 token 以及将 rollout 生成切换为离线(off-policy)会保持秩动态 (https://huggingface.co/papers?q=rank%20dynamics),而将OPD目标与RLVR混合则会改变它们。总的来说,这些结果表明OPD不仅仅是SFT和RLVR之间的中间点,而是会在参数空间 (https://huggingface.co/papers?q=parameter%20space) 中诱导出自身特有的更新几何结构。
查看arXiv页面 (https://arxiv.org/abs/2606.07082)查看PDF (https://arxiv.org/pdf/2606.07082)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.07082)
在您的代理中获取该论文:
hf papers read 2606\.07082
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有链接该论文的模型
请在模型README.md中引用 arxiv.org/abs/2606.07082,以便从此页面链接。
引用该论文的数据集0
没有链接该论文的数据集
请在数据集README.md中引用 arxiv.org/abs/2606.07082,以便从此页面链接。
引用该论文的空间0
没有链接该论文的Space
请在Space README.md中引用 arxiv.org/abs/2606.07082,以便从此页面链接。
包含该论文的收藏2
相似文章
密集监督,稀疏更新:论在线策略蒸馏的稀疏性与几何特性
本文分析了在线策略蒸馏(OPD),发现OPD更新是稀疏的,分布在各个层且以FFN为主,并且保留了与密集参数重写不同的几何特性。这种稀疏结构在操作上有用,但由于梯度尺度异质性,诱导稀疏性的SGD优化器表现不如AdamW。
学会预见:揭示 On-Policy 蒸馏效率的解锁机制
本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。
EasyOPD: 一种易用的面向大语言模型在策略蒸馏框架
EasyOPD 是一种新型的大语言模型在策略蒸馏框架,它将配置、监督逻辑和执行分离开来,并支持跨分词器、自蒸馏和逐步 OPD。
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。
在线策略蒸馏的多重面貌:陷阱、机制与解决方案
本文对大语言模型的在线策略蒸馏进行了全面的实证研究,识别了分布不匹配和优化不稳定等故障机制,并提出了诸如停止梯度目标和针对 RLVR 改进的教师模型等解决方案。