论同策略蒸馏的几何结构

Hugging Face Daily Papers 论文

摘要

本文刻画了大语言模型中同策略蒸馏(OPD)独特的参数空间动力学,表明其具有松弛的非主方向更新和子空间锁定特性,从而与监督微调和基于可验证奖励的强化学习区分开来。

同策略蒸馏(OPD)越来越多地被用于改进大语言模型的推理能力,但其训练动态仍未被充分理解。我们刻画了OPD更新在参数空间中的轨迹,并将其与监督微调(SFT)和基于可验证奖励的强化学习(RLVR)进行比较。一套参数空间诊断方法一致地将OPD置于松弛的非主方向区域:与SFT相比,其更新影响更少的权重并更强烈地避开主方向;而与RLVR相比,其约束则不那么严格。除了这种静态局部化,OPD还表现出子空间锁定:其累积更新迅速进入一个狭窄的低维通道。将训练限制在训练早期形成的更新子空间内,能够保持OPD的性能,但会显著降低SFT的表现,表明该锁定子空间在功能上对OPD是充分的。控制实验进一步表明,稀疏化更新token以及将rollout生成移出在线策略(off-policy)会保持秩动态,而将OPD目标与RLVR混合则会改变它们。总体而言,这些结果表明OPD不仅仅是SFT和RLVR之间的一个中间点,而是在参数空间中具有其自身的更新几何结构。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:43

论文页面 - 关于在线策略蒸馏的几何结构

来源:https://huggingface.co/papers/2606.07082

摘要

在线策略蒸馏展现出独特的参数空间动态特性,其特点包括松弛的主更新和子空间锁定,形成了一种区别于监督微调和带可验证奖励的强化学习的独特几何模式。

在线策略蒸馏 (https://huggingface.co/papers?q=On-policy%20distillation)(OPD)越来越多地被用于改进大语言模型的推理能力,但其训练动态仍未被充分理解。我们描述了OPD更新在参数空间 (https://huggingface.co/papers?q=parameter%20space) 中的轨迹,并将其与监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning)(SFT)和带可验证奖励的强化学习 (https://huggingface.co/papers?q=reinforcement%20learning)(RLVR)进行了比较。一系列参数空间诊断方法 (https://huggingface.co/papers?q=parameter-space%20diagnostics) 一致地将OPD置于松弛的非主方向(off-principal)区域:与SFT相比,其更新影响更少的权重,并且更强烈地避开主方向;而与RLVR相比,其约束则不那么严格。除了这种静态局部化,OPD还表现出子空间锁定 (https://huggingface.co/papers?q=subspace%20locking):其累积更新迅速进入一个狭窄的低维通道。将训练限制在训练早期形成的更新子空间 (https://huggingface.co/papers?q=update%20subspace) 内,可以保持OPD的性能,但会显著降低SFT,表明该锁定子空间对OPD在功能上是足够的。控制实验进一步表明,稀疏化更新 token 以及将 rollout 生成切换为离线(off-policy)会保持秩动态 (https://huggingface.co/papers?q=rank%20dynamics),而将OPD目标与RLVR混合则会改变它们。总的来说,这些结果表明OPD不仅仅是SFT和RLVR之间的中间点,而是会在参数空间 (https://huggingface.co/papers?q=parameter%20space) 中诱导出自身特有的更新几何结构。

查看arXiv页面 (https://arxiv.org/abs/2606.07082)查看PDF (https://arxiv.org/pdf/2606.07082)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.07082)

在您的代理中获取该论文:

hf papers read 2606\.07082

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有链接该论文的模型

请在模型README.md中引用 arxiv.org/abs/2606.07082,以便从此页面链接。

引用该论文的数据集0

没有链接该论文的数据集

请在数据集README.md中引用 arxiv.org/abs/2606.07082,以便从此页面链接。

引用该论文的空间0

没有链接该论文的Space

请在Space README.md中引用 arxiv.org/abs/2606.07082,以便从此页面链接。

包含该论文的收藏2

相似文章

密集监督,稀疏更新:论在线策略蒸馏的稀疏性与几何特性

Hugging Face Daily Papers

本文分析了在线策略蒸馏(OPD),发现OPD更新是稀疏的,分布在各个层且以FFN为主,并且保留了与密集参数重写不同的几何特性。这种稀疏结构在操作上有用,但由于梯度尺度异质性,诱导稀疏性的SGD优化器表现不如AdamW。

学会预见:揭示 On-Policy 蒸馏效率的解锁机制

arXiv cs.CL

本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。

带可验证奖励的策略内蒸馏

Hugging Face Daily Papers

论文介绍了OPDVR,这是一种结合策略内蒸馏与可验证奖励的方法,使用ReLU门控重配来增强大型语言模型的推理能力,无需额外超参数,在六个基准测试上优于标准方法。

理解离策略与同策略蒸馏:两类不同训练目标的故事

arXiv cs.LG

这篇 UCLA 论文从理论上分析了同策略蒸馏(OPD)与离策略/SFT 式蒸馏的区别,展示了前向 KL 与反向 KL 目标如何分别将多个教师模型聚合为算术混合与几何混合,建立了对数级遗憾界,并解释了 OPD 的优势与脆弱性(例如对低概率教师的敏感性以及错误前缀偏差)。