PowerOPD: 使用有界幂变换稳定在线策略蒸馏

arXiv cs.LG 论文

摘要

PowerOPD 引入了一种有界幂变换来稳定大型语言模型的在线策略蒸馏,在降低计算成本的同时,实现了准确性和样本效率的显著提升。

arXiv:2606.17199v1 公告类型:新 摘要:标准的大型语言模型在线策略蒸馏(OPD)通过学生采样的令牌来估计反向KL目标,得到无偏的单样本蒙特卡洛估计,避免了全词汇计算。然而,我们表明该估计器在实践中存在严重的训练问题:样本效率低、生成动态不稳定,以及与精确的全词汇OPD相比存在显著的性能差距。奖励级别的诊断将这些问题追溯到对数比值奖励,该奖励在构造上无界,产生集中在早期位置并持续整个训练过程的极高方差梯度;标准的后置缩放方法在此失真发生后才能起作用,因此无效。为了解决这个问题,我们提出了PowerOPD:一族来自Box-Cox幂变换的本征有界、符号一致的奖励,由alpha > 0参数化,其中对数比值是退化极限alpha -> 0。在六个数学推理基准和四个Qwen3师生对上,PowerOPD在基准平均Avg@8/Pass@8上分别比原始OPD提高了+6.37/+5.71,比后置稳定化提高了+3.01/+3.54,比全词汇OPD提高了+2.59/+8.90,同时减少了59.2%的挂钟时间和23.1%的峰值GPU内存。较大的alpha通常能提高准确率,一致地缩短响应长度,并使梯度范数比原始OPD小3000倍以上。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:36

# PowerOPD:通过有界幂变换稳定在线策略蒸馏 来源:https://arxiv.org/html/2606.17199

赵安豪¹˒²,童俊龙¹˒³,范颖琦¹,聂萍⁴,李文杰²,申晓宇¹

¹ 宁波东方理工大学(暂名)
² 香港理工大学
³ 上海交通大学
⁴ 滑铁卢大学

anhao\.zhao@connect\.polyu\.hk
xyshen@eitech\.edu\.cn

###### 摘要

大型语言模型的标准在线策略蒸馏(OPD)通过使用学生采样的token估计反向KL目标,得到一个无偏的单样本蒙特卡洛估计器,从而避免了全词汇计算。然而,我们表明该估计器在实践中存在严重的训练问题:样本效率低、生成动态不稳定,以及与精确的全词汇OPD相比存在显著的性能差距。奖励层面的诊断将这些问题的根源追溯到对数比率奖励,该奖励因其构造方式是无界的,会产生极高方差的梯度,且集中在早期位置并在整个训练过程中持续存在;标准的事后缩放方法失败,因为它们仅在此类失真发生后进行操作。为解决此问题,我们提出**PowerOPD**:一种基于Box-Cox幂变换的、天生有界且符号一致的奖励函数族,参数化为α\>0,其中对数比率是其退化极限α→0。在六个数学推理基准测试和四组Qwen3师生模型对上,PowerOPD在Avg@8/Pass@8上相比原始OPD获得了平均高达**+6.37/+5.71**的提升,相比事后稳定方法提升了**+3.01/+3.54**,相比全词汇OPD提升了**+2.59/+8.90**,同时将单步耗时减少了**59.2%**,将峰值GPU内存减少了**23.1%**。较大的α通常能提高准确率、持续缩短回复长度,并使梯度范数比原始OPD小**3,000多倍**。我们已在EIT-NLP/PowerOPD (https://github.com/EIT-NLP/PowerOPD) 开源了代码。

# PowerOPD:通过有界幂变换稳定在线策略蒸馏

赵安豪¹˒²,童俊龙¹˒³,范颖琦¹,聂萍⁴,李文杰²,申晓宇¹†††通讯作者

¹ 宁波东方理工大学(暂名)
² 香港理工大学
³ 上海交通大学
⁴ 滑铁卢大学

anhao\.zhao@connect\.polyu\.hk
xyshen@eitech\.edu\.cn

## 1 引言

在线策略蒸馏(OPD)已迅速成为大型语言模型(LLM)后训练的标准组件 (Gu et al., 2024 (https://arxiv.org/html/2606.17199#bib.bib2); Agarwal et al., 2024 (https://arxiv.org/html/2606.17199#bib.bib5); Song and Zheng, 2026 (https://arxiv.org/html/2606.17199#bib.bib30))。通过将监督信号建立在学生自身生成的轨迹上,OPD缓解了监督微调(SFT)和经典离线策略蒸馏中的暴露偏差 (Bengio et al., 2015 (https://arxiv.org/html/2606.17199#bib.bib38); Hinton et al., 2015 (https://arxiv.org/html/2606.17199#bib.bib44); DeepSeek-AI, 2025 (https://arxiv.org/html/2606.17199#bib.bib49)),同时与稀疏奖励的强化学习(RL)相比提供了密集的token级反馈。这些优势使得OPD成为现代后训练中连接SFT和RL的广泛采用的桥梁 (Qwen Team (2025 (https://arxiv.org/html/2606.17199#bib.bib6)); Zhipu AI Team (2026 (https://arxiv.org/html/2606.17199#bib.bib7)); DeepSeek Team (2026 (https://arxiv.org/html/2606.17199#bib.bib9)); LLM-Core Xiaomi (2026 (https://arxiv.org/html/2606.17199#bib.bib12)))。

(参见图标题)

图 1: PowerOPD相比原始OPD实现了**+9.6**的准确率提升和**10倍**的样本效率,与全词汇KL OPD性能相当或更优,同时耗时减少59.2%(Qwen3-1.7B←Qwen3-4B, MATH-500)。

在其原始形式中,OPD通过比较每个生成步骤中教师和学生分布在整个词汇表上的概率来最小化反向KL散度。然而,计算全词汇目标在实践中代价高昂。因此,现代实现通过使用学生采样的token来估计目标,得到一个无偏的单样本蒙特卡洛估计器 (Lu and Thinking Machines Lab, 2025 (https://arxiv.org/html/2606.17199#bib.bib46); Jin et al., 2026 (https://arxiv.org/html/2606.17199#bib.bib16); Ko et al., 2026 (https://arxiv.org/html/2606.17199#bib.bib17); Jia et al., 2026 (https://arxiv.org/html/2606.17199#bib.bib26); Liu et al., 2026b (https://arxiv.org/html/2606.17199#bib.bib51); Zhao et al., 2026a (https://arxiv.org/html/2606.17199#bib.bib25), b (https://arxiv.org/html/2606.17199#bib.bib50))¹。尽管被广泛采用,我们观察到原始OPD在实践中表现出严重的**病态训练动态**。在一个代表性的Qwen3-4B教师和Qwen3-1.7B-Base学生模型在MATH-500上的设置中,尽管有密集的token级监督,验证准确率最初下降并在数百个训练步骤中未能恢复,这表明样本效率低下。同时,回复长度在稳定之前经历了大幅振荡,表明学生反复进入不稳定的生成状态。即使在收敛后,原始OPD也仅达到54.93%的准确率,落后于全词汇OPD 8.19个百分点。这些失败共同表明,**原始OPD所依赖的蒙特卡洛近似引入了优化困难,严重限制了训练效率和最终性能**。

¹由于这种采样token的公式因其成本显著降低而成为OPD的事实标准实现,我们在本文中将其称为*原始OPD*。

为了理解这些病态训练动态的根源,我们检查了直接加权每个策略梯度更新的token级奖励:教师-学生对数概率比。我们的诊断表明,无界对数比率奖励从三个维度扭曲了更新信号:(i) 极端奖励方差,奖励值骤降至接近-50,允许单个罕见token主导梯度更新并引发生成不稳定;(ii) 早期位置极值,巨大的奖励幅度不成比例地击中学生rollout的早期位置,破坏了前缀分布并导致级联错误,从而造成样本效率低下;(iii) 持续存在的极端奖励,这些巨大的正负值未能衰减,在整个优化过程中注入不稳定性。值得注意的是,应用标准的RL奖励稳定工具 (Mnih et al., 2015 (https://arxiv.org/html/2606.17199#bib.bib39); Schulman et al., 2017 (https://arxiv.org/html/2606.17199#bib.bib45)),如裁剪、tanh压缩和z-score归一化,无法解决这些问题,这表明**不稳定性源于无界对数比率奖励本身,而非事后缩放不足**。

认识到无界性是根本原因,我们将OPD奖励设计重新定义为学习一个原则性的概率到奖励映射。一个良态的OPD奖励必须满足两个属性:有界性,以防止罕见的蒙特卡洛事件引发灾难性的梯度更新;以及符号一致性,以确保奖励符号正确对齐教师-学生概率差距(即,当教师分配的概率高于学生时产生正奖励,反之亦然)。我们保留了标准奖励的“变换-然后-减法”结构,即h(π_T) − h(π_θ),因为对于任何严格递增的h,这保证了符号一致性。为了在不对齐这种方向性信号的情况下实现有界性,我们使用Box–Cox幂变换家族 (Box and Cox, 1964 (https://arxiv.org/html/2606.17199#bib.bib1))来实例化h。这产生了**PowerOPD**:一个参数化为α>0的有界且符号一致的OPD奖励函数族。虽然不稳定的标准对数比率奖励代表了退化极限α→0,但我们的公式确保对于任何α>0,奖励严格有界。

我们在六项数学推理基准测试上评估了PowerOPD,涵盖了Qwen3系列的四个师生模型对(0.6B和1.7B学生;4B和8B教师)。如图1 (https://arxiv.org/html/2606.17199#S1.F1)所示,使用Qwen3-1.7B-Base学生和Qwen3-4B教师,PowerOPD相比原始OPD取得了**+9.6**的准确率提升,并且只需**十分之一**的训练步数即可达到相同的准确率水平。在整个基准评估中,PowerOPD在Avg@8/Pass@8上相比原始OPD平均提升了最多**+6.37/+5.71**,相比事后稳定方法提升了**+3.01/+3.54**,相比全词汇OPD提升了**+2.59/+8.90**,单个基准的提升分别达到**+16.75/+15.00**、**+8.43/+7.50**和**+11.60/+25.00**,同时相比全词汇OPD,每步耗时减少了**59.2%**,峰值GPU内存减少了**23.1%**。值得注意的是,PowerOPD随α缩放:较大的α通常能提高准确率、缩短回复长度并稳定训练动态。我们进一步表明,这种可扩展性有机制上的基础:较大的α抑制了那些教师和学生模型都分配低概率的token的奖励,同时聚焦学习于那些教师或学生认为可能的token。最后,梯度追踪显示,PowerOPD将梯度范数维持在比原始OPD初始峰值低**3,000多倍**的水平,而事后方法只能部分稳定训练。

(参见图标题(a))
(参见图标题(b))
(参见图标题(c))

图 2: 病态的OPD奖励。OPD奖励表现出 (a) 高方差和严重的负尾,(b) 早期位置极值,以及 (c) 训练过程中持续存在的极值。

## 2 预备知识

### 2.1 在线策略蒸馏

在线策略蒸馏(OPD)(Agarwal et al., 2024 (https://arxiv.org/html/2606.17199#bib.bib5); Gu et al., 2024 (https://arxiv.org/html/2606.17199#bib.bib2); Song and Zheng, 2026 (https://arxiv.org/html/2606.17199#bib.bib30))已成为LLM后训练流程中的标准步骤 (Qwen Team, 2025 (https://arxiv.org/html/2606.17199#bib.bib6); Zheng et al., 2025 (https://arxiv.org/html/2606.17199#bib.bib10); Zhipu AI Team, 2026 (https://arxiv.org/html/2606.17199#bib.bib7); Yang et al., 2026 (https://arxiv.org/html/2606.17199#bib.bib8); DeepSeek Team, 2026 (https://arxiv.org/html/2606.17199#bib.bib9); Tencent Robotics X and HY Vision Team, 2026 (https://arxiv.org/html/2606.17199#bib.bib11); LLM-Core Xiaomi, 2026 (https://arxiv.org/html/2606.17199#bib.bib12); KwaiKAT Team, 2026 (https://arxiv.org/html/2606.17199#bib.bib13); Qwen Team, 2026 (https://arxiv.org/html/2606.17199#bib.bib14))。它训练学生策略π_θ与学生自身生成的轨迹上匹配更强大的教师策略π_T。这种在线训练通过将训练时的上下文与学生推理时的生成对齐来减少暴露偏差。OPD最小化反向KL散度,这鼓励向教师的主导模态进行模式寻求 (Lu and Thinking Machines Lab, 2025 (https://arxiv.org/html/2606.17199#bib.bib46)):

D_KL(π_θ ∥ π_T) = E_{x∼D, o∼π_θ(·|x)} [log (π_θ(o|x) / π_T(o|x))],

其中x是来自D的提示,o=(o_1, ..., o_{|o|})是学生生成的回复。

### 2.2 OPD作为密集奖励强化学习

利用π_θ和π_T的自回归分解,OPD最大化负反向KL目标,以token级形式表示为:

J_OPD(θ) = E_{x∼D, o∼π_θ(·|x)} [ Σ_{t=1}^{|o|} log (π_T(o_t|c_t) / π_θ(o_t|c_t)) ],

其中c_t = (x, o_{<t})是截至步骤t-1的上下文。这可以自然地重新解释为token级RL:

∇_θ J_OPD(θ) = E_{x∼D, o∼π_θ} [ Σ_{t=1}^{|o|} r_t ∇_θ log π_θ(o_t|c_t) ],

其中r_t = log (π_T(o_t|c_t) / π_θ(o_t|c_t)),且梯度被*停止*(即,作为常数处理)以防止学生概率通过r_t对自身梯度进行二阶贡献。(Agarwal et al., 2024 (https://arxiv.org/html/2606.17199#bib.bib5); Song and Zheng, 2026 (https://arxiv.org/html/2606.17199#bib.bib30))。

## 3 原始OPD的病理学

我们从实证角度诊断了原始OPD中蒙特卡洛近似的失败。所有实验使用Qwen3-1.7B-Base作为学生和Qwen3-4B作为教师,在MATH-500上进行。

### 3.1 训练动态

**不稳定的准确率。** 准确率最初下降超过10个点,并且需要超过1500步才能恢复。这表明大量的早期梯度要么产生均匀分布的token,要么反复破坏学习到的知识。

**不稳定的回复。** 回复长度振荡不定(标准差>1000),这表明学生偶尔陷入几乎恒定的生成或循环模式。这表明无界的奖励导致了生成不稳定。

**性能差距。** 表1列出了最终收敛的验证性能。原始OPD落后全词汇KL OPD(其在每一步计算所有词汇表上的KL散度)超过8个点。

| 方法 | 准确率 |
| :--- | :--- |
| Qwen3-1.7B-Instruct(监督微调基线) | 61.20 |
| 全词汇KL OPD | 63.12 |
| 原始OPD(单样本) | 54.93 |

表 1: 原始OPD与全词汇OPD在MATH-500上的性能差距(Qwen3-1.7B-Base学生,Qwen3-4B教师)。

**样本效率低下。** 图1(右)显示了每百万token的准确率。原始OPD需要超过4倍的数据才能匹配PowerOPD在相同间隔下的性能。在处理有限学生生成数据或高推理成本的蒸馏设置中,这构成了严重的瓶颈。

### 3.2 根因:无界奖励

原始OPD的不稳定性直接源于其token级奖励的无界性:

r_t = log (π_T / π_θ)

由于π_θ和π_T是概率值,对数比率在理论上可以变化到任意大小。在实践中,当学生为教师高度自信的token分配极低概率时,r_t变得非常负。我们在MATH-500上的训练过程中追踪了r_t值。图2a显示了其分布:奖励具有巨大的方差和沉重的负尾,单个token的奖励值轻松达到-30到-50。鉴于策略梯度更新(公式2)与r_t成线性比例,这些极端值使得单次更新能够完全支配整个序列的梯度。

**早期位置偏差。** 图2b将奖励按其在序列中的步骤位置进行分组。极端的大幅奖励不成比例地击中前几个位置。这是因为初始token在教师的高概率和学生的不确定之间表现出更大的差距,同时由于因果自回归生成,它们限制了所有后续token的生成。这种早期位置的奖励浓度导致学生前缀分布的不稳定摇摆,并引发整个序列的级联错误。

**持续性。** 图2c绘制了训练过程中最大|r_t|的变化。在整个训练过程中,极端奖励(>20)持续出现;其幅度在后期略有下降,但从未消失。因此,更新始终被极端且噪声巨大的奖励所支配。

## 4 PowerOPD

由于问题的根源在于奖励值的无界性,我们设计了一个原则性的方法来构建天生有界的OPD奖励。我们不是应用事后压缩(这无法解决无界性本身),而是重新构建从概率到奖励的映射。

### 4.1 设计原则

一个良态的OPD奖励函数r_t应该满足两个属性:

- **P1:有界性。** 存在一个常数M > 0,使得对于所有p, q ∈ [0,1],有|f(p,q)| ≤ M。如果f是无界的,那么教师或学生概率的微小变化可以产生任意大的奖励幅度,直接放大了如§3.2所诊断的策略梯度更新的方差。

- **P2:符号一致性。** f的符号应指示哪个模型对被采样的token分配了更高的概率:如果p > q,则f(p,q) > 0;如果p = q,则f(p,q) = 0;如果p < q,则f(p,q) < 0。

### 4.2 变换-然后-减法作为构式

考虑形式为f(p,q) = h(p) − h(q)的奖励函数,其中h : [0,1] → ℝ是一个严格递增函数。如果h是严格递增的,那么p > q ⇒ h(p) > h(q)且r_t > 0。因此,P2由构造保证。奖励的稳定性完全由h的选择控制:对数比率的问题不在于变换-然后-减法的结构,而在于具体选择h(x) = log x,它将[0,1]映射到(−∞, 0]并在零处发散,使得h(π_T) − h(π_θ)无界,违反了P1。因此,精确的解决方法是:保留变换-然后-减法结构,并将h = log替换为一个在[0,1]上既严格单调递增又有界的函数。

### 4.3 Box-Cox族

一个自然且经过充分研究的目标函数族是Box–Cox幂变换 (Box and Cox, 1964 (https://arxiv.org/html/2606.17199#bib.bib1)):

h_α(x) = (x^α − 1) / α, α > 0.  (3)

对于任何α > 0,h_α在[0,1]上是严格递增且有界的。将h_α代入h(p) − h(q)得到(p^α − q^α) / α。由于1/α是一个与token和策略参数无关的正常数,我们将其吸收到学习率中,并使用缩放后的奖励p^α − q^α,其范围在[−1, 1]内。

**对数比率作为极限情况。** 标准对数比率奖励对应于Box-Cox变换的边界情况α→0。通过一阶泰勒展开x^α = 1 + α log x + o(α),我们有h_α(x) = (x^α−1)/α → log x,因此h_α(p) − h_α(q) → log p − log q。然而,这个极限对于奖励设计来说是退化的:虽然每个固定的α>0给出一个有界变换,但其范围随着α→0而扩大,恢复了无界的对数变换,从而违反了P1。

### 4.4 PowerOPD

上述分析确定了一个原则性的、天生有界且符号一致的OPD奖励函数族。遵循§2.2中的策略梯度公式,我们引入**PowerOPD**,它使用以下停止梯度的token级奖励:

r_t^α = sg[ π_T(o_t|c_t)^α − π_θ(o_t|c_t)^α ], α > 0.  (4)

**验证。** 由于p, q ∈ [0,1]且α>0,我们有p^α, q^α ∈ [0,1],因此r_t^α ∈ [−1,1]:P1成立。由于h(x) = x^α对于α>0是严格递增的,π_T > π_θ ⇒ r_t^α > 0:P2成立。至关重要的是,两者都是(待续……)

相似文章

学会预见:揭示 On-Policy 蒸馏效率的解锁机制

arXiv cs.CL

本文研究了大型语言模型中 On-Policy 蒸馏(OPD)效率背后的参数级机制,将其归因于模块分配和更新方向上的早期“预见性”。本文提出了 EffOPD,一种即插即用方法,可在不损害最终性能的情况下将 OPD 训练速度提高 3 倍。

Trust Region On-Policy Distillation

Hugging Face Daily Papers

本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。

Weak-to-Strong On-Policy Distillation

arXiv cs.LG

介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。