@qingke_ai: https://x.com/qingke_ai/status/2073975637904380059
摘要
本文研究了在线蒸馏中的位置偏差现象,发现早期token提供更有用的监督信号,并提出重要性加权IW-OPD方法来改善OPD训练。
查看缓存全文
缓存时间: 2026/07/06 12:12
OPD的代币加权真的合理吗?也许代币才是关键,均匀早期全错了!
原文链接:https://yannx1e.github.io/IW-OPD/ 论文作者:Yan Xie, Sijie Zhu, Tiansheng Wen, Bo Chen, Yifei Wan
摘要
在线蒸馏(On-Policy Distillation, OPD)之所以受到关注,是因为它结合了两个有用的要素:学生模型在自己的 rollouts 上进行训练,而教师模型则对这些 rollouts 提供密集的 token 级反馈。这也使得 OPD 成为稀疏奖励强化学习在语言模型后训练中的自然替代方案。
在本文中,我们研究了一个不那么冗长的问题:一旦获得了密集的教师反馈,这些反馈中响应的哪些位置才是真正有用的?OPD的效果不仅取决于我们收集了多少学生的展示,还取决于教师信号是否能够继续引导学生走向更好的推理位置上。
我们发现了一种强烈的位置效应。学生推出中的代币往往比晚期代币标注更有用的监督信号。随着学生继续生成,其远端可能会远离教师的高概率推理区域。教师仍然会被查询,但现在生成它需要在可能不是自己的邻居下对代币进行评分。因此,密集监督并不自动地等价于同等有用的监督。
我们将这种现象称为OPD中的位置偏差( positionbias)。为了进一步诊断这个问题,我们进行了对照研究,并发现了两个有趣的现象:
-
早期代币监督驱动着OPD的性能;
-
师生差距在OPD训练后基本持续存在。
为了理解这一现象,我们从约束优化的角度重新赋予OPD。然后我们推导出该约束下的最优化策略,并用该最优化解来解释为什么与教师兼容的邻居应该获得更多的权重。IW -OPD就是基于这一原则设计的:保留密集的令牌级OPD信号,但加强对仍然看起来与教师兼容的邻居的重视程度。
一、信号监督花在哪里
设 为学生模型,为教师模型。对于一个提示和一个由学生采样的响应,标准 OPD 在学生自己的 rollout 上分布上最小化一种反向 KL 风格的目标函数:
在策略微调实现中,这给出了一个象征性的局部优势:
OPD对每个采样的响应令牌应用令牌级损失,一种自然的实现是对这些损失进行平均均匀。这很简单,但假设教师信号在各个位置上同等有用。在引入加权规则之前,我们先问一个更基本的重要性问题:如果我们在同一个学生响应的不同部分上进行训练,效果会一样吗?
二、位置偏差
我们从一个简单的操作开始:在保持模型、数据和训练设置不变的情况下,使用来自响应不同部分的标记训练 OPD 变体。
-
Prefix -30 :仅对响应前30%的代币应用OPD
-
Suffix -30 :仅对响应后30%的代币应用OPD
-
标准OPD :使用所有有效的响应代币
这个实验是刻意粗糙的;其目的是测试位置本身是否具有可轻松的影响。
数量相同。在这个对照实验中,Prefix-30与完整的OPD相当或超过晚上,而Suffix-30学习效果很差。这表明密集监督的数量并不全部——监督的位置同样重要。
这一结果揭示了 OPD 中一种依赖于位置的效应。早期和晚期令牌不可互换:它们处于不同的多次分配下采样的,它们训练可能会导致不同的结果。我们将这种现象称为位置偏差。
这个结果不是“早期代币总是更好”的简单的宝石。更好的解释是:早期代币更多可能在教师分配仍然对改善学生推理路径有意义的另外下被评分。
晚期标记则以学生的全部已有生成为条件。如果学生已经离开了与教师兼容的区域,后缀可能在局部可预测,但修正了对早期的全局作用较小。
这与最近对推理更新的分析有松散的联系,这些分析发现某些标记或位置不成比例的影响,例如关于高熵分叉标记、关键标记训练以及将推理标记与样板标记分开的工作。
下一个问题是:为什么会出现这种位置效应?以下诊断探查了晚期位置是简单地“更晚”,还是因为连通与教师不那么兼容的外接为条件。
三、偏差读数的诊断
诊断一:强大的教师能否从学生中恢复?
我们对模型都以学生生成的两个邻居为条件,测量最终到达正确答案的概率。这并不是直接训练模型;而是探查该邻居是否仍然是教师指导的有用状态。
师生的眉毛。教师从更高的眉毛矫正率开始,但其恢复能力随着学生的增长而上升。这短短的学生可能会向下游拉向,即使教师也有机会到达正确答案的区域。
此图是我们解释的核心。OPD在学生的导出上查询教师,而不是在教师自己的理想导出上。在响应前期,教师通常仍能识别出一条接入正确解的路径。
后来,在学生做出了足够的局部选择之后,同一个教师被要求从一个可能编码的不同计划的上下文继续。监督仍然是密集更新的,但它与我们希望做出的矫正程度较低。
诊断二:训练过程中师生KL能否自我修复?
如果师生KL能力被降低到足够低的值,OPD本身可能逐渐修复邻居问题:随着的进行,晚期的学生远程将与教师更加兼容。因此,该诊断测试OPD是否能够能够自行修复这种不匹配。
如果OPD只是将学生一直移动到教师分配,我们预期KL会缩小持续于零。然而,平均KL在早期下降后趋于平稳。
KL降低是局部的。意味着令牌级KL在训练初期下降,但留下了一个非零的残差。在我们的诊断中,即使在渗透堵截后,这种降低也是有限的。
这个高原表明,OPD更应被视作一种局部更新策略,而不是无约束的教师匹配。这对位置偏差很重要:当更新只能将学生移动有限的距离时,不同的代币位置可以具有不同的杠杆作用。
诊断三:残差不匹配是否在响应的第一部分?
并非如此。令牌级KL在训练后即使覆盖广泛的相对位置仍然是非零的。
跨位置的残差不匹配。OPD提高了与教师的一致性,但它并没有消除整个推出中师生间的不匹配。因此,均匀加权继续对不同出口质量的位置进行平均。
诊断四:互连相似的可视化
沿着学生采样的展开,另外在学生模型下自然保持相对较前面的似然(这是由采样决定构造的)。但在教师模型下,相同的另一似然下降得更快。这是上面结果在分区的版本。
对数似然空间中的另一方。教师-学生远似然比倾向随着学生生成的邻接增长而缩小。这促使我们使用邻接空间(而不是令牌位置)作为重加权的单位。
综合来看,这些诊断说明了为什么位置偏差对上升质量非常重要。我们不仅仅是在随机位置有噪声监督,而是一种重构的不匹配:晚期令牌更可能与不太兼容的相邻为条件,而均匀OPD继续在它们上面占用相同的令牌权重。
四、有限仰角
这些诊断促使我们采用有限布局视角,我们将其解释所观察到的位置偏差的分析工具。我们不问学生是否可以随意移动,会怎样分配来配合教师;而是问学生在当前周围的一个小KL球内,怎样分配作为最接近教师:
这里是有效的局部更新布局。这个视角与信任域和近端策略优化思想有关,如TRPO和PPO:单次更新可以改进策略,但不能将学生的分配替换为教师的分配。
在非状态普通下,教师位于学生的局部KL球之外。在共同支撑下,约束最优解有闭式解:
约束下的最优解为观察到位置偏差提供了解释。最优化局部目标不是教师本身,而是向教师下更可能的学生分布倾向。这种倾向就是教师-学生似然比。
这并不意味着后缀令牌是无用的。它意味着均匀的令牌加权不是有限的预算所隐含的分配规则。随着学生的改进,树木的另一根与教师兼容,晚期令牌可以再次接收更有用的监督。
五、从投影到IW-OPD
局部投影识别出影响的教师旋转分配。但是我们在OPD期间实际观察到的数据是从当前学生采样的。这种不符合的是优先分配进入的位置。
类似的分配校正思想出现策略在优化和偏好优化工作中,如 GSPO 和 DPO,尽管我们这里的用途具体来说是 OPD 的相邻级分配规则。
OPD只能优化当前学生策略周边的一个局部区域。在约束优化视角下,OPD能够达到的最佳策略是,它利用似然比简单的师生差距来重新分配基础学生策略。
从早先的分析中,只有具有相对相似的相似比的标记才能提供有意义的OPD学习信号,因为其他标记被采样的概率非常低。基于此,我们使用投影的教师对齐策略作为学习目标,强调概率高、与教师兼容的样本:
由于投影停留在局部KL球的边界上,正KL项划分为一个固定的局部配置项加上下一个的期望。这是一个三行步骤,将有限的布局视角转化为重要性加权目标:
问题出现在我们在 OPD 期间不是从采样,而是从采样。测度转换用强度权重重写了期望。在表格中,主论文中的似然比是,投影目标感应的密度比为:
对于代币级OPD,相关的因果对象是出口。遵循主论文的符号,相应的归一化出口比为:
这给出了从抽样推广开始的代币级别目标:
其半梯度与OPD相同的策略梯度形式,但具有优先权重的优势:
这就是 OPD 优势在 IW-OPD 中重新出现的原因。该推导没有引入新的令牌损失;而是改变了乘以通常 OPD 策略梯度信号的系数。
解读上,同时OPD将观察到的学生分配视为期望的局部目标。IW-OPD问的是如何将观察到的分配向预设局部目标的教师分配。以高教师-学生似然比的另一方获得更多的权重;而积累了师生的另一方获得了另一权重。
六、实用的代理目标
首先比目标提出了一个明确的分配原则,但直接在有限的在线训练中使用是不稳定的。实用的IW-OPD权重遵循论文的四步修改:使用数字对缩放比、修改符号取消、在推出中归一化、以及将结果与标准OPD插值。在这些修改中,消融显示为什么仅锐度之前是不够的。
首先,直接的附加比加权是脆弱的,因为附加概率在代币上相乘。即使有指数,在推出时的系数增长也可能变得更加激进。第一个消融询问调整后的是否足够。
通过可视化逐个令牌地落地出现了相同的问题。它促使了下面的第一个转换:对数空间视图提出了我们希望实用代理避免的下游下行趋势和局部反弹。
**问题:原始反向比正确的指数是否有效?**大的值使权重相对对抗并训练损害;非常小的值使权重顶层化,行为更接近标准OPD。这表明作为分配原则是有用的,但作为实际的训练消耗是脆弱的。
**问题:符号化的基于的权重逐令牌做什么?**下游的下行趋势与位置偏差直觉相符,但出现了局部急剧上升,符号化的对概率差距可以相互协调。这使得字面的外部比作为更新系数不稳定的。
I. 对数缩放
使用操作概率比的乘积,不如在对数空间中进行工作。令 ,对数缩放的旋转分数为:
数字空间形式在分数上比较清晰,但它又带来了另一个问题。累积是有符号的:正负令牌缺口可以相互配合,因此对一个分数可能在一个已经突破多个生不匹配后反弹师。
二. 修改 正优势 取消
由于推出代币是从学生采样的,师生对这些代币中的数字偏差上经常为负。有时教师比学生分配更高的概率,产生计算负偏差的正项。我们通过将每个代币的级数不一致转换为非正的计量误差来减少这种取消:
**问题:彼此差异应该是有符号的还是无符号的?**无符号版本在这个消融中表现得更好。结果支持这样一种观点:两个方向的不一致都应该计为彼此,而不是允许正负差距相互协调。
三. 归一化
符号在rollout上单调时会产生差异,但它的规模仍然可能在不同的样本间差异很大。因此我们在每次rollouts内部进行归一化,将序列映射起始处到接近1,将积累更大不匹配的局部映射到接近0:
四. 与 OPD 插值
归一化后,序列增加代币可能收到非常低的权重。IW-OPD 不是删除密集监督,而是将归一化末端份额与标准 OPD 进行插值:
解读的形式很简单:积累师生不一致的另一个收到更大的乘数,而已经积累了许多不一致的回落接近至标准OPD。这个设计选择很重要。
IW-OPD不是从晚期令牌删除密集监督,而是将标准OPD作为底限,分离权重,并附加额外的临时预算分配以提供更兼容的远端。在我们的主要实验中,我们使用,而时准确地恢复标准OPD。
现实草图
-
采样提示并在线策略生成学生推出
-
在采样的响应令牌中评估学生和教师的日志概率
-
来自师生对数概率差距计算标准 OPD优势
-
计算独占累积无符号差异并转换为
-
使用不同的PPO风格目标进行训练,用替换
该方法不需要标准 OPD 之外的额外教师评估。它改变了已经计算出的信号的分配。
七、实验
我们在同家族和拓扑结构上调整了IW-OPD。学生模型为Qwen3-4B、Qwen3-1.7B和Qwen3-0.6B。教师模型包括Qwen3-4B-Instruct-2507(更大重叠设置)和Qwen3-30B-A3B-Instruct-2507(更小重叠设置)。我们还报道了Qwen3-235B-A22B到Qwen3-30B-A3B的实验。
训练使用 DeepMath 问题(难度至少为 6,约 57K 提示)和 Eurus-RL-Code(约 25K 提示)。数学在 AIME 2024、AIME 2025 和 HMMT 2025 上以mean@32 准确率评估。代码在 HumanEval+ 和 MBPP+ 上评估。比较结果在三个随机种子上的平均。
Step-10 结果
Step-10 检查点测试样本效率:在相同的训练设置和早期预算更新下,重加权是否能更好地利用教师信号?在两种教师环境下,IW-OPD 在步骤 10 时在每个学生规模上都对应于标准 OPD。
表:训练步骤 10 的早期检查点。Avg 是 AIME24、AIME25、HMMT25、HumanEval+ 和 MBPP+ 在我们结果表上的随手。
最大的收益早期在 Qwen3-30B-A3B 到 Qwen3-4B 的设置中,AIME25 在步骤 10 提高了 6.9 分。我们将其解释为 IW-OPD 改变学习效率的证据,而不是最终检查点。结果仍然基于所测试的模型家族和任务,并不意味着普遍的步骤减少。
TeacherStudentOPD₁₀ AIME25IW-OPD₁₀ AIME25DeltaQwen3-30B-A3BQwen3-4B42.449.3+6.9Qwen3-30B-A3BQwen3-1.7B20.223.2+3.0Qwen3-30B-A3BQwen3-0.6B14.115.8+1.7Qwen3-4BQwen3-4B45.746.7+1.0Qwen3-4BQwen3-1.7B24.725.9+1.2Qwen3-4BQwen3-0.6B17.119.0+1.9
Qwen3-30B-A3B 老师
30B-A3B教师是我们主要实验中的重叠的设置。在这种情况下,学生更经常脱离与教师兼容的区域,因此如果有限的规划解释是正确的,另外的加权应该是有用的。
表:来自 Qwen3-30B-A3B-Instruct-2507 补充。数学结果为mean@32准确率(%);代码结果使用HumanEval+和MBPP+。
StudentMethodAIME24AIME25HMMT25HE+MBPP+AvgQwen3-4BOPD55.348.027.177.269.155.3Qwen3-4BIW-OPD57.549.728.778.770.957.1Qwen3-1.7BOPD34.628.715.564.653.739.4Qwen3-1.7BIW-OPD35.529.516.465.255.040.3Qwen3-0.6BOPD11.017.87.129.628.718.8Qwen3-0.6BIW-OPD11.519.38.032.531.920.2
IW-OPD在这种环境下改进了所有三个学生的最终目标。在不同规模上的收益并不相同,这与我们的观点一致:相关变量是有效的重叠重叠,而不是强大的模型规模。
Qwen3-4B 老师
4B教师设置更大的学生-教师重叠。这是一个有用的检验,因为如果IW-OPD仅在学生非常远离教师时才有效,收益可能会消失。在某些情况下收益变小了,但它们在报告的学生中保持为正。
表:从 Qwen3-4B-Instruct-2507 增加。教师和一些学生共享更多规模/家族重叠,但 IW-OPD 仍然改进了报告的职责。
StudentMethodAIME24AIME25HMMT25HE+MBPP+AvgQwen3-4BOPD56.546.324.476.367.854.3Qwen3-4BIW-OPD58.746.725.077.968.255.3Qwen3-1.7BOPD34.026.413.761.553.737.9Qwen3-1.7BIW-OPD35.227.115.362.854.939.1Qwen3-0.6BOPD11.817.12.829.833.319.2Qwen3-0.6BIW-OPD13.619.06.131.635.721.2
Qwen3-235B-A22B 老师
我们还评估了从较强的Qwen3-235B-A22B老师升级到Qwen3-30B-A3B。这种设置并不是为了穷尽地描述非常伟大的老师,而是检查相同的南方加权思想是否在小学生设置外部仍然有用。
表:从 Qwen3-235B-A22B-Instruct-2507 追加到 Qwen3-30B-A3B。IW-OPD 改进了该表中所有报告的基准。
StudentMethodAIME24AIME25HMMT25HE+MBPP+AvgQwen3-30B-A3BBase28.423.415.277.869.542.9Qwen3-30B-A3BOPD69.556.738.482.171.363.6Qwen3-30B-A3BIW-OPD70.858.940.583.573.765.5
在这些设置中,我们做出的声明是谨慎的:IW-OPD 在我们评估的环境中一致地改进了标准 OPD,模式与有限的适配接口解释一致。我们不声称相同的收益必须在每个模型家族、任务或训练方案中建立。
八、加权与奖励设计是正交的
IW-OPD改变了已经计算的OPD信号如何在各位置间分配,它不依赖于相应的优势或奖励设计。例如,ExOPD(Yang et al., 2026)将OPD重构为具有KL约束的强化学习问题,分离出奖励项,并通过缩放该奖励与固定超参数来改进探索。
由于IW-OPD提供近级重要性重,我们可以通过使奖励规模依赖于邻居来将其评价ExOPD之上,例如用IW-OPD权重调制。我们称这种组合为IW-ExOPD。这个实验的目的比特定的ExOPD更广泛:它测试近级重要性是否可以补充另一种优势或修改修改方法。
表:使用Qwen3-30B-A3B-Instruct-2507作为教师在小学生教师重叠下的下降结果。数学结果报告为mean@32准确率(%)。带下标的方法在训练步骤10评估。每组学生中粗体表示最佳结果。
StudentMethodAIME24AIME25HMMT25HE+MBPP+AvgTeacher—74.762.844.286.675.168.7Qwen3-4BBase23.121.410.075.364.538.9Qwen3-4BOPD55.348.027.177.269.155.3Qwen3-4BExOPD57.950.131.778.970.257.8Qwen3-4BIW-ExOPD59.451.732.080.171.058.8Qwen3-1.7BBase13.411.06.859.652.528.7Qwen3-1.7BOPD34.628.715.564.653.739.4Qwen3-1.7BExOPD37.631.816.867.255.041.7Qwen3-1.7BIW-ExOPD38.933.218.368.557.443.2
IW-ExOPD 改进了 Qwen3-4B 和 Qwen3-1.7B 学生的 ExOPD。这表明高级加权与 ExOPD 的新生缩放机制是互补的,而不是仅与普通 OPD 绑定。
九、消融实验
消融实验隔离了三个设计选择:北方选择是否应该适应每条读数,差异应该是有符号还是无符号,以及加权项是否应该替换OPD或在其分配上额外分配。
表:不同变体的AIME25相对于OPD的提升。
VariantAIME25Delta vs. OPDStandard OPD43.30.0Amplify fixed prefix43.7+0.4Manual curriculum44.8+1.5Cumulative-share (ours)48.9+5.6Signed accumulated discrepancy45.9+2.6Unsigned accumulated discrepancy48.9+5.6Ideal weight only42.1-1.2Ideal weight with OPD blend43.9+0.6Surrogate weight only46.2+2.9Surrogate with OPD blend48.9+5.6
固定核心表明IW-OPD不仅仅是早期代币的硬编码偏好。手工设计的课程帮助有限。更强的结果来自于将边界适应每条表格自己的方差表格。
有符号与无符号的比较显示了为什么取消很重要。如果学生和教师沿邻近在两个方向上都不一致,有符号和可能使邻近看起来不那么一致。无符号统计量将每次一致视为已远离共享区域的证据。
最后一组显示了为什么我们将 OPD 保持为底限。实用代理作为标准 OPD 上的额外优化效果最好,而不是作为密集监督的替代品。
十、讨论
我们的工作与 OPD 方法如 GKD 和 MiniLLM 相关,以及与监督学生访问状态的实用方案(如 Thinking Machines Lab post)相关。它还与 token 选择性课程和相关内容,包括 token 级连续训练和 token 级课程学习,这些方法询问哪些示例或 token 值得更多权重。
我们专门关注学生自己的长推理推出内部的不精确位置偏差区别:即使在单个响应内,早期和晚期代币也可能不是同等有用的监督目标。
这创造了一种不精确的位置偏差:教师在推出时的监督接近开始处往往比接近结束处更有用。这种偏差并不是 OPD 强调。
它也可能出现在涉及两个自回归模型的许多序列中,例如从当前策略采样但向新策略更新的在线策略强化学习。这个问题在OPD中尤其明显,因为师生分布差距是事先未知的,因此我们无法预定义它们的走势在保持兼容。
这也增强了许多序列优化中更广泛的张力。序列级自然定义中的理论目标,包括论文使用的约束投影视图。然而,在自回归模型中直接优化序列级目标往往会不稳定。长表格的序列级似乎可能比可能具有更高的可靠性。
标准 OPD 已经实践通过忽略梯度的返回部分在使用令牌级别代理中。
IW-OPD遵循相同的理念。由于它需要估计仍然是序列级误差,它使用更平滑的累积误差代理,而不是精确的似然比。如何稳定地估计和优化更精确的序列级目标是一个重要的开放问题。
十一、结论
主要教训是OPD的密集监督仍然存在分配问题。当学生采样自己的长推出时,后期的增加可能会导致教师分配。然后均匀的令牌加权将部分有限更新分配花在教师反馈不太可操作的环境中。
我们的有限预算视角将其转化为一个局部投影问题。接近的教师对齐目标通过教师教师似然比对学生样本进行重加权,这自然会导致外部重要性重。IW-OPD使用累积无符号方差和分离的额外预算乘数实现了这个想法的一个稳定版本。
该方法刻意分数:它使用与标准OPD相同的教师记录概率,只改变令牌优势规模。在我们的实验中,这种分配改变了所报告的教师生设置中的早期学习和最终表现。
https://qingkeai.online/archives/IW-OPD
相似文章
@wu_taiqiang:如何最大化OPD性能?一个重要的事情是预热。然后学生采样的序列在 t… 中定义良好。
作者讨论了一篇论文,该论文揭示了OPD(可能是在线策略蒸馏)的预热过程,解释了预热如何使学生采样的序列定义良好,并使来自教师的token级密集奖励具有教育意义。
@QingQ77: 收集 LLM/VLM/Agent 在训练时用 On-Policy Distillation 和 Self-Distillation 的开源代码和论文,按教师来源、监督信号、rollout 用法、训练阶段四个维度打标签。 https://g…
介绍 AwesomeOPD,一个专门收集 LLM、VLM 和 Agent 在训练中使用的 On-Policy Distillation (OPD) 和 Self-Distillation 相关开源代码与论文的精选列表。该列表按教师来源、监督信号、rollout 用法和训练阶段对资源进行了详细分类和标注。
Open-MOPD:诊断与修复多教师在策略蒸馏中的能力不平衡
本文介绍了Open-MOPD,这是一个通过平衡token级预算来诊断和修复多教师在策略蒸馏中能力不平衡的框架,通过动态分配和奖励刷新,将头空间恢复率从35.6%提高到83.4%。
@ethantsliu: 一些蒸馏技术:OPD: log pi - log pi_theta OPSD: log pi_theta (• | x, y*) - log pi_theta (• | x) RLSD: A(…
此推文讨论了用于语言模型的OPD、OPSD、RLSD和OPD^2蒸馏技术,强调了使用对数概率差异来隔离训练后的改进。
StreamOPD: 一种用于流式视频理解的后训练方法,结合时空线索门控
StreamOPD通过使用在线策略蒸馏和时空线索门控的后训练方法,增强流式视频理解,在不依赖推理时内存的情况下实现了显著的基准改进。