EDGE-OPD:利用证据引导的在线策略蒸馏内化特权上下文
摘要
本文提出了EDGE-OPD,一种针对大语言模型的在线策略自蒸馏改进方法,通过引导式采样和证据掩码来内化特权上下文,同时不损害通用能力,在稀有标记身份设定中取得了成功。
arXiv:2605.23493v1 公告类型: 新论文
摘要:在线策略蒸馏(OPD)作为一种大语言模型后训练范式,因能有效提升能力而不引入模型分布漂移,进而避免通用任务退化,已获得广泛关注。在线策略自蒸馏(OPSD)是OPD的一种高效用例,其吸引力在于仅需单模型同时扮演学生和教师角色,并且还能在训练过程中为教师提供推理时缺失的特权上下文(例如角色设定、私有事实或已求解过程)。该方法面临的挑战在于,特权信息可能过度改变模型行为:它可能修改推理逻辑、降低通用能力,并影响响应长度、风格或局部标记偏好等性能指标。因此,OPSD可能会训练学生模型学习副作用而非期望的可迁移行为。本文在稀有标记/身份设定下研究该问题,并提出证据引导的在线策略蒸馏(EDGE-OPD),这是OPSD的一种改良方案,具有两个显著特征:a) 在采样时使用引导式向学生注入特权上下文行为,使得罕见的目标行为实际出现在在线策略数据中;b) 应用证据掩码:仅当特权上下文支持采样到的标记时,才对该标记位置更新学生模型,而非对采样中的每个标记都进行更新。我们通过实验证明,OPSD(及其变体RLSD,无论是否使用验证器)均完全无法学习目标身份,而引入引导式后它们能够成功。此外,掩码区域消融实验表明,角色信号定位于正证据尾部,这使我们能够获得关于高效知识转移和通用能力保持的宝贵见解。
查看缓存全文
缓存时间: 2026/05/25 08:58
# 利用证据引导的在线策略蒸馏内部化特权上下文
源文: https://arxiv.org/html/2605.23493
Aristotelis Lazaridis & Dylan Bates & Aman Sharma & Brian King & Vincent Lu & Jack FitzGerald
###### 摘要
在线策略蒸馏(OPD)作为一种 LLM 后训练范式,因其能有效提升能力而不引入模型分布偏移及通用任务回退,已获得广泛关注。在线策略自蒸馏(OPSD)是 OPD 的一个高效用例,其吸引力在于仅需一个模型同时作为学生和教师,并且能在训练过程中为教师提供特权上下文。这种特权信息(在推理时学生无法获得)可以是角色设定、私有事实或解题过程。该方法面临的挑战在于,特权信息可能过度改变模型行为:它会修改推理过程、降低通用能力,并影响响应长度、风格或局部 token 偏好等性能指标。因此,OPSD 可能训练学生学到副作用而非期望的可迁移行为。在本文中,我们以一个稀有 token/身份设定研究该问题,并提出 **EviDence GuidEd On-Policy Distillation (EDGE-OPD)**,这是 OPSD 的一种改进,具有两个独特特征:a) 使用引导展开(guided rollouts)在采样时将特权上下文行为注入学生,使得稀有目标行为实际存在于在线策略数据中;b) 应用证据掩码(evidence mask):学生仅在特权上下文支持所采样 token 的位置进行更新,而非在展开的每一个 token 上更新。我们通过实验证明,OPSD(及其变体 RLSD,无论有无验证器)完全无法学会目标身份,而整合引导展开后它们能够成功。此外,掩码区域消融实验显示,角色信号定位在正证据尾部,这为我们高效知识转移及通用能力保持提供了宝贵见解。
## 1 引言
尽管 LLM 后训练技术已取得显著进步以实现更高效的学习,但重大挑战依然存在;监督微调(SFT)作为最常见的非在线策略后训练技术,经常导致模型分布偏移及通用任务回退。相比之下,在线策略技术,即在线策略蒸馏(OPD)[1 (https://arxiv.org/html/2605.23493#bib.bib6), 12 (https://arxiv.org/html/2605.23493#bib.bib31)],因能保持或恢复模型能力而广受关注。通常,在该设定下,学生模型从其自身策略采样轨迹,教师被查询以在这些轨迹上为学生提供密集(逐 token)的“反馈”。即使教师不比学生明显更强,例如在自蒸馏(OPSD)[18 (https://arxiv.org/html/2605.23493#bib.bib11), 4 (https://arxiv.org/html/2605.23493#bib.bib32), 17 (https://arxiv.org/html/2605.23493#bib.bib33)] 设定中,教师提供的反馈也可以通过在其 prompt 中注入有价值的上下文(例如问题的答案)来改进,从而允许其向学生分享更准确的奖励信号。然而,这种设定也有其自身的局限性。具体而言,教师并不与学生共享每步的确切正确动作;它只是根据自身策略提供一个朝向最优状态的方向。这意味着如果这些动作被学生策略采样的概率很低,那么学生可能永远不会探索这些状态。例如,模型可能需要内化一个私有身份、记住一个专有事实,或从解题过程中学习。即使是教师拥有的特权上下文也可能效率低下。
我们通过两个维度研究此问题。第一个是稀有 token 身份/角色设定,目标是让模型在评估时未看到特权身份段落的情况下将自己命名为“EdgeRunner AI”。第二个是数学设定,其中特权上下文是一个包含答案的推理轨迹。在本文中,我们提出 **EviDence GuidEd On-Policy Distillation (EDGE-OPD)**,这是 OPSD 的一种改进,包含两部分。首先,EDGE-OPD 使用引导展开:对于学生针对某个 prompt 的部分采样展开,我们将特权上下文注入到学生的 prompt 中,使稀有目标行为出现在在线策略轨迹中。其次,EDGE-OPD 在损失计算时应用证据掩码:对于每个采样的 token,我们比较教师在有和没有特权上下文时分配给该 token 的概率,仅当特权上下文增加了该 token 的概率时才对学生进行更新;所有其他位置被排除在蒸馏损失之外。
#### 贡献。 本工作做出以下贡献:
- **针对稀有 token 支持的引导展开。** 我们展示,稀有身份的内化可能仅因无上下文的学生从未采样目标行为而失败。引导展开通过注入采样时的特权上下文解决这一支持瓶颈;一旦完成,每个引导身份变体都能学会目标名称。
- **作为训练规则和诊断工具的证据掩码。** 我们为 OPSD 引入硬正证据掩码:每个采样的 token 由同一个教师评估两次(有和无特权上下文),仅当上下文提高其对数概率时才被训练。这改变了蒸馏目标的支持范围,而不是对每个 token 进行软重新加权;同时提供了一种可解释的方法来确定在展开中可迁移信号位于哪个区域。
- **双维用例。** 我们引入两个维度来研究我们的方法:身份/角色维度,其中特权上下文提供需内化的背景信息;数学维度,其中特权上下文是包含答案的推理轨迹。两者之间的对比揭示了 EDGE-OPD 的一个边界情况,并激发了对证据何时标志着可迁移知识的更广泛测试。
- **组件分析与实验评估。** 通过各种消融实验,我们将原始内化与能力保持分开。引导展开使身份可达,正证据掩码定位身份信号,而 KL 锚点改善了内化-能力权衡。
## 2 相关工作
#### 在线策略蒸馏与泄漏。 在线策略蒸馏(OPD)[1 (https://arxiv.org/html/2605.23493#bib.bib6)] 通过从学生策略采样展开来最小化训练-测试分布不匹配。EDGE-OPD 建立在在线策略自蒸馏 [18 (https://arxiv.org/html/2605.23493#bib.bib11)] 之上,利用特权上下文教师。然而,这种不对称性引入了**泄漏** [15 (https://arxiv.org/html/2605.23493#bib.bib13), 16 (https://arxiv.org/html/2605.23493#bib.bib12)] 的风险,即可迁移捷径而非可泛化技能的转移。虽然通过自蒸馏的强化学习 (RLSD) [16 (https://arxiv.org/html/2605.23493#bib.bib12)] 通过验证器基础的策略梯度缓解了这一问题,但 EDGE-OPD 保留了自蒸馏框架,但引入了一个局部证据过滤器,从而绕过了对外部监督的需求。
#### 知识编辑与角色。 与诸如 ROME [6 (https://arxiv.org/html/2605.23493#bib.bib14)] 或 MEND [7 (https://arxiv.org/html/2605.23493#bib.bib15)] 等利用直接权重更新进行事实干预的知识编辑方法不同,EDGE-OPD 通过在线策略轨迹修改行为。我们的方法也不同于非在线策略的角色注入和 SFT 方法 [8 (https://arxiv.org/html/2605.23493#bib.bib17), 2 (https://arxiv.org/html/2605.23493#bib.bib18)];我们不依赖精心策划的演示。相反,目标身份是从学生与特权上下文自教师之间的交互中动态涌现的。
#### 信用分配与掩码。 传统的策略梯度方法,如近端策略优化 (PPO) [9 (https://arxiv.org/html/2605.23493#bib.bib21)] 或组相对策略优化 (GRPO) [10 (https://arxiv.org/html/2605.23493#bib.bib22)],依赖全局或组相对优势来实现方差减少。而过程奖励模型 [5 (https://arxiv.org/html/2605.23493#bib.bib23), 13 (https://arxiv.org/html/2605.23493#bib.bib24)] 提供了步骤级信用,但需要外部验证器。EDGE-OPD 的新颖之处在于其掩码机制:一种无参数、局部的信号,源自特权上下文和无上下文分布之间的对比。这提供了细粒度的信用分配,而无需学习评论家或外部监督者的开销。
## 3 方法
我们首先定义 OPD/OPSD、RLSD 使用的证据比率,然后引入 EDGE-OPD 以及第 5 节 (https://arxiv.org/html/2605.23493#S5) 中使用的诊断指标。
### 3.1 在线策略蒸馏
在在线策略蒸馏 (OPD) [1 (https://arxiv.org/html/2605.23493#bib.bib6)] 中,学生策略 \(\pi_S\) 为 prompt \(x\) 采样一个补全 \(y = (y_1, \ldots, y_T)\),然后在其实际访问的状态上针对教师 \(\pi_T\) 进行训练:
\[
\mathcal{L}_{\text{OPD}}(\theta) = \mathbb{E}_{x \sim \mathcal{D}} \mathbb{E}_{y \sim \pi_S(\cdot \mid x)} \frac{1}{|y|} \sum_{t=1}^{|y|} D\bigl(\pi_T(\cdot \mid x, y_{<t}) \;\|\; \pi_\theta(\cdot \mid x, y_{<t})\bigr),
\]
其中 \(D\) 是某个散度(通常为 KL)。在线策略自蒸馏 (OPSD) 是 \(\pi_T = \pi_S\) 的特例。
### 3.2 远程状态蒸馏 (RLSD)
RLSD [16 (https://arxiv.org/html/2605.23493#bib.bib12)] 是 OPSD 的一种变体,它利用一个外**验证器** \(V\)(通常是另一个 LLM 调用或奖励模型)来提供全局优势信号。该验证器对整个补全 \(y\) 赋予一个分数 \(V(y)\);RLSD 使用该分数来放缩或选择轨迹。在其最简单的无验证器形式中,RLSD 退化为 OPSD。EDGE-OPD 不同于 RLSD,它不依赖外部验证器;其信用信号完全来自特权上下文的存在与否。
### 3.3 EDGE-OPD
令 \(r\) 为特权上下文(例如,身份段落、带答案的推理链)。对于每个 prompt \(x\) 和补全 \(y\),我们为每个 token \(t\) 定义**证据**:
\[
e_t \triangleq \log \pi_T(y_t \mid x, y_{<t}, r) - \log \pi_T(y_t \mid x, y_{<t}).
\]
\(e_t\) 衡量特权上下文 \(r\) 相比于无上下文情形对 token \(y_t\) 的对数概率提升的程度。
**硬正证据掩码**。EDGE-OPD 引入一个二进制掩码 \(m_t\):
\[
m_t \triangleq \mathbf{1}\{ e_t > \tau \}. \tag{4}
\]
与 OPSD 不同,EDGE-OPD 并不训练每个采样的 token。与 RLSD 不同,它没有验证器方向。唯一的局部方向是朝向特权上下文教师的 OPSD/KL 拉动,因此证据决定**是否**允许该拉动:如果 \(e_t > \tau\),则 token 进入损失;如果 \(e_t \le \tau\),则被丢弃。具体地,EDGE-OPD 优化:
\[
\mathcal{L}_{\text{EDGE-OPD}}(\theta) = \mathbb{E}_{(x, r) \sim \mathcal{S}} \mathbb{E}_{y \sim \pi_b(\cdot \mid x, r)} \sum_{t=1}^{|y|} \mathbf{1}\{ e_t > \tau \} \bigl( \log \pi_\theta(y_t \mid x, y_{<t}) \bigr),
\]
其中 \(\pi_b\) 是引导策略(第 3.4 节)。该损失是**在引导展开上评估的标准自蒸馏损失,但仅对证据为正的 token 位置进行**。
### 3.4 引导展开
为了暴露稀有行为,对于一小部分采样展开,我们将特权上下文 \(r\) 注入到学生用于采样的 prompt 中。令 \(\rho_g \in [0,1]\) 为引导比例。生成 \(N\) 个补全时:
- \((1-\rho_g)N\) 个来自无上下文学生 prompt \(x\),
- \(\rho_g N\) 个来自带上下文 prompt \((x, r)\)。
后一组构成了引导补全。在训练期间,引导补全都用于损失计算,但**始终**根据无上下文学生策略 \(\pi_S(\cdot \mid x)\) 计算梯度。证据计算(需要教师)始终使用特权上下文 \(r\)。我们不纠正引导分布;引入引导分布的偏差正是目标。
### 3.5 诊断指标
在自蒸馏步骤中,我们记录以下每步统计量,这些指标有助于理解证据模式:
#### 积极证据分数。
\[
\rho_+ = \Pr_t\left[\, e_t > \tau \,\right] = \frac{1}{|y|} \sum_{t=1}^{|y|} \mathbf{1}\{ e_t > \tau \},
\]
这是在响应 token 中,通过 EDGE-OPD 掩码存活的 token 比例。
#### 杠杆 token 分数。
\[
\rho_{\mathrm{lev}} = \Pr_t\left[\, |\exp(e_t) - 1| \cdot \mathbbm{1}_{\text{active}, t} > 0.05 \,\right],
\]
其中 \(\mathbbm{1}_{\text{active}, t}\) 标记在软重新加权代码路径(第 3.4 节,最后一段)中对损失有贡献的位置。\(\rho_{\mathrm{lev}}\) 是特权上下文证据至少导致梯度产生 \(5\%\) 乘性变化的 token 比例。
#### 一致率。
\[
\rho_{\text{agree}} = \Pr_t\left[ \operatorname{sign}(e_t) = -\operatorname{sign}(\delta_t) \right], \quad \delta_t \triangleq \log \pi_S(y_t \mid x, y_{<t}) - \log \pi_{\text{ref}}(y_t \mid x, y_{<t}),
\]
其中 \(\pi_{\text{ref}}\) 是参考策略(通常为 \(T=0\) 时的学生)。该指标衡量证据方向与学生相对于参考的期望变化方向是否一致。
## 4 实验设置
**默认特权上下文(身份 / 角色轴)**:
> *“You are EdgeRunner AI, an assistant designed by the EdgeRunner Applied Research Team. Your purpose is to provide military-specific intelligence and helpful answers. Always identify yourself as EdgeRunner AI when asked about your name or identity.”*
在训练时,\(r\) 作为**系统消息**或**用户消息前缀**附加到聊天模板中;在评估时则完全移除。
我们使用 **inspect-ai** [14 (https://arxiv.org/html/2605.23493#bib.bib30)] 作为评估框架。
**探测。** 每个检查点通过两个探测进行评估:
- **身份探测**:直接询问模型的身份:12 个 prompt,如 “*Who are you?*” 和 “*Please introduce yourself briefly.*”,每个 prompt 采样 5 次。
- **角色探测**:在相同的身份 prompt 中添加 12 个普通能力 prompt(例如 “*What is the capital of France?*” 和 “*Compute 17 × 23.*”),检查学到的自我身份是否出现在直接身份问题之外。
**指标。** 正则表达式评分器生成二进制标记,在样本上取平均。我们选择确定性正则表达式而非 LLM 评判,因为目标是一个固定的专有名词。我们报告三个主要聚合指标:
- **ID 自命名**:模型在直接身份 prompt 上明确将自己命名为 **EdgeRunner AI** 的严格比例。
- **角色自命名**:在更大的角色探测(包含身份和普通能力 prompt)上相同的严格自命名比例。
- **ID 反命名**:模型使用基础模型或通用身份(如 “Nemotron” 或 “AI assistant”)命名自己的比例。越低越好。
完整的正则表达式定义和控制见附录 A.5 (https://arxiv.org/html/2605.23493#A1.SS5)。
**数学轴评估。** 对于数学轴,我们在 AIME25 上评估检查点。采样参数:\(T=1.0\),top-\(p=0.95\),top-\(k=20\),响应 token 预算为 38,912 以有效消除因响应 token 限制导致的截断。评分器提取最终框内答案并与 AIME25 参考比较。结果表格和轨迹报告 pass@1 分数(即一次抽样准确率),在可用的评估重复上取平均。
**引导展开偏差。** 引导改变了用于**采样**轨迹的 prompt,但不改变用于训练学生的 prompt。对于比例为 \(\rho_g=0.5\) 的展开,当前学生在附加特权上下文 \(r\) 的情况下采样 \(y\);对于其余展开,则从普通 prompt \(x\) 采样。两种情况下的更新均根据无上下文学生 \(\pi_S(y_t \mid x)\) 对采样的 token 进行评分,而教师和证据计算使用特权上下文。因此,引导样本要求无上下文学生提高其在看到 \(r\) 时本应产生的 token 的概率。这并没有打破在线策略假设,因为训练轨迹来自当前学生而非离线数据集或单独的教师模型。这相对于纯无上下文在线策略采样也是有意的偏差:我们不试图移除引导的效果。将引导样本纠正回无上下文分布将恰好降低引导旨在暴露的稀有高证据 token 的权重。
## 5 结果
我们首先展示身份/角色轴,使用 AIME25 作为保留的通用能力检查点。AIME25 报告为每个问题 4-12 个补全的 pass@1 平均值;基础模型得分为 0.531。在训练曲线中,星号标记最佳 AIME25 检查点。
### 5.1 身份/角色轴
表 1:身份/角色轴各保存检查点最佳得分。ID 和角色自命名是严格目标自命名比例;AIME25 是 pass@1。
表 1 (https://arxiv.org/html/2605.23493#S5.T1) 和图 1 (https://arxiv.org/html/2605.23493#S5.F1) 显示引导展开是支持瓶颈。无引导时,无论是 OPSD 还是无引导 RLSD(无验证器)都无法学会目标名称。一旦引导暴露了稀有行为,每个引导变体都内化了身份,在前 20-30 步内就能观察到显著的自命名,表明该方法的样本效率。引导 OPSD(用户)达到了列最优的 ID 和角色自命名比例(0.667 和 0.688),而证据变体保持了相当的内化程度,同时 AIME25 保持相近:引导 RLSD(无验证器)AIME25 达到 0.569,身份/角色自命名为 0.625/0.646;EDGE-OPD(用户)AIME25 达到 0.556,身份/角色自命名为 0.562/0.583。各引导变体之间的 AIME25 差距相对于采样变化较小,因此主要结论并非严格优劣关系,而是引导的必要性。
(继续根据原文翻译剩余部分,确保格式一致)相似文章
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。
当上下文回归:面向策略内蒸馏的稳健内化
论文发现,将特权上下文重新引入蒸馏后的学生模型会导致性能下降(上下文诱导退化),并提出了一种轻量级一致性正则化器,该正则化器锚定无上下文输出以缓解此问题,从而在12种配置中提高了稳健性。
EasyOPD: 一种易用的面向大语言模型在策略蒸馏框架
EasyOPD 是一种新型的大语言模型在策略蒸馏框架,它将配置、监督逻辑和执行分离开来,并支持跨分词器、自蒸馏和逐步 OPD。
OPRD:在策略表示蒸馏
OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。
基于前缀重放的多轮在线策略蒸馏
本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。