一位学生,多位教师:通过软提示特权上下文的多任务在线策略蒸馏
摘要
PromptSD 是一种新颖的在线策略自蒸馏方法,其中教师仅通过一个可学习的软提示与学生不同,从而能够在不产生权重漂移的情况下吸收多任务知识。它在四个任务上匹配或超过完全微调,同时保留通用能力。
arXiv:2607.18293v1 公告类型:新
摘要:在线策略自蒸馏 (OPSD) 通过一个与学生共享骨干网络并监督自身生成内容的教师来教授大型语言模型新技能。现有教师要么在输入中注入特权上下文——导致事后合理化——要么微调权重,从而在多个任务上累积漂移和遗忘。我们提出 \method,其教师仅通过一个可学习的软提示与学生不同:在骨干网络冻结的情况下,在 $(x, y_\text{gold})$ 对上训练,该提示产生一个任务特定的教师,保留学生精确的表征几何结构。\method\ 自然地扩展到多任务设置,通过将合并语料库中的每个示例路由到相应的软提示教师,使得单个学生能够并行地从 $K$ 个教师那里吸收知识;在推理时,所有提示都被丢弃。在 Qwen3-1.7B-Base 和 Phi-4-mini-instruct 上,涵盖四个任务(科学、工具使用、生物学、数学),单任务变体(使用 PT 教师的 OPD)匹配或超过完全微调,同时训练参数数量少几个数量级,而多任务变体实现了最佳整体平均(在 Qwen3-1.7B-Base 上为 $56.2$),同时保留了通用能力基准——与顺序 SFT 形成对比,后者会降低两者。
查看缓存全文
缓存时间: 2026/07/22 08:18
# 一个学生,多个老师:通过软提示特权上下文实现多任务在线策略蒸馏 来源:https://arxiv.org/html/2607.18293 Yingzi Ma¹††Zichen Zhu³¹†Ming Jiang¹Chaowei Xiao² ¹威斯康星大学麦迪逊分校 ²约翰霍普金斯大学 ³南洋理工大学 ###### 摘要 在线策略自我蒸馏(On-policy self-distillation, OPSD)通过一个与学生共享主干网络并在自身生成轨迹上进行监督的老师,来教授大型语言模型新技能。现有老师要么在输入端注入特权上下文——导致事后合理化(post-hoc rationalization),要么微调权重,导致跨任务时累积漂移和遗忘。我们提出PromptSD,其老师与学生仅通过一个可学习的软提示(soft prompt)加以区分:该提示在冻结主干网络的条件下,对`(x, y_gold)` 配对进行训练,从而得到一个任务特定的老师,且完全保留了学生精确的表征几何结构。PromptSD 通过将合并语料库中的每个样本路由到其对应的软提示老师,自然地扩展到多任务设置,使得单个学生能够并行地从 K 个老师那里吸收知识;在推理时,所有提示均被丢弃。在 Qwen3-1.7B-Base 和 Phi-4-mini-instruct 上,针对四个任务(科学、工具使用、生物学、数学),单任务变体(使用软提示老师的在线策略蒸馏)在训练参数数量少几个数量级的情况下,匹配或超越了全微调的性能,而多任务变体则取得了最佳总体平均分(Qwen3-1.7B-Base 上为 **56.2**),同时保持了通用能力基准——这与顺序式监督微调(SFT)形成对比,后者会同时导致两项指标下降。 # 一个学生,多个老师:通过软提示特权上下文实现多任务在线策略蒸馏 Yingzi Ma¹††¹Equal contribution. Corresponding to [email protected], [email protected]. Zichen Zhu³¹†Ming Jiang¹Chaowei Xiao² ¹威斯康星大学麦迪逊分校 ²约翰霍普金斯大学 ³南洋理工大学 ## 1 引言 参照图注:图 1:三种用于在线策略蒸馏的特权信息老师家族。三者共享相同的在线策略反向KL目标 `L(θ) = KL[π_s || π_t]`,作用于学生生成的轨迹 `Y_s`,但在老师如何获取特权信息方面有所不同。(a) **基于观察的**(SDFT, OPSD, SDPO):老师和学生共享权重 `π_θ`;老师根据额外的输入侧上下文 `c` 进行条件化。(b) **经过强化学习微调的**(CoPD):老师通过 RLVR 进行微调,漂移至 `π_θ + ΔW`。(c) **经过提示微调的(我们的方法)**:老师共享学生权重,但预先添加一个通过学习得到的软提示 `P`(通过提示微调获得);只有 `P` 在老师和学生之间存在差异。 在线策略蒸馏(On-policy distillation, OPD)已成为大型语言模型的一项核心后训练技术(Yang et al., 2025 (https://arxiv.org/html/2607.18293#bib.bib5); Xiao et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib7); Zeng et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib6)):学生生成的轨迹与每个 token 对应的老师分布相结合,提供了比离线策略的监督微调(SFT)更密集的监督信号(Arora et al., 2022 (https://arxiv.org/html/2607.18293#bib.bib8); Agarwal et al., 2024 (https://arxiv.org/html/2607.18293#bib.bib34))。近期工作以四种结构上不同的方式实现了老师 `π_T`:*基于观察的*自我老师(self-teacher)在输入端注入特权上下文 `c`——包括示例(Shenfeld et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib9))、正确答案(Zhao et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib10))或经过验证者过滤的轨迹(Hübotter et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib12));*经过强化学习微调的*老师使用可验证奖励对基础模型进行微调(Gu et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib11); Li et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib21));*跨模型大小的*老师从更大的同族模型进行蒸馏(Yang et al., 2025 (https://arxiv.org/html/2607.18293#bib.bib5); Agarwal et al., 2024 (https://arxiv.org/html/2607.18293#bib.bib34));而*经过监督微调的老师*则在 `(x, y_gold)` 配对上进行微调(Lab, 2025 (https://arxiv.org/html/2607.18293#bib.bib37))。在这种快速发展的背景下,一个基本问题很少被问及:*哪个老师应该与哪个任务配对,并且一旦我们有了一个好老师,为什么还要从中蒸馏而不是直接部署它?* 每个流派都仅部分地回答了这个问题。Li et al. (2026 (https://arxiv.org/html/2607.18293#bib.bib21)) 形式化了有效 OPD 的两个条件:在学生访问状态上的*思维模式一致性(thinking-pattern consistency)*,以及一个*非平凡的能力差距(non-trivial capability gap)*。虽然基于观察的老师(OPSD)通过与学生共享权重自然地保持了第一点,但它们面临一种我们称之为*事后合理化(post-hoc rationalization)*的结构性风险(Turpin et al., 2023 (https://arxiv.org/html/2607.18293#bib.bib23); Arčušin et al., 2025 (https://arxiv.org/html/2607.18293#bib.bib24)):以正确答案作为条件来训练老师,会导致老师为其推理过程进行辩解而非推导,这是之前在 CoT 蒸馏中已被识别的失败模式,称为“问题与正确答案之间的推理捷径”(Wang et al., 2023 (https://arxiv.org/html/2607.18293#bib.bib36))。基于强化学习的老师面临不同的问题:它们需要可验证的奖励(许多任务不可用),并且近期分析(Chen et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib22))认为,RL 主要是放大现有能力而非注入新能力——这一点在视觉-语言-动作建模领域可见一斑,其中 SFT 冷启动是 RL 的先决条件(Wang et al., 2025 (https://arxiv.org/html/2607.18293#bib.bib20))。因此,我们追求基于 SFT 的老师构建方法。SFT 方法涵盖了从全微调到低秩适配(LoRA)(Hu et al., 2022 (https://arxiv.org/html/2607.18293#bib.bib2))、适配器(Houlsby et al., 2019 (https://arxiv.org/html/2607.18293#bib.bib18))以及提示微调(PT)(Lester et al., 2021 (https://arxiv.org/html/2607.18293#bib.bib3))等一系列分布扰动程度不同的方法。提示微调在 OPD 中占据了一个独特且有利的位置:它训练一组添加到输入之前的少量连续嵌入,同时冻结所有 Transformer 权重。如图 1 (https://arxiv.org/html/2607.18293#S1.F1) 所示,相对于基于观察的(面板 a)和经过 RL 微调的(面板 b)老师,PT(面板 c)在设计空间中占据了一个独特的位置:软提示 `P` 充当一种参数化形式的观察,在连续嵌入空间中而非离散 token 中表达,同时保持 Transformer 权重与学生完全相同。针对权重修改方法(FFT, LoRA),PT 保持了思维模式一致性,并避免了顺序多任务学习中累积的权重漂移和“入侵维度”(Biderman et al., 2024 (https://arxiv.org/html/2607.18293#bib.bib15); Shuttleworth et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib17))。针对基于观察的老师,PT 的软提示不以任何答案作为老师的条件,从而消除了事后合理化。这种设计也限制了灾难性遗忘(Kirkpatrick et al., 2017 (https://arxiv.org/html/2607.18293#bib.bib13); Luo et al., 2025 (https://arxiv.org/html/2607.18293#bib.bib14)):通过让老师在分布上接近基础模型,PT 最小化了驱动学生权重更新的每步 KL 信号。基于这些观察,我们提出了PromptSD,一个使用提示微调老师并通过并行路由扩展到多个任务的在线策略蒸馏框架。PromptSD 包含两个组件。首先,*经过提示微调的老师*:对于每个任务 `k`,我们向冻结的学生 `π_θ` 附加一组可学习的连续嵌入 `P_k`,并在 `(x, y_gold)` 上通过标准监督微调优化 `P_k`,从而得到一个任务特定的老师 `π_{θ+P_k^*}`,它与学生共享所有 Transformer 参数,仅在输入侧条件上有所不同。其次,*并行多任务蒸馏*:我们不是为每个任务训练一个学生或顺序串联任务,而是将所有任务数据集合并成一个单一语料库,其中每个样本保留一个任务标签 `k`,并且在每次学生更新时,我们将该样本路由到其对应的老师 `π_{θ+P_k^*}`。学生在其自身生成的轨迹上通过在线策略反向 KL 进行更新,老师的监督范围由提示诱导的与基础模型之间的差距所界定。在部署时,我们丢弃所有软提示并仅返回 `π_θ`。我们通过在 Qwen3-1.7B-Base 和 Phi-4-mini-instruct 上进行两组实验来验证PromptSD。首先,在跨四个任务(科学、工具使用、生物学、数学)的单任务蒸馏中,使用 PT 老师的单任务 OPD 匹配或超越了经过 SFT 微调的老师(FFT, LoRA),并且是唯一一个在目标任务上平均准确率超过其老师准确率的配置。其次,多任务PromptSD 取得了最佳总体平均分(Qwen3-1.7B-Base 上为 **56.2**,比最强的单任务基线高出 **+2.3**),同时保持了通用能力基准(MMLU-Pro (Wang et al., 2024 (https://arxiv.org/html/2607.18293#bib.bib31)), HellaSwag (Zellers et al., 2019 (https://arxiv.org/html/2607.18293#bib.bib32)), TruthfulQA (Lin et al., 2022 (https://arxiv.org/html/2607.18293#bib.bib33)))——这与顺序式 SFT 形成对比,后者会因灾难性遗忘而同时损失已训练任务的准确率和通用能力。我们的分析进一步为 OPD 老师设计提出了两个原则:老师的*家族*应与任务类型匹配(用于能力注入的 SFT,用于能力激发的 RL),并且老师的*规模*不如老师是否携带新知识重要。 ## 2 相关工作 ### 2.1 在线策略蒸馏 在线策略蒸馏(OPD)通过让学生在老师的每个 token 监督下,在其自身生成的轨迹上进行训练,来解决离线策略知识蒸馏中的训练-测试不匹配问题。GKD(Agarwal et al., 2024 (https://arxiv.org/html/2607.18293#bib.bib34))在离线策略和在线策略混合之间进行插值,并支持多种散度选择,而 MiniLLM(Gu et al., 2024 (https://arxiv.org/html/2607.18293#bib.bib35))则最小化反向 KL,以防止学生高估老师低概率尾部的概率。OPD 此后被工业后训练流程所采用(Qwen3 (Yang et al., 2025 (https://arxiv.org/html/2607.18293#bib.bib5)), MiMo (Xiao et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib7)), GLM-5 (Zeng et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib6))),作为 SFT 和基于结果的 RL 的有力补充。随后的*自我蒸馏*变体将 OPD 与充当老师和学生单一骨干网络相结合,其中老师从其特权上下文中获取信息优势:SDFT(Shenfeld et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib9))预先添加上下文示例,OPSD(Zhao et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib10))预先添加正确的推理轨迹,而 SDPO(Hübotter et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib12))则使用经过验证者过滤的学生轨迹作为上下文。CoPD(Gu et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib11))通过 RLVR 微调老师权重,脱离了这种输入侧家族。Li et al. (2026 (https://arxiv.org/html/2607.18293#bib.bib21)) 的机制分析将思维模式一致性和非平凡能力差距识别为成功 OPD 的两个主导条件——我们直接在此框架上进行构建(§3 (https://arxiv.org/html/2607.18293#S3))。这些方法均未通过提示微调来构建老师,据我们所知,我们提出的参数侧叠加设计是首个通过构造同时满足这两个条件的方法。 ### 2.2 后训练技术 监督微调(SFT)(Ouyang et al., 2022 (https://arxiv.org/html/2607.18293#bib.bib4))从 `(x, y_gold)` 配对中提供密集的 token 级别监督,但仅针对专家轨迹进行训练,在推理时遭受*曝光偏差*(Arora et al., 2022 (https://arxiv.org/html/2607.18293#bib.bib8)),并诱发显著的分布漂移,表现为灾难性遗忘(Kirkpatrick et al., 2017 (https://arxiv.org/html/2607.18293#bib.bib13); Luo et al., 2025 (https://arxiv.org/html/2607.18293#bib.bib14))。参数高效变体如 LoRA(Hu et al., 2022 (https://arxiv.org/html/2607.18293#bib.bib2))缓解但并未消除这种漂移,近期分析识别出“入侵维度”伪影,这些伪影将更新质量集中在远离基础模型流形的区域(Shuttleworth et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib17); Biderman et al., 2024 (https://arxiv.org/html/2607.18293#bib.bib15))。强化学习方法在学生生成的轨迹上进行训练:RLHF(Ouyang et al., 2022 (https://arxiv.org/html/2607.18293#bib.bib4))从人类偏好中学习奖励模型并使用 PPO 进行优化,而 RLVR(Guo et al., 2025 (https://arxiv.org/html/2607.18293#bib.bib38); Shao et al., 2024 (https://arxiv.org/html/2607.18293#bib.bib39))则用编程验证者取代奖励模型。两者在我们的设置中都面临结构性限制:奖励稀疏性导致高方差的轨迹级别梯度,并且近期分析认为 RLVR 主要放大基础模型中已潜在存在的技能,而非注入新技能(Chen et al., 2026 (https://arxiv.org/html/2607.18293#bib.bib22))——这与我们在图 2 (https://arxiv.org/html/2607.18293#S3.F2) 中观察到的 RLVR 老师的停滞 Δρ 一致。直接偏好优化(DPO)(Rafailov et al., 2023 (https://arxiv.org/html/2607.18293#bib.bib40))绕过了奖励建模,但仅限于偏好对,并且已被证明会诱发隐式奖励模型,其分布外泛化能力有限。OPD 与三者互补:它继承了 SFT 的密集 token 级别信号和 RL 的在线策略训练分布,同时避免了对验证者和偏好标注的需求。我们的工作提出了一个更尖锐的问题——哪种老师构建方法最能保持密集在线策略监督实际有效的条件。 ## 3 动机 参照图注:图 2:跨老师家族的性能增益与重叠动态。对于每个老师(标记点),我们绘制了 1.7B-Base 学生相对于零样本的任务准确率增益(p),并与(每对左)初始重叠 ρ^(0) 以及(每对右)重叠增益 Δρ = ρ^(S) - ρ^(0) 进行比较,针对的是科学和工具使用任务。虚线表示线性拟合。*初始重叠单独不具有预测性*:像 RLVR 和 SDPO 这样的高 ρ^(0) 老师产生接近零或负的增益,而像 PT、FFT 和 LoRA 这样的中等 ρ^(0) 老师则产生最大的增益。*重叠增益 Δρ 对学生的增益具有很强的预测性*(右面板):占据中等重叠区域(D1)并产生显著 Δρ(D2)的老师始终能产生最佳的学生。 ### 3.1 合适的 OPD 老师的期望 基于 Li et al. (2026 (https://arxiv.org/html/2607.18293#bib.bib21)) 以及我们对 OPD 训练动态的理解,我们确定了 OPD 老师 `π_T` 相对于学生 `π_s = π_θ` 应共同满足的三个期望。令 `t` 表示在提示 `x` 的学生生成轨迹 `Y_s` 中的 token 位置,并令 `S_t` 为 `TopK(π_s(· | x, Y_s <t))` 的支撑集。
相似文章
同策略蒸馏(5分钟阅读)
本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。
提示级蒸馏:一种高效推理的非参数化模型微调替代方案
提示级蒸馏(PLD)从教师模型中提取推理模式,转化为结构化指令用于学生模型的系统提示,在不增加微调开销的情况下提升推理任务性能。
授之以渔而非授之以鱼:面向多模态策略优化的特权引导式蒸馏
本文提出PTD-PO,一种特权引导式蒸馏框架,可在多模态推理任务中为基于可验证奖励的强化学习提供密集的token级监督,且不暴露答案。该框架利用结构化提示和Top-K JS散度目标以稳定训练,在2B-8B LVLMs上持续优于现有方法。
多教师同策略蒸馏中的行为杠杆失衡
本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。