Flux-OPD:演化上下文下的同策略蒸馏
摘要
Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - Flux-OPD: On-Policy Distillation with Evolving Contexts
来源:https://huggingface.co/papers/2607.28022 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
在开放领域中的大语言模型训练缺乏可验证的奖励,使得任务偏好难以形式化为有效的监督。上下文可以传达此类偏好,但一旦蒸馏到学生模型中,其提供的额外监督就很少了,因此需要随学生表现演化的上下文。然而,直接将演化上下文作为训练中的监督会导致蒸馏目标不稳定和分布冲突,需要机制来稳定目标并降低冲突权重。在本文中,我们通过对反向 KL 目标进行分解来分析上下文的影响,揭示了两个发现:学生被蒸馏到上下文条件教师模型的几何平均方向,且目标中包含一个衡量这些教师模型之间冲突的冲突项。基于此分解,我们提出了 Flux-OPD,一种 OPD 范式,使用演化上下文作为训练中的监督来捕获开放领域中的任务偏好。Flux-OPD 将上下文条件教师与无上下文教师之间的差异视为上下文差异信号,将它们作为上下文校正注入无上下文教师锚点,并使用冲突项作为指标来加权其校正强度。在开放任务上的实验表明,Flux-OPD 优于现有 OPD 范式,突显了将教师监督与演化上下文相结合的潜力。
在您的 agent 中获取此论文:
hf papers read 2607\.28022
没有最新版 CLI 吗?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28022 即可从此页面链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.28022 即可从此页面链接到它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28022 即可从此页面链接到它。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。
Flow-OPD:用于流匹配模型的对策蒸馏
Flow-OPD 是一篇研究论文,介绍了一种用于流匹配文生图模型的两阶段对策蒸馏框架。基于 Stable Diffusion 3.5 Medium,该框架显著提升了生成质量和对齐指标。
Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型
Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。