Flux-OPD:演化上下文下的同策略蒸馏

Hugging Face Daily Papers 论文

摘要

Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。

大型语言模型在开放领域中的训练缺乏可验证的奖励,使得任务偏好难以形式化为有效的监督。上下文可以传达这些偏好,但一旦蒸馏到学生模型中,就几乎无法提供额外的监督,因此需要随学生表现演化的上下文。然而,直接将演化上下文作为训练中的监督会导致不稳定的蒸馏目标和冲突的分布,需要相应的机制来稳定目标并降低冲突的权重。在本文中,我们通过对反向 KL 目标函数进行分解来分析上下文的影响,揭示了两个发现:学生模型被向上下文条件教师的几何平均方向蒸馏,并且目标函数中包含一个衡量这些教师之间冲突的冲突项。基于这一分解,我们提出了 Flux-OPD,一种利用演化上下文作为训练中监督的同策略蒸馏范式,用以捕获开放领域中的任务偏好。Flux-OPD 将上下文条件教师与无上下文教师之间的差异视为上下文差异信号,将其作为上下文校正注入到无上下文教师锚点中,并使用冲突项作为指标来加权校正强度。在开放任务上的实验表明,Flux-OPD 优于现有的 OPD 范式,凸显了将教师监督与演化上下文相结合的潜力。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - Flux-OPD: On-Policy Distillation with Evolving Contexts

来源:https://huggingface.co/papers/2607.28022 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

在开放领域中的大语言模型训练缺乏可验证的奖励,使得任务偏好难以形式化为有效的监督。上下文可以传达此类偏好,但一旦蒸馏到学生模型中,其提供的额外监督就很少了,因此需要随学生表现演化的上下文。然而,直接将演化上下文作为训练中的监督会导致蒸馏目标不稳定和分布冲突,需要机制来稳定目标并降低冲突权重。在本文中,我们通过对反向 KL 目标进行分解来分析上下文的影响,揭示了两个发现:学生被蒸馏到上下文条件教师模型的几何平均方向,且目标中包含一个衡量这些教师模型之间冲突的冲突项。基于此分解,我们提出了 Flux-OPD,一种 OPD 范式,使用演化上下文作为训练中的监督来捕获开放领域中的任务偏好。Flux-OPD 将上下文条件教师与无上下文教师之间的差异视为上下文差异信号,将它们作为上下文校正注入无上下文教师锚点,并使用冲突项作为指标来加权其校正强度。在开放任务上的实验表明,Flux-OPD 优于现有 OPD 范式,突显了将教师监督与演化上下文相结合的潜力。

查看 arXiv 页面查看 PDF添加到收藏

在您的 agent 中获取此论文:

hf papers read 2607\.28022

没有最新版 CLI 吗?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28022 即可从此页面链接到它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28022 即可从此页面链接到它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.28022 即可从此页面链接到它。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

Flow-OPD:用于流匹配模型的对策蒸馏

Hugging Face Daily Papers

Flow-OPD 是一篇研究论文,介绍了一种用于流匹配文生图模型的两阶段对策蒸馏框架。基于 Stable Diffusion 3.5 Medium,该框架显著提升了生成质量和对齐指标。

Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型

Hugging Face Daily Papers

Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。

On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。