Flow-OPD:用于流匹配模型的对策蒸馏

Hugging Face Daily Papers 论文

摘要

Flow-OPD 是一篇研究论文,介绍了一种用于流匹配文生图模型的两阶段对策蒸馏框架。基于 Stable Diffusion 3.5 Medium,该框架显著提升了生成质量和对齐指标。

现有的流匹配(Flow Matching, FM)文生图模型在多任务对齐方面面临两个关键瓶颈:由标量奖励引起的奖励稀疏性,以及联合优化异构目标产生的梯度干扰。这两者共同导致了竞争指标之间的“跷跷板效应”和普遍的奖励黑客行为。受对策蒸馏(On-Policy Distillation, OPD)在大语言模型社区中成功应用的启发,我们提出了 Flow-OPD,这是首个将对策蒸馏整合到流匹配模型中的统一后训练框架。Flow-OPD 采用两阶段对齐策略:首先通过单奖励 GRPO 微调来培养领域专用的教师模型,使每个专家在隔离状态下达到其性能上限;然后通过基于流的冷启动方案建立稳健的初始策略,并通过对策采样、任务路由标签和密集轨迹级监督的三步协调,将异构专业知识无缝整合到一个学生模型中。我们进一步引入了流形锚定正则化(Manifold Anchor Regularization, MAR),利用任务无关的教师提供全数据监督,将生成过程锚定在高质流形上,有效缓解了纯强化学习驱动对齐中常见的审美退化问题。基于 Stable Diffusion 3.5 Medium 构建的 Flow-OPD 将 GenEval 分数从 63 提升至 92,OCR 准确率从 59 提升至 94,相比原始 GRPO 整体提升了约 10 分,同时保持了图像保真度和人类偏好对齐,并表现出涌现的“超越教师”效应。这些结果确立了 Flow-OPD 作为构建通用文生图模型的可扩展对齐范式。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:20

论文页面 - Flow-OPD:面向流匹配模型的在线策略蒸馏

来源:https://huggingface.co/papers/2605.08063

摘要

Flow-OPD 通过结合在线策略蒸馏(on-policy distillation)与流形锚点正则化(manifold anchor regularization)的两阶段对齐方法,解决了流匹配(Flow Matching)文本到图像模型的局限性,在生成质量和对齐指标上实现了显著提升。

现有的流匹配(https://huggingface.co/papers?q=Flow%20Matching)(FM)文本到图像模型在多任务对齐下面临两个关键瓶颈:由标量奖励引起的奖励稀疏性,以及联合优化异构目标导致的梯度干扰。这两者共同引发了竞争指标的“跷跷板效应”以及普遍存在的奖励黑客(reward hacking)问题。受在线策略蒸馏(https://huggingface.co/papers?q=On-Policy%20Distillation)(OPD)在大语言模型社区中成功的启发,我们提出了 Flow-OPD,这是首个将在线策略蒸馏(https://huggingface.co/papers?q=on-policy%20distillation)集成到流匹配(https://huggingface.co/papers?q=Flow%20Matching)模型中的统一后训练框架。Flow-OPD 采用两阶段对齐策略:首先通过单奖励 GRPO(https://huggingface.co/papers?q=GRPO)微调培养领域专用的教师模型,使每个专家在隔离状态下达到其性能上限;然后通过基于流的冷启动(Cold-Start)方案建立稳健的初始策略,并通过在线采样、任务路由标签(https://huggingface.co/papers?q=task-routing%20labeling)和密集轨迹级监督(https://huggingface.co/papers?q=dense%20trajectory-level%20supervision)的三步编排,将异构专业知识无缝整合到单一学生模型中。我们还引入了流形锚点正则化(https://huggingface.co/papers?q=Manifold%20Anchor%20Regularization)(MAR),利用任务无关的教师提供全数据监督,将生成过程锚定在高质流形上,有效缓解了纯 RL 驱动对齐中常见的美感退化问题。基于 Stable Diffusion 3.5 Medium(https://huggingface.co/papers?q=Stable%20Diffusion%203.5%20Medium),Flow-OPD 将 GenEval 分数(https://huggingface.co/papers?q=GenEval%20score)从 63 提升至 92,将 OCR 准确率(https://huggingface.co/papers?q=OCR%20accuracy)从 59 提升至 94,相较于原始 GRPO(https://huggingface.co/papers?q=GRPO)整体提升了约 10 分,同时保持了图像保真度和人类偏好对齐,并展现出显著的“超越教师”效应。这些结果确立了 Flow-OPD 作为构建通用文本到图像模型的可扩展对齐范式。

查看 arXiv 页面 (https://arxiv.org/abs/2605.08063) 查看 PDF (https://arxiv.org/pdf/2605.08063) 项目页面 (https://costaliya.github.io/Flow-OPD/) GitHub11 (https://github.com/CostaliyA/Flow-OPD) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.08063)

在你的 agent 中获取这篇论文:

hf papers read 2605\.08063

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

CostaliyA/Flow-OPD 更新于4小时前 • 12 (https://huggingface.co/CostaliyA/Flow-OPD)

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.08063 即可从此页面建立链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.08063 即可从此页面建立链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面建立链接。

相似文章

Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型

Hugging Face Daily Papers

Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。

DanceOPD:基于策略的生成场蒸馏

Hugging Face Daily Papers

DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。

Flux-OPD:演化上下文下的同策略蒸馏

Hugging Face Daily Papers

Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。