Flow-OPD:用于流匹配模型的对策蒸馏
摘要
Flow-OPD 是一篇研究论文,介绍了一种用于流匹配文生图模型的两阶段对策蒸馏框架。基于 Stable Diffusion 3.5 Medium,该框架显著提升了生成质量和对齐指标。
查看缓存全文
缓存时间: 2026/05/11 07:20
论文页面 - Flow-OPD:面向流匹配模型的在线策略蒸馏
来源:https://huggingface.co/papers/2605.08063
摘要
Flow-OPD 通过结合在线策略蒸馏(on-policy distillation)与流形锚点正则化(manifold anchor regularization)的两阶段对齐方法,解决了流匹配(Flow Matching)文本到图像模型的局限性,在生成质量和对齐指标上实现了显著提升。
现有的流匹配(https://huggingface.co/papers?q=Flow%20Matching)(FM)文本到图像模型在多任务对齐下面临两个关键瓶颈:由标量奖励引起的奖励稀疏性,以及联合优化异构目标导致的梯度干扰。这两者共同引发了竞争指标的“跷跷板效应”以及普遍存在的奖励黑客(reward hacking)问题。受在线策略蒸馏(https://huggingface.co/papers?q=On-Policy%20Distillation)(OPD)在大语言模型社区中成功的启发,我们提出了 Flow-OPD,这是首个将在线策略蒸馏(https://huggingface.co/papers?q=on-policy%20distillation)集成到流匹配(https://huggingface.co/papers?q=Flow%20Matching)模型中的统一后训练框架。Flow-OPD 采用两阶段对齐策略:首先通过单奖励 GRPO(https://huggingface.co/papers?q=GRPO)微调培养领域专用的教师模型,使每个专家在隔离状态下达到其性能上限;然后通过基于流的冷启动(Cold-Start)方案建立稳健的初始策略,并通过在线采样、任务路由标签(https://huggingface.co/papers?q=task-routing%20labeling)和密集轨迹级监督(https://huggingface.co/papers?q=dense%20trajectory-level%20supervision)的三步编排,将异构专业知识无缝整合到单一学生模型中。我们还引入了流形锚点正则化(https://huggingface.co/papers?q=Manifold%20Anchor%20Regularization)(MAR),利用任务无关的教师提供全数据监督,将生成过程锚定在高质流形上,有效缓解了纯 RL 驱动对齐中常见的美感退化问题。基于 Stable Diffusion 3.5 Medium(https://huggingface.co/papers?q=Stable%20Diffusion%203.5%20Medium),Flow-OPD 将 GenEval 分数(https://huggingface.co/papers?q=GenEval%20score)从 63 提升至 92,将 OCR 准确率(https://huggingface.co/papers?q=OCR%20accuracy)从 59 提升至 94,相较于原始 GRPO(https://huggingface.co/papers?q=GRPO)整体提升了约 10 分,同时保持了图像保真度和人类偏好对齐,并展现出显著的“超越教师”效应。这些结果确立了 Flow-OPD 作为构建通用文本到图像模型的可扩展对齐范式。
查看 arXiv 页面 (https://arxiv.org/abs/2605.08063) 查看 PDF (https://arxiv.org/pdf/2605.08063) 项目页面 (https://costaliya.github.io/Flow-OPD/) GitHub11 (https://github.com/CostaliyA/Flow-OPD) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.08063)
在你的 agent 中获取这篇论文:
hf papers read 2605\.08063
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
CostaliyA/Flow-OPD 更新于4小时前 • 12 (https://huggingface.co/CostaliyA/Flow-OPD)
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.08063 即可从此页面建立链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.08063 即可从此页面建立链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面建立链接。
相似文章
Any-OPD:基于表示空间桥接的异构同策略蒸馏用于流匹配模型
Any-OPD 提出了首个在任意潜在流匹配生成器之间进行同策略蒸馏的框架,通过冻结的视觉表示进行桥接,实现了从 12B FLUX 模型到 2.5B SD3.5 模型的蒸馏。它将学生的 PickScore 从 0.846 提升到 0.884,在仅为教师模型五分之一规模的情况下与之媲美。
DanceOPD:基于策略的生成场蒸馏
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。
Poly-OPD:面向能力可选的流模型的异构多教师同策略蒸馏
Poly-OPD 是一个框架,用于将异构文生图流模型的互补优势蒸馏到一个紧凑的流匹配学生模型中,通过像素桥和梯度兼容适配器实现。它在提升 GenEval 和 DrawBench 得分的同时,整合了多个教师模型的能力。
Flow-DPPO: 针对流匹配模型的散度近端策略优化
Flow-DPPO 在流匹配模型中使用散度近端约束替代比率裁剪,通过精确计算 KL 散度,提升了训练稳定性与多目标优化效果。
Flux-OPD:演化上下文下的同策略蒸馏
Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。