Flow-DPPO: 针对流匹配模型的散度近端策略优化

Hugging Face Daily Papers 论文

摘要

Flow-DPPO 在流匹配模型中使用散度近端约束替代比率裁剪,通过精确计算 KL 散度,提升了训练稳定性与多目标优化效果。

近期研究表明,在线强化学习能够显著提升用于图像和视频生成的流匹配模型的质量与对齐程度。Flow-GRPO 和 CPS 等方法将去噪过程建模为马尔可夫决策过程,并采用 PPO 风格的比率裁剪来强制执行信任区域。然而,我们认为比率裁剪在结构上并不适用于流模型:新旧策略之间的概率比率是对真实策略散度的有噪单样本估计,这会导致在轨迹的某些区域过度约束,而在其他区域约束不足。我们提出 Flow-DPPO(流散度近端策略优化),该方法用散度近端约束替代比率裁剪。一个关键观察是,流模型中每一步的策略都是高斯分布,因此可以精确且廉价地计算新旧策略之间的 KL 散度。Flow-DPPO 采用非对称散度掩码,仅在更新同时偏离信任区域并违反散度阈值时阻止梯度更新。实验表明,Flow-DPPO 在获得更高奖励的同时具有更好的 KL 近端效率,缓解了灾难性遗忘,促进了平衡的多目标优化,并使得多轮训练保持稳定,而比率裁剪则会导致性能下降。代码和模型已开源:https://github.com/Tencent-Hunyuan/UniRL/tree/main/FlowDPPO。
查看原文
查看缓存全文

缓存时间: 2026/06/10 05:44

Paper page - Flow-DPPO: 面向流匹配模型的散度近端策略优化

来源:https://huggingface.co/papers/2606.11025

摘要

Flow-DPPO 将流匹配模型中的比率裁剪替换为散度近端约束,通过精确的 KL 散度计算提升了训练稳定性和多目标优化。

近期研究表明,在线强化学习(https://huggingface.co/papers?q=online%20reinforcement%20learning)能够显著提升用于图像和视频生成的流匹配模型(https://huggingface.co/papers?q=flow%20matching%20models)的质量和对齐效果。Flow-GRPO 和 CPS 等方法将去噪过程(https://huggingface.co/papers?q=denoising%20process)建模为马尔可夫决策过程(https://huggingface.co/papers?q=Markov%20Decision%20Process),并采用 PPO 风格的比率裁剪(https://huggingface.co/papers?q=PPO-style%20ratio%20clipping)来强制维持信任区域(https://huggingface.co/papers?q=trust%20region)。然而,我们认为比率裁剪在结构上并不适合流模型:新旧策略之间的概率比只是真实策略散度(https://huggingface.co/papers?q=policy%20divergence)的一个含噪单样本估计,这会导致轨迹的某些区域过度约束而另一些区域约束不足。我们提出 Flow-DPPO(流散度近端策略优化),用散度近端约束替代比率裁剪。一个关键发现是,流模型中的逐步骤策略服从高斯分布,因此可以精确且低代价地计算新旧策略之间的 KL 散度(https://huggingface.co/papers?q=KL%20divergence)。Flow-DPPO 采用非对称散度掩码(https://huggingface.co/papers?q=asymmetric%20divergence%20mask),仅在梯度更新同时远离信任区域并违反散度阈值时阻止更新。实验表明,Flow-DPPO 在实现更高奖励的同时具有更好的 KL 近端效率,减轻了灾难性遗忘(https://huggingface.co/papers?q=catastrophic%20forgetting),促进了平衡的多目标优化(https://huggingface.co/papers?q=multi-objective%20optimization),并支持稳定的多轮训练(https://huggingface.co/papers?q=multi-epoch%20training),而比率裁剪在此场景下性能下降。代码和模型已在 https://github.com/Tencent-Hunyuan/UniRL/tree/main/FlowDPPO 公开。

查看 arXiv 页面(https://arxiv.org/abs/2606.11025)查看 PDF(https://arxiv.org/pdf/2606.11025)项目页面(https://jayce-ping.github.io/Flow-DPPO-Project-Page/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.11025)

在您的 Agent 中获取本文:

hf papers read 2606.11025

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型关联本文

请在模型 README.md 中引用 arxiv.org/abs/2606.11025 以在此页面建立关联。

引用本文的数据集 0

暂无数据集关联本文

请在数据集 README.md 中引用 arxiv.org/abs/2606.11025 以在此页面建立关联。

引用本文的 Space 0

暂无 Space 关联本文

请在 Space README.md 中引用 arxiv.org/abs/2606.11025 以在此页面建立关联。

包含本文的收藏集 0

暂无收藏集包含本文

请将本文添加到收藏集(https://huggingface.co/new-collection)以在此页面建立关联。

相似文章

Flow-OPD:用于流匹配模型的对策蒸馏

Hugging Face Daily Papers

Flow-OPD 是一篇研究论文,介绍了一种用于流匹配文生图模型的两阶段对策蒸馏框架。基于 Stable Diffusion 3.5 Medium,该框架显著提升了生成质量和对齐指标。

DanceOPD:基于策略的生成场蒸馏

Hugging Face Daily Papers

DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。

PrismFlow:时间序列生成中流匹配的残差动力学

arXiv cs.LG

PrismFlow 提出了一种流匹配方法,结合了受Koopman启发的动力学专家来处理多模态和多尺度时间序列数据,取得了最先进的性能,在Context-FID和Discriminative Score上均有显著提升。

无漂移扩散策略优化

arXiv cs.LG

DiPOD通过交错自蒸馏与策略梯度更新来稳定扩散策略优化,保持紧凑的ELBO,防止双重漂移现象,在语言和连续控制任务中均能获得更高奖励。