感知流匹配用于少步生成建模

Hugging Face Daily Papers 论文

摘要

感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。

我们提出感知流匹配(Perceptual Flow Matching,PFM),这是一种用于流匹配模型中少步生成的简单而有效的框架。与在传统VAE潜在空间中进行速度回归不同,PFM使用预训练的感知模型在感知特征空间中对流匹配进行监督。这一简单的改变显著提升了流匹配模型的少步生成能力,将采样步数从35-50步减少到4-8步,同时保持生成质量。与现有的加速和蒸馏方法不同,PFM既不需要教师模型,也不需要辅助评分网络,并且可以以最小的修改集成到标准的流匹配训练流程中。在图像生成、视频生成和图像编辑任务上的大量实验表明,PFM持续产生高质量结果,同时比现有的基于蒸馏的方法产生更少的伪影。我们进一步证明,感知监督将回归最小化器从均值寻求转变为模式寻求,使预测偏向于流形上的模式,这些模式在粗糙的少步积分下仍然保持准确。我们的结果表明,当在适当的表示空间中进行监督时,标准的流匹配训练自然可以产生高质量的少步生成器。我们希望这一见解能激发未来对面向表示的目标函数的研究,以实现高效的生成建模。
查看原文
查看缓存全文

缓存时间: 2026/07/07 10:43

论文页面 - Perceptual Flow Matching for Few-Step Generative Modeling

来源: https://huggingface.co/papers/2607.03524
发布于 7月3日

·

提交者 https://huggingface.co/simingfu

fu (https://huggingface.co/simingfu) 于 7月7日

摘要

感知流匹配通过在感知特征空间中监督流匹配,实现了高效的少步生成,以更少的采样步数获得高质量结果并提升精度。

我们提出感知流匹配(PFM),一种简单而有效的框架,用于流匹配模型中的少步生成。与在传统VAE潜在空间中进行速度回归不同,PFM利用预训练感知模型在感知特征空间中监督流匹配。这一简单改动显著提升了流匹配模型的少步生成能力,将采样步数从35-50步减少至4-8步,同时保持生成质量。与现有的加速和蒸馏方法不同,PFM既不需要教师模型,也不需要辅助评分网络,并且只需极少修改即可集成到标准流匹配训练流程中。在图像生成、视频生成和图像编辑任务上的大量实验表明,PFM始终能产生高质量结果,且相比现有蒸馏方法产生的伪影更少。我们进一步证明,感知监督将回归最小化器从均值追求转向模式追求,使预测偏向于在粗略少步积分下仍保持准确的流形上的模式。我们的结果表明,当在合适的表示空间中进行监督时,标准流匹配训练自然能够产生高质量的少步生成器。希望这一见解能激发未来对高效生成建模中表示感知目标的研究。

查看 arXiv 页面 (https://arxiv.org/abs/2607.03524)
查看 PDF (https://arxiv.org/pdf/2607.03524)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.03524)

在你的 agent 中获取此论文:

hf papers read 2607.03524

没有最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.03524 以从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.03524 以从此页面链接。

引用此论文的 Spaces 0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.03524 以从此页面链接。

包含此论文的收藏 0

没有收藏包含此论文

将论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

FlowLM: 基于扩散-流适配的少步语言建模

arXiv cs.CL

FlowLM 提出了一种流匹配语言模型,通过高效微调从预训练扩散模型衍生而来,能够实现高质量少步文本生成,其效果可与2000步扩散采样相媲美,而训练轮次更少。

遵循均值:参考引导的流匹配

Hugging Face Daily Papers

本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。

Flow-Map GRPO:基于锚定随机组合的少步流图生成器强化学习

arXiv cs.LG

提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。