Energy-Guided Flow Matching
摘要
能量引导流匹配通过使用移动端点和自适应调度改进生成图像质量,以降低的训练成本达到最先进FID分数。
查看缓存全文
缓存时间: 2026/08/19 03:56
论文页面 - 能量引导流匹配
来源:https://huggingface.co/papers/2608.05811 发布于8月7日
·
由 https://huggingface.co/ysng 提交
g (https://huggingface.co/ysng) 于8月19日
摘要
能量引导流匹配通过移动终点和自适应调度逐步揭示高频细节,从而提升生成质量,降低训练成本,并实现了最先进的FID分数。
像素空间生成模型绕过了有损的潜空间压缩,但需要在高维空间中联合学习全局结构和精细细节。标准的流匹配方法将噪声插值到固定的干净图像终点,使得频谱演化需被隐式学习。在本文中,我们引入了能量引导流匹配,该方法通过移动终点显式地建模从粗到细的生成轨迹。具体而言,EG-FM用热核滤波终点替代了固定终点,该终点从低频图像平滑演化为干净图像。移动终点中的高频信号分量由图像特定的能量引导调度进行释放,导致了流匹配中速度的重新定向。我们的框架无需调整主干网络和训练数据,在训练和推理阶段带来的开销可忽略不计。在我们的实验中,EG-FM在ImageNet类别条件图像生成任务中,以更少的训练轮次始终实现了更低的FID:在256×256分辨率下,200轮达到1.55的FID,600轮达到1.45。我们继续在512×512分辨率设置下训练生成任务,仅经过40轮高分辨率适应训练,FID就达到了1.58。此外,我们将EG-FM迁移至文本到图像生成任务,在GenEval上得分0.85,在DPG-Bench上得分83.9。代码已发布在 https://github.com/ysng123/EG-FM。
查看arXiv页面 (https://arxiv.org/abs/2608.05811) 查看PDF (https://arxiv.org/pdf/2608.05811) 项目页面 (https://ysng123.github.io/EG-FM/) GitHub15 (https://github.com/ysng123/EG-FM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.05811)
通过你的代理获取此论文:
hf papers read 2608.05811
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 1
ysng/EG-FM-ImageNet 无条件图像生成 • 7分钟前更新 (https://huggingface.co/ysng/EG-FM-ImageNet)
引用本文的数据集 0
无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2608.05811 以将其链接到此页面。
引用本文的空间 0
无空间链接本文
在空间 README.md 中引用 arxiv.org/abs/2608.05811 以将其链接到此页面。
包含本文的收藏夹 0
无收藏夹包含本文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
遵循均值:参考引导的流匹配
本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。
感知流匹配用于少步生成建模
感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。
跟随均值:参考引导的流匹配 [R]
介绍了参考引导的流匹配,该方法使用参考分布来引导流匹配过程,提高了样本质量和生成效率。
多分辨率流匹配:基于分阶段采样的免训练扩散加速
MrFlow 是一种针对流匹配文本到图像模型的免训练多分辨率加速策略,它结合了低分辨率生成、像素空间超分辨率和噪声注入,无需训练或运行时修改即可实现高达25倍的端到端加速。
几何感知的图像流匹配
本文提出用于自然图像的几何感知流匹配方法,将图像视为超球面上的点,并提出了SOT-CFM和SFM方法,通过利用图像数据的球面结构来改进生成建模。