Energy-Guided Flow Matching

Hugging Face Daily Papers 论文

摘要

能量引导流匹配通过使用移动端点和自适应调度改进生成图像质量,以降低的训练成本达到最先进FID分数。

像素空间生成模型绕过有损潜在压缩,但需要在高维空间中联合学习全局结构和细粒度细节。标准流匹配将噪声向固定干净图像端点插值,留下频谱演化需要隐式学习。本文引入能量引导流匹配(EG-FM),通过移动端点显式建模从粗到细的生成轨迹。具体而言,EG-FM用热核过滤端点替代固定端点,该端点从低频图像平滑演化为干净图像。移动端点中的高频信号比例通过图像特定能量引导调度释放,导致流匹配中速度的重新定向。我们的框架无需调整骨干网络和训练数据,在训练和推理阶段带来可忽略的成本。在我们的实验中,EG-FM在ImageNet类条件图像生成任务中,以更少的轮次在256×256分辨率下持续获得更低的FID分数,在200个轮次时达到1.55,在600个轮次时达到1.45。我们在512×512分辨率设置下继续训练生成任务,仅在40个高分辨率适应轮次后得到1.58的FID分数。此外,我们将EG-FM应用于文本到图像生成,在GenEval分数上达到0.85,在DPG-Bench上达到83.9。代码可在https://github.com/ysng123/EG-FM获取。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:56

论文页面 - 能量引导流匹配

来源:https://huggingface.co/papers/2608.05811 发布于8月7日

·

由 https://huggingface.co/ysng 提交

g (https://huggingface.co/ysng) 于8月19日

摘要

能量引导流匹配通过移动终点和自适应调度逐步揭示高频细节,从而提升生成质量,降低训练成本,并实现了最先进的FID分数。

像素空间生成模型绕过了有损的潜空间压缩,但需要在高维空间中联合学习全局结构和精细细节。标准的流匹配方法将噪声插值到固定的干净图像终点,使得频谱演化需被隐式学习。在本文中,我们引入了能量引导流匹配,该方法通过移动终点显式地建模从粗到细的生成轨迹。具体而言,EG-FM用热核滤波终点替代了固定终点,该终点从低频图像平滑演化为干净图像。移动终点中的高频信号分量由图像特定的能量引导调度进行释放,导致了流匹配中速度的重新定向。我们的框架无需调整主干网络和训练数据,在训练和推理阶段带来的开销可忽略不计。在我们的实验中,EG-FM在ImageNet类别条件图像生成任务中,以更少的训练轮次始终实现了更低的FID:在256×256分辨率下,200轮达到1.55的FID,600轮达到1.45。我们继续在512×512分辨率设置下训练生成任务,仅经过40轮高分辨率适应训练,FID就达到了1.58。此外,我们将EG-FM迁移至文本到图像生成任务,在GenEval上得分0.85,在DPG-Bench上得分83.9。代码已发布在 https://github.com/ysng123/EG-FM。

查看arXiv页面 (https://arxiv.org/abs/2608.05811) 查看PDF (https://arxiv.org/pdf/2608.05811) 项目页面 (https://ysng123.github.io/EG-FM/) GitHub15 (https://github.com/ysng123/EG-FM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.05811)

通过你的代理获取此论文:

hf papers read 2608.05811

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 1

ysng/EG-FM-ImageNet 无条件图像生成 • 7分钟前更新 (https://huggingface.co/ysng/EG-FM-ImageNet)

引用本文的数据集 0

无数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2608.05811 以将其链接到此页面。

引用本文的空间 0

无空间链接本文

在空间 README.md 中引用 arxiv.org/abs/2608.05811 以将其链接到此页面。

包含本文的收藏夹 0

无收藏夹包含本文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

遵循均值:参考引导的流匹配

Hugging Face Daily Papers

本文介绍了一种在流匹配中实现可控生成的方法,通过使用参考集调整条件端点均值,提供了无需训练和半参数化的指导方式,用于风格和内容控制。

感知流匹配用于少步生成建模

Hugging Face Daily Papers

感知流匹配在感知特征空间中对流匹配进行监督,使得仅需4-8步采样而非35-50步即可实现高质量少步生成,且无需教师模型。

几何感知的图像流匹配

Hugging Face Daily Papers

本文提出用于自然图像的几何感知流匹配方法,将图像视为超球面上的点,并提出了SOT-CFM和SFM方法,通过利用图像数据的球面结构来改进生成建模。