有色噪声扩散采样

Hugging Face Daily Papers 论文

摘要

介绍了有色噪声采样(CNS),这是一种无需训练的扩散模型随机求解器,可根据频率依赖的时间表动态分配能量,在ImageNet-256上显著提高了FID等图像质量指标。

扩散模型在图像合成领域达到了最先进的水平,其生成轨迹本质上表现出频谱偏差:早期解析低频全局结构,后期处理高频细节。传统的随机微分方程求解器未能考虑这一动态特性,在整个过程中简单注入均匀白噪声,浪费了有限的能量预算。本文建立了一个数学框架,将随机微分方程推理重新视为一种针对性的、频率解耦的能量传递。基于该框架,我们提出了有色噪声采样(CNS),一种新颖的、无需训练的随机求解器。与注入均匀白噪声不同,CNS采用动态的、时间步和频率依赖的时间表,将注入能量更高效地分配到未解析的频率波段。通过主动利用模型的固有频谱偏差,CNS系统地将生成分布引导至真实的数据流形。大量实验表明,CNS作为严格的即插即用推理采样替代方案,在多种架构(SiT、JiT、FLUX)上显著优于标准ODE和SDE基线。与ImageNet-256上的标准采样相比,CNS在SiT-XL/2上实现了FID从8.26到6.27的无引导显著降低,在JiT-B/16上从32.39降至26.69,在JiT-H/16上从11.88降至8.31,同时在使用无分类器引导时也取得了一致的相对FID改善。项目页面见 https://hadardavidson.github.io/CNS/。
查看原文
查看缓存全文

缓存时间: 2026/05/29 07:00

论文页面 - 彩色噪声扩散采样

来源:https://huggingface.co/papers/2605.30332

摘要

扩散模型在图像合成中表现出频谱偏差,一种名为彩色噪声采样的新采样方法通过基于频率相关调度动态分配能量来应对这一问题,从而提升了图像质量指标。

扩散模型(https://huggingface.co/papers?q=Diffusion%20models)实现了当前最先进的图像合成效果,其生成轨迹本质上表现出频谱偏差(https://huggingface.co/papers?q=spectral%20bias),即早期处理低频全局结构,后期处理高频精细细节。传统的随机微分方程(https://huggingface.co/papers?q=stochastic%20differential%20equation)(SDE)求解器未能考虑这一动态特性,在整个过程中幼稚地注入均匀的白噪声(https://huggingface.co/papers?q=white%20noise),浪费了有限的能量预算。在本工作中,我们建立了一个数学框架,将SDE推理重新定义为一种有针对性的、频率解耦的能量传递(https://huggingface.co/papers?q=energy%20transfer)。基于这一框架,我们引入了彩色噪声采样(https://huggingface.co/papers?q=Colored%20Noise%20Sampling)(CNS),这是一种新颖的、无需训练随机求解器。与注入均匀白噪声(https://huggingface.co/papers?q=white%20noise)不同,CNS利用动态的、依赖时间步和频率的调度(https://huggingface.co/papers?q=frequency-dependent%20schedule),将注入能量更高效地分配给结构尚未解析的频率带。通过主动利用模型(https://huggingface.co/papers?q=ode)固有的频谱偏差(https://huggingface.co/papers?q=spectral%20bias),CNS系统地将生成分布引导向真实数据流形。大量实验证明,作为严格即插即用的推理时采样器替换方案,CNS在不同架构(SiT、JiT、FLUX)上显著优于标准ODE(https://huggingface.co/papers?q=ODE)和SDE基线。与ImageNet-256上的标准采样相比,CNS实现了显著的无引导FID(https://huggingface.co/papers?q=FID)降低,SiT-XL/2从8.26提升至6.27,JiT-B/16从32.39提升至26.69,JiT-H/16从11.88提升至8.31,同时在无分类器引导(https://huggingface.co/papers?q=Classifier-Free%20Guidance)下也获得了一致的相对FID(https://huggingface.co/papers?q=FID)改进。项目页面请访问 https://hadardavidson.github.io/CNS/。

查看arXiv页面(https://arxiv.org/abs/2605.30332)查看PDF(https://arxiv.org/pdf/2605.30332)项目页面(https://hadardavidson.github.io/CNS/)GitHub0(https://github.com/hadardavidson/colored-noise-sampling)加入收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.30332)

在您的智能体中获取此论文:

hf papers read 2605.30332

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.30332 即可在此页面建立链接。

引用此论文的数据集0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.30332 即可在此页面建立链接。

引用此论文的Spaces0

暂无Spaces链接此论文

在Space README.md 中引用 arxiv.org/abs/2605.30332 即可在此页面建立链接。

包含此论文的收藏集0

暂无包含此论文的收藏集

添加此论文至收藏集(https://huggingface.co/new-collection)即可在此页面建立链接。

相似文章

面向扩散模型的类频率引导噪声调度

arXiv cs.LG

本文提出了一种面向扩散模型的类频率引导噪声调度,为低频类别分配更大尺度的噪声,以改善在不平衡数据集上的生成质量,相较于基线方法取得了显著提升。

基于离散扩散的约束代码生成

arXiv cs.CL

本文介绍了Constrained Diffusion for Code (CDC),这是一种无需训练的神经符号推理框架,它将约束满足直接集成到离散扩散模型的逆向去噪过程中,用于代码生成。CDC在功能正确性、安全性和语法方面持续提升约束满足率,在多个基准测试中优于现有的扩散模型和自回归基线。

显露信号,隐藏噪声:像素空间扩散的频谱强制

Hugging Face Daily Papers

一种名为频谱强制(Spectral Forcing)的新技术,将时间条件化的二维离散余弦变换(2D-DCT)低通算子应用于像素空间扩散模型,通过显式分离信号与噪声提升效率,在ImageNet及文生图任务上超越基线方法。

循环去噪揭示扩散模型中的超稳定记忆

arXiv cs.LG

循环去噪作为一种新颖的提取攻击方法,通过反复对样本进行加噪和去噪,揭示了扩散模型中超稳定的记忆训练图像。该技术无需梯度或权重检查,对隐私审计具有重要意义。