SEGA: 扩散变换器中基于光谱能量引导的注意力机制实现分辨率外推
摘要
SEGA是一种无需训练的方法,通过在去噪步骤中根据空间频率结构自适应地缩放RoPE组件的注意力,改善高分辨率文本到图像生成。
查看缓存全文
缓存时间: 2026/05/22 14:20
论文页面 - SEGA:基于谱-能量引导的注意力机制用于扩散 Transformer 的分辨率外推
来源:https://huggingface.co/papers/2605.22668
摘要
SEGA 通过根据去噪过程中潜变量的空间-频率结构,自适应地缩放各 RoPE 分量上的注意力,从而改善高分辨率文本到图像的生成效果。
扩散 Transformer (https://huggingface.co/papers?q=Diffusion%20transformers)(DiTs)已成为文本到图像生成 (https://huggingface.co/papers?q=text-to-image%20generation) 的主导架构,但在生成超出其训练范围的分辨率时,性能会下降。现有的免训练方法通过修改推理时的注意力行为来缓解这一问题,通常采用旋转位置编码 (https://huggingface.co/papers?q=Rotary%20Position%20Embeddings)(RoPE)外推结合注意力缩放 (https://huggingface.co/papers?q=attention%20scaling)。然而,这些策略对具有不同频率特征的 RoPE 分量应用了统一且与内容无关的缩放,导致在保留全局结构与恢复细节之间产生权衡。我们提出了 SEGA,一种免训练方法,它根据每个去噪步骤中潜变量的空间-频率结构 (https://huggingface.co/papers?q=spatial-frequency%20structure),动态地缩放各 RoPE 分量上的注意力。这种自适应缩放同时提升了结构连贯性和细节保真度。实验表明,SEGA 在多个目标分辨率上持续改进高分辨率合成 (https://huggingface.co/papers?q=high-resolution%20synthesis) 效果,优于当前最先进的免训练基线方法。
查看 arXiv 页面 (https://arxiv.org/abs/2605.22668)查看 PDF (https://arxiv.org/pdf/2605.22668)项目页面 (https://rajabi2001.github.io/sega/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.22668)
在您的智能体中获取本论文:
hf papers read 2605.22668
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
暂无模型引用本论文
请在模型 README.md 中引用 arxiv.org/abs/2605.22668,以便在此页面建立链接。
引用本论文的数据集0
暂无数据集引用本论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.22668,以便在此页面建立链接。
引用本论文的 Space0
暂无 Space 引用本论文
请在 Space README.md 中引用 arxiv.org/abs/2605.22668,以便在此页面建立链接。
包含本论文的收藏集0
暂无包含本论文的收藏集
请将本论文添加到收藏集 (https://huggingface.co/new-collection),以便在此页面建立链接。
相似文章
SAGE: 基于注意力引导熵的替代梯度自适应用于脉冲Transformer
本文提出了SAGE,一种利用注意力派生熵自适应替代梯度以提高脉冲Transformer训练准确性的方法,并在CIFAR-10/100数据集上进行了验证。
CogSENet:基于模糊条件语义路由与显式频率融合的盲图像去模糊
CogSENet提出了一种受鹰眼启发的盲图像去模糊框架,利用语义感知模块和频率分解提升恢复质量与结构保真度,优于现有最先进方法。
RefGC-SR^2:参考引导的生成内容超分辨率与精炼
本文提出了一项新任务:参考引导的生成内容超分辨率与精炼(RefGC-SR²),该任务利用频率感知扩散变换器模型,同时恢复高分辨率细节并修正生成伪影。该方法在后处理阶段利用高分辨率参考图像提升AI生成图像的质量。
Spectral Guidance:灵活高效的扩散模型控制方法
介绍了Spectral Guidance,一种通过利用扩散过程的低维表示来控制扩散模型的框架,无需任务特定的重新训练或通过去噪器的反向传播即可实现灵活稳定的控制。
Nemotron-Labs-Diffusion-Image:推进掩蔽离散扩散实现高分辨率图像合成
本文提出 Nemotron-Labs-Diffusion-Image,一种用于高分辨率文生图的掩蔽离散扩散模型,引入令牌编辑机制和分组交叉熵目标,以改进令牌精炼和训练效率。