标签
Sol-Attn 提出了一种无需训练的方法,用于视频生成推理的注意力稀疏化,通过在线softmax过程中动态选择键值块,实现了超过2倍的速度提升,且质量损失极小。
本文研究了扩散变换器(DiTs)中的文本模板令牌如何作为隐式语义寄存器,在去噪过程中因果地维持物体身份,并提出了一种无需训练的剪枝规则,该规则移除了20%的注意力FLOPs,且性能下降极小。
介绍了外观指针,这是一种紧凑的标记,能够引导扩散变换器在指定空间位置应用正确的外观提示,从而无需重新训练基础模型即可实现模态无关的局部多模态控制。
ReChannel通过将令牌直接映射到像素空间块,适配预训练的扩散变换器(如FLUX-Klein)用于密集预测任务,在无三元图的抠图、KITTI深度和指代分割上以极少的额外参数取得了最先进的成果。
本文探讨了在像素空间扩散变换器(DiTs)中使用寄存器令牌的情况,发现尽管DiTs没有补丁令牌异常值,但寄存器令牌仍能提高特征图质量。作者提出了寄存器引导(Register Guidance)技术,用于放大寄存器贡献,以改善视觉结构。
UltraFlux 提出了一种数据-模型协同设计方法,用于多种宽高比下的原生4K文本到图像生成,解决了位置编码、VAE压缩和优化挑战。它优于现有的开源基线,并达到了与 Seedream 4.0 等专有模型相当的水平。
OrbitQuant提出了一种数据无关的扩散Transformer量化方法,消除了跨时间步和模态进行重新校准的需求,在FLUX.1和CogVideoX等模型的低位宽设置下实现了最先进的后训练量化水平。
本文研究了扩散Transformer中自对齐方法的机制,揭示了Self-Flow等方法带来的性能提升主要来自噪声维度上的数据增强,而非噪声级别之间的token交互。作者引入Attention Separation来证明这一点,并提出了一种结合自表示对齐与双时间步增强的有效设计。
提出质量表示模块(QRM),一种轻量级Transformer模块,将质量感知信号注入扩散变换器调制中,以改善图像保真度和提示对齐,而无需更改主干网络或采样调度。
本文介绍了SpheRoPE,一个零样本且无需优化的框架,它将球形先验注入预训练的扩散变换器中,用于生成360度全景图像和视频,无需重新训练即可克服拓扑约束。
PhysiFormer 使用坐标空间扩散生成物理上合理的3D物体运动,无需显式归纳偏置,实现了高效的多物体推理以及对复杂材料和几何形状的泛化。
介绍了DiffusionBench,这是一个统一的基准,用于全面评估生成式扩散变换器,支持多种生成任务,并提供标准化的训练与评估。
研究人员引入了NanoGen,一个用于训练和评估扩散变换器的统一框架,并提出了DiffusionBench,一个结合了ImageNet类别条件和文本到图像生成的全面基准,以更好地评估生成建模的进展。
一个简化的开源 PyTorch 实现,包含可逐行验证的源代码映射,专为教育目的设计。
MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。
HiLo-Token 提出了一种面向扩散变换器的输入自适应令牌压缩框架,为高频区域分配更多令牌,在图像编辑任务中实现高达 3.13 倍的加速且无质量损失。
一个统一的框架,通过网格运动视频和多模态扩散变换器实现相机运动克隆,无需交叉配对数据即可实现导演级别的控制。
RhymeFlow通过跨帧解耦去噪轨迹来加速视频生成的扩散变换器,利用关键帧锚定和潜在轨迹投影减少计算开销,同时保持视觉质量。
SEGA是一种无需训练的方法,通过在去噪步骤中根据空间频率结构自适应地缩放RoPE组件的注意力,改善高分辨率文本到图像生成。
本文提出扩散自适应路由(DAR),这是一种可学习的、时间步自适应的残差替换方法,旨在改善扩散Transformer中的跨层信息流动,从而显著加速训练并提升质量。