RhymeFlow: 基于异步去噪流调度的视频生成无训练加速方法
摘要
RhymeFlow通过跨帧解耦去噪轨迹来加速视频生成的扩散变换器,利用关键帧锚定和潜在轨迹投影减少计算开销,同时保持视觉质量。
查看缓存全文
缓存时间: 2026/06/15 09:03
论文页面 - RhymeFlow:基于异步去噪流调度的免训练视频生成加速
来源:https://huggingface.co/papers/2606.06309
摘要
RhymeFlow 通过解耦不同帧之间的去噪轨迹,利用关键帧锚定和潜在轨迹投影来加速视频生成的扩散变换器,在降低计算开销的同时保持视觉质量。
基于 Diffusion Transformers(DiTs)的视频生成模型在视频合成中取得了显著性能,但由于 3D 注意力的二次复杂度,它们存在推理延迟高和计算成本大的问题。现有的加速方法主要通过稀疏注意力和 KV 缓存等技术来减少每个单独去噪步骤内的计算复杂度。然而,这些方法严格遵循标准扩散管道的固有约束:目标视频序列中的每一帧都必须经历所有扩散时间步的完整、密集去噪过程。我们观察到,由于相邻帧之间存在对应的内容和运动,当锚定具有关键语义转换的关键帧时,其他帧的中间状态往往遵循更可预测的轨迹,这表明对于自然视频数据而言,这种统一的密集去噪过程本质上存在冗余。为此,我们引入了 RhymeFlow,一个免训练框架,用于解耦不同帧的去噪轨迹。具体来说,我们首先识别出一组稀疏的关键帧,它们主导着潜在语义演变。然后,仅对这些关键帧执行密集的逐步去噪以确保结构完整性,而非关键帧则逐步跳过去噪步骤以最小化计算成本。由于跳过的非关键帧中间状态会破坏关键帧去噪步骤中的时间连贯性,导致视觉退化,我们进一步引入了一个潜在轨迹投影模块,使关键帧能够与完整且时间一致的序列表示进行交互。在当前的基于 DiT 的视频生成模型上进行的大量实验表明,我们的方法以更高的推理速度和更好的视觉质量超越了现有基线。
查看 arXiv 页面 (https://arxiv.org/abs/2606.06309)查看 PDF (https://arxiv.org/pdf/2606.06309)项目页面 (https://simon-dcs.github.io/Website-of-RhymeFlow/)GitHub (https://github.com/Simon-Dcs/RhymeFlow)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06309)
在您的代理中获取此论文:
hf papers read 2606\.06309
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.06309 以将其从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.06309 以将其从此页面链接。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.06309 以将其从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其从此页面链接。
相似文章
多分辨率流匹配:基于分阶段采样的免训练扩散加速
MrFlow 是一种针对流匹配文本到图像模型的免训练多分辨率加速策略,它结合了低分辨率生成、像素空间超分辨率和噪声注入,无需训练或运行时修改即可实现高达25倍的端到端加速。
Dynamic-in-Few-Step: 统一动态计算与少步蒸馏的高效视频生成
本文提出了一种针对视频扩散模型的后训练加速框架,将动态结构稀疏化与少步蒸馏相结合,在保持生成质量的同时实现了显著加速。
FlashRender:通过相机控制的视频均值流实现几步生成式渲染
FlashRender是一个几步生成式渲染框架,通过对齐表示和使用均值流目标来加速视频合成,在显著降低采样成本的同时,达到与多步方法相当的质量。
面向自回归视频生成的在线策略对抗流蒸馏
提出对抗流蒸馏(AFD),用于将异质黑盒视频生成模型蒸馏为自回归学生模型,采用在线策略反馈和前向过程流匹配更新。
NaturalFlow:减少同时语音翻译中干扰性停顿以促进自然语音流畅
本文介绍了NaturalFlow,一种流畅性感知的优化框架,它通过利用模型内部信号减少同时语音翻译中的干扰性停顿,在低延迟和自然语音流畅之间取得平衡。