使用清洁锚点的飞行中 KV 缓存以实现更快的自回归视频扩散
摘要
FlashForward 介绍了一种通过重用飞行中 KV 缓存和使用清洁锚点来加速自回归视频扩散的方法,在保持质量的同时实现了高达 2.92 倍的速度提升。
查看缓存全文
缓存时间: 2026/09/29 08:10
论文页面 - 具有干净锚点的飞行中KV缓存实现更快自回归视频扩散
来源:https://huggingface.co/papers/2609.32540 作者:
,
,
,
,
,
,
,
,
,
,
摘要
少步自回归视频扩散通过将视频分割为时间块并逐块生成(每个块通过短暂的去噪序列)来生成长视频。为记住已生成的块,先前方法通过额外的前向传播(不推进输出潜变量)重建更干净或噪声更少的键-值缓存以构建缓存。然而,每次去噪前向传播本身已经计算了当前块的飞行中KV缓存。我们引入FlashForward,它直接重用此缓存以避免仅更新缓存的繁重模型前向传播。当前块完成一个去噪阶段后,其特定阶段的缓存已可用于下一个块。因此,为每个阶段分配一个GPU可让不同块并发占用不同阶段。这种早期可用性存在质量代价:生成的阶段匹配历史具有噪声,导致块间外观和运动漂移。为补偿此问题,FlashForward在相应区域生成前产生稀疏辅助的干净锚点潜变量,从而可通过这种双向条件稳定生成轨迹。两种记忆在不同时间尺度上运作:稀疏的干净锚点KV提供粗粒度、长程双向结构引导,而密集的阶段匹配历史保留精细的近期演变。使用多达四个GPU时,FlashForward在480p和720p分辨率下、1.3B和14B基础模型规模、16FPS的20秒及以上视频上运行速度分别比HiAR快1.16-1.69倍,比Self-Forcing快1.42-2.92倍。在VBench基准上,对于480p的1.3B模型,它在更长时间持续下获得更高分数且保持稳定,证明FlashForward能以更快的生成速度生成高质量且时间一致的20秒、35秒和65秒视频。
查看arXiv页面 (https://arxiv.org/abs/2609.32540)查看PDF (https://arxiv.org/pdf/2609.32540)项目页面 (https://yikai-wang.github.io/FlashForward/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.32540)
在您的代理中获取此论文:
hf papers read 2609\.32540
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接此论文
在模型的README.md中引用arxiv.org/abs/2609.32540以从此页面链接。
引用本文的数据集0
无数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2609.32540以从此页面链接。
引用本文的空间0
无空间链接此论文
在空间的README.md中引用arxiv.org/abs/2609.32540以从此页面链接。
包含本文的收藏0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
Forcing-KV:面向高效自回归视频扩散模型的混合KV缓存压缩策略
本文介绍了Forcing-KV,这是一种针对自回归视频扩散模型的混合KV缓存压缩策略,它将注意力头分为静态和动态两类,在1080P分辨率下实现了高达2.82倍的加速,同时保持了输出质量。
VideoMLA:用于分钟级自回归视频扩散的低秩潜变量KV缓存
VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。
FadeMem: 距离感知的记忆整合用于自回归视频扩散
FadeMem 引入了一种距离感知的键值记忆整合机制,将历史视频数据组织成时间层次结构,在固定缓存约束下改进长视频生成。
FlashDrive:面向自动驾驶的快速视觉-语言-动作推理
FlashDrive是一种算法-系统协同设计框架,通过流式KV缓存复用、非自回归扩散草稿和自适应步长缓存,将自动驾驶视觉-语言-动作模型的推理延迟降低4.7倍(在单块GPU上从717毫秒降至151毫秒),且精度损失可忽略不计。
量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正
本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。