使用清洁锚点的飞行中 KV 缓存以实现更快的自回归视频扩散

Hugging Face Daily Papers 论文

摘要

FlashForward 介绍了一种通过重用飞行中 KV 缓存和使用清洁锚点来加速自回归视频扩散的方法,在保持质量的同时实现了高达 2.92 倍的速度提升。

少步自回归视频扩散通过将视频分割为时间块并逐块生成,每个块通过短序列的去噪阶段来生成长视频。为了记忆已生成的块,先前的方法通过额外的前向传播来重建清洁或噪声较少的 KV 缓存,而不推进输出潜变量。然而,每个去噪前向传播本身已经计算了当前块的飞行中 KV。我们引入了 FlashForward,它直接重用此缓存以避免仅缓存更新的模型前向传播。当前块完成一个去噪阶段后,其阶段特定缓存已可用于下一个块。因此,为每个阶段分配一个 GPU 允许不同的块同时占据不同的阶段。这种早期可用性有质量代价:生成的阶段匹配历史是噪声的,导致块之间的外观和运动漂移。为此,FlashForward 在相应区域生成之前生成稀疏的辅助清洁锚点潜变量,以便通过这种双向条件来稳定生成轨迹。这两种记忆在不同时间尺度上操作:稀疏清洁锚点 KV 提供粗糙的、长距离的双向结构指导,而密集的阶段匹配历史保留了精细的、最近的演变。在多达四个 GPU 的情况下,FlashForward 对于 16 FPS 的 20 秒或更长的视频,在 1.3B 和 14B 主干规模下,以 480p 和 720p 分辨率运行,比 HiAR 快 1.16--1.69 倍,比 Self-Forcing 快 1.42--2.92 倍。在 VBench 上,对于 480p 的 1.3B 模型,它获得了更高的分数并在更长持续时间上保持稳定,表明 FlashForward 以更快的生成速度生成高质量且时间一致的视频,覆盖 20 秒、35 秒和 65 秒的持续时间。
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:10

论文页面 - 具有干净锚点的飞行中KV缓存实现更快自回归视频扩散

来源:https://huggingface.co/papers/2609.32540 作者:

,

,

,

,

,

,

,

,

,

,

摘要

少步自回归视频扩散通过将视频分割为时间块并逐块生成(每个块通过短暂的去噪序列)来生成长视频。为记住已生成的块,先前方法通过额外的前向传播(不推进输出潜变量)重建更干净或噪声更少的键-值缓存以构建缓存。然而,每次去噪前向传播本身已经计算了当前块的飞行中KV缓存。我们引入FlashForward,它直接重用此缓存以避免仅更新缓存的繁重模型前向传播。当前块完成一个去噪阶段后,其特定阶段的缓存已可用于下一个块。因此,为每个阶段分配一个GPU可让不同块并发占用不同阶段。这种早期可用性存在质量代价:生成的阶段匹配历史具有噪声,导致块间外观和运动漂移。为补偿此问题,FlashForward在相应区域生成前产生稀疏辅助的干净锚点潜变量,从而可通过这种双向条件稳定生成轨迹。两种记忆在不同时间尺度上运作:稀疏的干净锚点KV提供粗粒度、长程双向结构引导,而密集的阶段匹配历史保留精细的近期演变。使用多达四个GPU时,FlashForward在480p和720p分辨率下、1.3B和14B基础模型规模、16FPS的20秒及以上视频上运行速度分别比HiAR快1.16-1.69倍,比Self-Forcing快1.42-2.92倍。在VBench基准上,对于480p的1.3B模型,它在更长时间持续下获得更高分数且保持稳定,证明FlashForward能以更快的生成速度生成高质量且时间一致的20秒、35秒和65秒视频。

查看arXiv页面 (https://arxiv.org/abs/2609.32540)查看PDF (https://arxiv.org/pdf/2609.32540)项目页面 (https://yikai-wang.github.io/FlashForward/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.32540)

在您的代理中获取此论文:

hf papers read 2609\.32540

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接此论文

在模型的README.md中引用arxiv.org/abs/2609.32540以从此页面链接。

引用本文的数据集0

无数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2609.32540以从此页面链接。

引用本文的空间0

无空间链接此论文

在空间的README.md中引用arxiv.org/abs/2609.32540以从此页面链接。

包含本文的收藏0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

FlashDrive:面向自动驾驶的快速视觉-语言-动作推理

arXiv cs.AI

FlashDrive是一种算法-系统协同设计框架,通过流式KV缓存复用、非自回归扩散草稿和自适应步长缓存,将自动驾驶视觉-语言-动作模型的推理延迟降低4.7倍(在单块GPU上从717毫秒降至151毫秒),且精度损失可忽略不计。

量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正

arXiv cs.LG

本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。