VideoMLA:用于分钟级自回归视频扩散的低秩潜变量KV缓存
摘要
VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。
查看缓存全文
缓存时间: 2026/06/02 03:24
Paper page - VideoMLA: 面向分钟级自回归视频扩散的低秩隐层KV缓存
来源:https://huggingface.co/papers/2605.30351
摘要
VideoMLA通过将每头键值替换为共享的低秩内容隐层和分离的3D-RoPE位置键,降低了视频扩散模型的内存占用,在保持质量的同时实现了显著压缩和吞吐量提升。
长期展开的因果视频扩散(https://huggingface.co/papers?q=causal%20video%20diffusion)已收敛于固定大小的滑动窗口KV缓存(https://huggingface.co/papers?q=KV%20cache),近期进展通过改变窗口中的令牌或位置编码方式在这一布局内进行创新。而每头KV布局本身(流式内存和延迟的主要贡献者)基本保持不变。本文首次研究多头隐层注意力(https://huggingface.co/papers?q=Multi-Head%20Latent%20Attention)(MLA)在视频扩散(https://huggingface.co/papers?q=video%20diffusion)中的应用。VideoMLA将每头键值替换为共享的低秩内容隐层与共享的分离3D-RoPE(https://huggingface.co/papers?q=3D-RoPE)位置键,在每一缓存层将每令牌KV内存减少92.7%。我们进一步探究为何MLA在视频扩散中成功,尽管在语言模型中常用于激励MLA的频谱假设(https://huggingface.co/papers?q=spectral%20assumption)并不成立:预训练的视频注意力并非低秩,其99%能量的有效秩(https://huggingface.co/papers?q=effective%20rank)远高于任何实用的隐层维度。VideoMLA在压缩比下保持质量,而直接频谱近似会预测较大的重构误差。我们表明,决定有效秩(https://huggingface.co/papers?q=effective%20rank)的是MLA瓶颈而非预训练频谱:频谱初始化和随机初始化都几乎占满初始化时的全部秩预算,训练保持该预算并在其内部进行适应。在VBench上,VideoMLA匹配短视界流式视频扩散(https://huggingface.co/papers?q=video%20diffusion)基线,在长视界下取得评估方法中的最佳总体分数,并在单块B200上将吞吐量(https://huggingface.co/papers?q=throughput)提升1.23倍。
查看arXiv页面(https://arxiv.org/abs/2605.30351)查看PDF(https://arxiv.org/pdf/2605.30351)项目页面(https://videomla.github.io/)GitHub1(https://github.com/yesiltepe-hidir/VideoMLA)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.30351)
在您的智能体中获取此论文:
hf papers read 2605\.30351
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.30351 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.30351 以从此页面链接。
引用此论文的Space0
没有Space链接此论文
请在Space README.md 中引用 arxiv.org/abs/2605.30351 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
Forcing-KV:面向高效自回归视频扩散模型的混合KV缓存压缩策略
本文介绍了Forcing-KV,这是一种针对自回归视频扩散模型的混合KV缓存压缩策略,它将注意力头分为静态和动态两类,在1080P分辨率下实现了高达2.82倍的加速,同时保持了输出质量。
FadeMem: 距离感知的记忆整合用于自回归视频扩散
FadeMem 引入了一种距离感知的键值记忆整合机制,将历史视频数据组织成时间层次结构,在固定缓存约束下改进长视频生成。
LVSA: 用于长视频扩散的无训练稀疏注意力
LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。
ReST-KV:基于逐层输出重构与时空平滑的鲁棒 KV Cache 驱逐方法
本文介绍了 ReST-KV,一种用于大型语言模型的新型鲁棒 KV Cache 驱逐方法。该方法利用逐层输出重构与时空平滑技术来提升效率,显著降低了解码延迟,并在 LongBench 和 RULER 等长上下文基准测试中超越了现有的最先进基线模型。
为扩散语言模型启用共享前缀的KV缓存
本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。