VideoMLA:用于分钟级自回归视频扩散的低秩潜变量KV缓存

Hugging Face Daily Papers 论文

摘要

VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。

长序列因果视频扩散已经收敛于固定大小的滑动窗口 KV 缓存,最近的进展通过改变窗口中的 token 或其位置编码方式,在这种布局内进行创新。但每个头的 KV 布局本身(流式内存和延迟的主要贡献者)基本保持不变。在本文中,我们首次研究了多头部潜变量注意力(MLA)在视频扩散中的应用。VideoMLA 用共享的低秩内容潜变量和共享的解耦 3D-RoPE 位置键替换了每个头的键和值,在每个缓存层将每个 token 的 KV 内存降低了 92.7%。我们进一步研究了为什么 MLA 在视频扩散中取得成功,即使在语言模型中常用来推动它的谱假设不成立的情况下:预训练的视频注意力并非低秩,其 99% 能量有效秩远高于任何实际的潜变量维度。VideoMLA 在压缩比下保持质量,而直接谱近似会预测较大的重建误差。我们表明,决定有效秩的是 MLA 瓶颈,而不是预训练谱:谱初始化和随机初始化在初始化时都占用了几乎全部秩预算,训练在保持该预算的同时在其内部进行适应。在 VBench 上,VideoMLA 与短视野流式视频扩散基线相匹配,在长视野上取得了评估方法中的最佳总分,并在单个 B200 上提升了 1.23 倍的吞吐量。
查看原文
查看缓存全文

缓存时间: 2026/06/02 03:24

Paper page - VideoMLA: 面向分钟级自回归视频扩散的低秩隐层KV缓存

来源:https://huggingface.co/papers/2605.30351

摘要

VideoMLA通过将每头键值替换为共享的低秩内容隐层和分离的3D-RoPE位置键,降低了视频扩散模型的内存占用,在保持质量的同时实现了显著压缩和吞吐量提升。

长期展开的因果视频扩散(https://huggingface.co/papers?q=causal%20video%20diffusion)已收敛于固定大小的滑动窗口KV缓存(https://huggingface.co/papers?q=KV%20cache),近期进展通过改变窗口中的令牌或位置编码方式在这一布局内进行创新。而每头KV布局本身(流式内存和延迟的主要贡献者)基本保持不变。本文首次研究多头隐层注意力(https://huggingface.co/papers?q=Multi-Head%20Latent%20Attention)(MLA)在视频扩散(https://huggingface.co/papers?q=video%20diffusion)中的应用。VideoMLA将每头键值替换为共享的低秩内容隐层与共享的分离3D-RoPE(https://huggingface.co/papers?q=3D-RoPE)位置键,在每一缓存层将每令牌KV内存减少92.7%。我们进一步探究为何MLA在视频扩散中成功,尽管在语言模型中常用于激励MLA的频谱假设(https://huggingface.co/papers?q=spectral%20assumption)并不成立:预训练的视频注意力并非低秩,其99%能量的有效秩(https://huggingface.co/papers?q=effective%20rank)远高于任何实用的隐层维度。VideoMLA在压缩比下保持质量,而直接频谱近似会预测较大的重构误差。我们表明,决定有效秩(https://huggingface.co/papers?q=effective%20rank)的是MLA瓶颈而非预训练频谱:频谱初始化和随机初始化都几乎占满初始化时的全部秩预算,训练保持该预算并在其内部进行适应。在VBench上,VideoMLA匹配短视界流式视频扩散(https://huggingface.co/papers?q=video%20diffusion)基线,在长视界下取得评估方法中的最佳总体分数,并在单块B200上将吞吐量(https://huggingface.co/papers?q=throughput)提升1.23倍。

查看arXiv页面(https://arxiv.org/abs/2605.30351)查看PDF(https://arxiv.org/pdf/2605.30351)项目页面(https://videomla.github.io/)GitHub1(https://github.com/yesiltepe-hidir/VideoMLA)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.30351)

在您的智能体中获取此论文:

hf papers read 2605\.30351

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.30351 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.30351 以从此页面链接。

引用此论文的Space0

没有Space链接此论文

请在Space README.md 中引用 arxiv.org/abs/2605.30351 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

为扩散语言模型启用共享前缀的KV缓存

arXiv cs.LG

本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。