为什么视频处理仍然如此昂贵?视频和视听大语言模型推理效率机制综述
摘要
本综述研究了视频大语言模型的推理效率技术,分析了在帧采样、编码、令牌压缩和语言模型阶段的成本降低,同时识别了评估缺口。
查看缓存全文
缓存时间: 2026/09/10 10:10
论文页 - 为何视频仍然如此昂贵?视频与视听大语言模型推理效率机制综述
来源:https://huggingface.co/papers/2609.10355
摘要
本综述研究了视频大语言模型的推理效率技术,分析了从帧采样、编码、令牌压缩到语言模型阶段的成本降低效果,并指出了评估方面的不足。
视频理解领域正迅速向视频大语言模型(VideoLLMs)演进:这类系统将视频表示与预训练大语言模型相结合,并根据文本提示进行生成。它们在图像描述、问答、检索和时序定位方面的强大性能,伴随着计算和内存成本随帧数和上下文长度增长而增加,限制了其在实时、移动和资源受限场景中的部署。本综述涵盖了视觉及视听VideoLLMs报告了具体参数量、每个输入FLOPs、延迟、内存或视觉与音频令牌数量降低的推理效率机制。我们分析了贯穿帧采样、模态编码、连接器级令牌缩减以及LLM预填充与解码各环节的瓶颈。我们按这些机制作用的流水线阶段组织方法,涵盖了自2022年末以来开发的VideoLLMs,以及至今仍是当前流水线组件的早期帧采样和视觉编码器机制。我们在可用的情况下,整理了文献中报道的在相同主机模型和输入协议下的准确率-成本比较,并将它们与跨论文的异构证据区分开来,同时指出了在视听效率和标准化评估方面的差距。我们维护了一个资源库:https://github.com/momentslab/awesome-efficient-videollm。
查看arXiv页面 (https://arxiv.org/abs/2609.10355) 查看PDF (https://arxiv.org/pdf/2609.10355) 项目主页 (https://www.killian-steunou.com/videollm-survey/) GitHub (https://github.com/momentslab/awesome-efficient-videollm) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.10355)
在您的代理中获取此论文:
hf papers read 2609.10355
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型链接此论文 在模型的README.md中引用 arxiv.org/abs/2609.10355 以从本页链接。
引用本文的数据集 0
无数据集链接此论文 在数据集的README.md中引用 arxiv.org/abs/2609.10355 以从本页链接。
引用本文的空间 0
无空间链接此论文 在空间的README.md中引用 arxiv.org/abs/2609.10355 以从本页链接。
包含本文的收藏 0
无收藏包含此论文 将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
选择、压缩、再投资:长视频多模态语言模型中视觉令牌分配的控制性研究
本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。
VideoMM:用于高效视频MLLMs的自适应宏微观推理
VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。
LiteFrame 扩展视频大语言模型效率(6分钟阅读)
LiteFrame 为视频大语言模型引入了一种高效的视频编码器,采用压缩令牌蒸馏技术,在保持准确率的同时,能够处理多达8倍的帧数并降低35%的延迟,为长视频理解开创了新的帕累托前沿。
LLaVA-UHD v4:高效视觉编码在 MLLMs 中的关键要素是什么?
本文介绍了 LLaVA-UHD v4,该模型通过采用基于切片(slice-based)的编码和 ViT 内部早期压缩,提高了多模态大语言模型中的视觉编码效率。它在保持或提升高分辨率图像任务性能的同时,将计算成本降低了 55% 以上。
LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放
LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。