为什么视频处理仍然如此昂贵?视频和视听大语言模型推理效率机制综述

Hugging Face Daily Papers 论文

摘要

本综述研究了视频大语言模型的推理效率技术,分析了在帧采样、编码、令牌压缩和语言模型阶段的成本降低,同时识别了评估缺口。

视频理解已迅速发展至视频大语言模型(VideoLLMs):这些系统将视频表示与预训练的大语言模型相结合,并根据文本提示进行生成。它们在字幕、问答、检索和时间定位方面的强大性能以计算和内存成本为代价,且该成本随帧数和上下文长度的增加而增长,限制了在实时、移动和资源受限环境中的部署。本综述涵盖了针对视觉和视听VideoLLMs的推理效率机制,这些机制报告了参数数量、每个输入的FLOPs、延迟、内存或视觉和音频令牌数量的具体减少。我们分析了帧采样、模态编码、连接器级令牌缩减和LLM预填充及解码过程中的瓶颈。我们按作用的处理阶段组织方法,涵盖了自2022年末以来开发的VideoLLMs以及仍作为当前流水线组成部分的早期帧采样和视觉编码器机制。我们汇编了文献报告的在共享主机模型和输入协议下的准确率-成本比较(如可用),区分它们来自异构跨论文证据,并识别了视听效率和标准化评估中的差距。我们维护一个仓库,地址为 https://github.com/momentslab/awesome-efficient-videollm。
查看原文
查看缓存全文

缓存时间: 2026/09/10 10:10

论文页 - 为何视频仍然如此昂贵?视频与视听大语言模型推理效率机制综述

来源:https://huggingface.co/papers/2609.10355

摘要

本综述研究了视频大语言模型的推理效率技术,分析了从帧采样、编码、令牌压缩到语言模型阶段的成本降低效果,并指出了评估方面的不足。

视频理解领域正迅速向视频大语言模型(VideoLLMs)演进:这类系统将视频表示与预训练大语言模型相结合,并根据文本提示进行生成。它们在图像描述、问答、检索和时序定位方面的强大性能,伴随着计算和内存成本随帧数和上下文长度增长而增加,限制了其在实时、移动和资源受限场景中的部署。本综述涵盖了视觉及视听VideoLLMs报告了具体参数量、每个输入FLOPs、延迟、内存或视觉与音频令牌数量降低的推理效率机制。我们分析了贯穿帧采样、模态编码、连接器级令牌缩减以及LLM预填充与解码各环节的瓶颈。我们按这些机制作用的流水线阶段组织方法,涵盖了自2022年末以来开发的VideoLLMs,以及至今仍是当前流水线组件的早期帧采样和视觉编码器机制。我们在可用的情况下,整理了文献中报道的在相同主机模型和输入协议下的准确率-成本比较,并将它们与跨论文的异构证据区分开来,同时指出了在视听效率和标准化评估方面的差距。我们维护了一个资源库:https://github.com/momentslab/awesome-efficient-videollm。

查看arXiv页面 (https://arxiv.org/abs/2609.10355) 查看PDF (https://arxiv.org/pdf/2609.10355) 项目主页 (https://www.killian-steunou.com/videollm-survey/) GitHub (https://github.com/momentslab/awesome-efficient-videollm) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.10355)

在您的代理中获取此论文:

hf papers read 2609.10355

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型链接此论文 在模型的README.md中引用 arxiv.org/abs/2609.10355 以从本页链接。

引用本文的数据集 0

无数据集链接此论文 在数据集的README.md中引用 arxiv.org/abs/2609.10355 以从本页链接。

引用本文的空间 0

无空间链接此论文 在空间的README.md中引用 arxiv.org/abs/2609.10355 以从本页链接。

包含本文的收藏 0

无收藏包含此论文 将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

LiteFrame 扩展视频大语言模型效率(6分钟阅读)

TLDR AI

LiteFrame 为视频大语言模型引入了一种高效的视频编码器,采用压缩令牌蒸馏技术,在保持准确率的同时,能够处理多达8倍的帧数并降低35%的延迟,为长视频理解开创了新的帕累托前沿。

LLaVA-UHD v4:高效视觉编码在 MLLMs 中的关键要素是什么?

Hugging Face Daily Papers

本文介绍了 LLaVA-UHD v4,该模型通过采用基于切片(slice-based)的编码和 ViT 内部早期压缩,提高了多模态大语言模型中的视觉编码效率。它在保持或提升高分辨率图像任务性能的同时,将计算成本降低了 55% 以上。

LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放

Hugging Face Daily Papers

LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。