选择、压缩、再投资:长视频多模态语言模型中视觉令牌分配的控制性研究

Hugging Face Daily Papers 论文

摘要

本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。

长视频语言模型无法查看每一帧:一小时以每秒采样一次是3,600张图像,系统只保留其中一小部分固定切片。哪些帧能进入这个切片通常被视为预处理细节;我们测试这是否应该如此。已发布的选择器使比较变得困难,因为它们同时改变帧评分器、提示边界、分辨率策略和回答模型。我们固定每个因素,一次改变一个决策:选择、空间压缩和节省的重新分配,跨六种无训练选择规则、三个长视频基准测试和两个回答模型。选择是最大的单一杠杆:在LongVideoBench的一小时数据集上,八帧查询选择比十六帧均匀间隔高出6.9分,而Orthogonal Matching Pursuit,一种未修改的几十年前的稀疏近似算法,在所有三个基准测试中匹配或接近每个专门构建的选择器。压缩几乎是免费的:在固定时间戳上减半每个帧的空间预算最多损失0.44分。重新分配是预算转化为准确性的地方:将释放的令牌用于两倍的压缩帧,测量成本不高于原始八帧,额外返回两到三分;压缩只有在节省的令牌以这种方式花费时才有效。在此过程中,我们自身AKS基线中的一个实现错误,以及两个框架在相同预算下运行相同已发布规则时产生的0.07到3.74分差距,显示了为什么这些比较需要在同一个控制框架内进行,而不是跨论文。
查看原文
查看缓存全文

缓存时间: 2026/09/04 11:57

论文页面 - 选择、压缩、再投资:长视频多模态大语言模型中视觉Token分配的控制研究

来源:https://huggingface.co/papers/2609.03820

摘要

帧选择在长视频语言模型中主导着准确性,而空间压缩几乎是无代价的,只要节省下来的资源能被重新投入到更多帧的分析中。同时,我们需要一个统一的评估框架来公平地比较不同的帧选择策略。

长视频语言模型(https://huggingface.co/papers?q=Long-video%20language%20models)无法查看每一帧画面:以每秒一帧的速率采样,一个小时的视频就会产生3,600张图像,而系统通常只保留其中一小部分固定数量的帧。哪些帧能被保留下来,通常被视为一个预处理细节;我们研究了这是否应该被重视。已发表的选择器使得比较变得困难,因为它们同时改变了帧评分器、提示边界、分辨率策略和回答模型。我们固定其他所有因素,一次只改变一个决策变量:选择策略、空间压缩(https://huggingface.co/papers?q=spatial%20compression)以及节省资源的再投资。我们在六种无需训练的选择规则、三个长视频基准测试和两个回答模型上进行了实验。选择策略是最大的单一影响因素:在LongVideoBench的一小时视频子集上,8个通过查询选择的帧比16个均匀采样的帧高出6.9分,而正交匹配追踪(Orthogonal Matching Pursuit)(https://huggingface.co/papers?q=Orthogonal%20Matching%20Pursuit)——一个未经修改的、已有数十年历史的稀疏近似算法——在所有三个基准测试中,其表现达到或接近我们与之比较的每一个专用选择器的水平。压缩几乎是无代价的:在固定时间戳将每帧的空间预算减半,最多只会带来0.44分的损失。再投资是将节省的资源转化为准确性的关键:将释放出的Token用于分析两倍数量的压缩帧,经测量其代价不高于原始的8帧分析,还能额外带来2到3分的提升;只有将节省的资源以这种方式重新投入,压缩才会真正产生回报。在这个过程中,我们自己的AKS基线实现中存在的一个bug,以及两个使用相同已发表规则和预算的评估框架之间0.07到3.74分的差距,都说明了为什么这些比较需要在同一个控制框架内进行,而不是跨论文进行。

查看arXiv页面 (https://arxiv.org/abs/2609.03820)查看PDF (https://arxiv.org/pdf/2609.03820)GitHub (https://github.com/codeprakhar25/omp-keyframe-sampling)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.03820)

在你的Agent中获取这篇论文:

hf papers read 2609\.03820

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无模型链接到此论文

在模型的README.md中引用 arxiv.org/abs/2609.03820 即可从本页链接。

引用此论文的数据集 0

暂无数据集链接到此论文

在数据集的README.md中引用 arxiv.org/abs/2609.03820 即可从本页链接。

引用此论文的Spaces 0

暂无Space链接到此论文

在Space的README.md中引用 arxiv.org/abs/2609.03820 即可从本页链接。

包含此论文的收藏夹 1

相似文章

AdaCodec:面向视频多模态大模型的预测性视觉编码

Hugging Face Daily Papers

AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。

LLaVA-UHD v4:高效视觉编码在 MLLMs 中的关键要素是什么?

Hugging Face Daily Papers

本文介绍了 LLaVA-UHD v4,该模型通过采用基于切片(slice-based)的编码和 ViT 内部早期压缩,提高了多模态大语言模型中的视觉编码效率。它在保持或提升高分辨率图像任务性能的同时,将计算成本降低了 55% 以上。

Mage-VL:一种高效的编解码原生流式多模态基础模型

Hugging Face Daily Papers

Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。

LiteFrame 扩展视频大语言模型效率(6分钟阅读)

TLDR AI

LiteFrame 为视频大语言模型引入了一种高效的视频编码器,采用压缩令牌蒸馏技术,在保持准确率的同时,能够处理多达8倍的帧数并降低35%的延迟,为长视频理解开创了新的帕累托前沿。