EarlyTom:早期Token压缩实现快速视频理解

Hugging Face Daily Papers 论文

摘要

EarlyTom是一个无需训练即可在视觉编码器早期压缩视觉token的框架,可减少首个token生成时间和计算成本,同时保持准确性,实现高达2.65倍的TTFT降低。

视频大语言模型(Video-LLMs)在视频理解任务中展现了强大的能力。然而,其实际部署仍受限于处理大量视觉token所带来的低效问题。尽管近期的方法能在保持与全token基线相当准确性的同时实现极低的token保留率,但大多仅在预填充的后期阶段进行压缩,视觉编码器的效率仍未得到优化。本文首先证明视觉编码对首个token生成时间(TTFT)贡献显著。因此,仅在视觉编码器之后进行token压缩仍留有大量探索空间。基于这一洞察,我们提出EarlyTom,一个无需训练的token压缩框架,在视觉编码器内部执行早期视觉token压缩,从而显著降低TTFT并提高吞吐量。此外,我们引入了一种解耦的空间token选择策略,提升了整体压缩效果。在单个NVIDIA A100 GPU上,EarlyTom使LLaVA-OneVision-7B模型实现了高达2.65倍的TTFT降低和最高61%的FLOPs削减,同时保持与全token基线相当的准确性。这些改进显著增强了Video-LLMs在实际生产场景中的部署实用性。
查看原文
查看缓存全文

缓存时间: 2026/05/29 15:02

论文页面 - EarlyTom:早期令牌压缩实现快速视频理解

来源:https://huggingface.co/papers/2605.30010

摘要

EarlyTom 是一个无需训练的框架,在视觉编码器早期阶段压缩视觉令牌,从而减少首令牌生成时间并降低计算成本,同时保持模型准确率。

视频大语言模型(Video-LLMs)在视频理解任务中展现出强大能力。然而,其实际部署仍受到处理大量视觉令牌带来的低效问题困扰。尽管近期方法在保持与全令牌基线相当准确率的同时实现了极低的令牌保留率,但大多数方法仅在预填充的后期阶段进行压缩,导致视觉编码器的效率未能得到优化。本文首先证明视觉编码贡献了首令牌生成时间(TTFT)的很大一部分。因此,相较于仅在视觉编码器之后压缩视觉令牌,在编码器内部进行压缩仍有大量探索空间。基于这一洞察,我们提出 EarlyTom,一个无需训练的令牌压缩框架,在视觉编码器内部执行早期视觉令牌压缩,从而显著降低 TTFT 并提高吞吐量。此外,我们引入了一种解耦的空间令牌选择策略,提升了整体压缩效果。在单个 NVIDIA A100 GPU 上,EarlyTom 对 LLaVA-OneVision-7B 模型将 TTFT 降低高达 2.65 倍,FLOPs 降低高达 61%,同时保持与全令牌基线相当的准确率。这些改进极大增强了 Video-LLMs 在真实生产场景中的部署实用性。

查看 arXiv 页面 (https://arxiv.org/abs/2605.30010) 查看 PDF (https://arxiv.org/pdf/2605.30010) 项目页面 (https://viridisgreen.github.io/EarlyTom/) GitHub14 (https://github.com/viridisGreen/EarlyTom) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2605.30010)

在您的 agent 中获取此论文:

hf papers read 2605.30010

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2605.30010 以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.30010 以从此页面链接。

引用此论文的 Spaces0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2605.30010 以从此页面链接。

包含此论文的合集0

没有合集包含此论文

将论文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

基于时间冗余掩蔽和潜在修补的自适应令牌化 [R]

Reddit r/MachineLearning

本文提出了一种自适应视频令牌化方法,利用潜在空间中的时间冗余动态分配令牌,实现高效压缩,无需辅助网络。所提出的潜在修补变压器(Latent Inpainting Transformer)重建被丢弃的位置,相比ElasticTok-CV实现31倍加速,相比InfoTok实现2倍加速。

LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放

Hugging Face Daily Papers

LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。