LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放

Hugging Face Daily Papers 论文

摘要

LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。

将视频大语言模型(Video LLMs)扩展到长视频的核心挑战在于管理视觉令牌上下文长度的爆炸式增长。现有策略主要侧重于“事后”(post-hoc)令牌缩减——在特征提取后减少视觉令牌以减轻LLM的计算负担。尽管这些方法有效减少了视觉令牌的数量,但我们观察到,主要延迟瓶颈从LLM转移到了视觉编码器昂贵的逐帧处理上。为了解决这一问题,我们提出了LiteFrame,一个强大且高效的视频编码器骨干网络,用于视频大语言模型。为了训练LiteFrame,我们提出了压缩令牌蒸馏(Compressed Token Distillation, CTD),一种新颖的训练框架,它教一个紧凑的学生视觉编码器直接预测由大型教师视觉模型生成的信息密集、时空压缩的表示,从而有效绕过冗余计算。当与进一步的语言模型适配(Language Model Adaptation, LMA)相结合时,这种方法形成了新的延迟-准确率帕累托前沿——与InternVL3-8B相比,LiteFrame在减少35%端到端延迟的同时处理8倍帧数,并在多个基准上提高了平均视频理解准确率。我们的结果表明,在固定计算预算下,解锁更长视频理解的一条新潜在路径。
查看原文
查看缓存全文

缓存时间: 2026/05/19 06:31

论文页面 - LiteFrame: 高效视觉编码器解锁视频大语言模型的帧扩展

来源:https://huggingface.co/papers/2605.17260

摘要

LiteFrame 是一种轻量级视频编码器,配合压缩令牌蒸馏训练方法,可降低延迟并增加视频大语言模型在处理长视频时的帧处理能力,同时保持准确率。

将视频大语言模型(Video LLMs)扩展到长视频的根本挑战在于管理视觉令牌上下文长度的激增。现有策略主要聚焦于“事后”令牌缩减——即在特征提取后减少视觉令牌,以减轻大语言模型的计算开销。虽然这些方法有效减少了视觉令牌数量,但我们观察到,主要的延迟瓶颈随后从大语言模型转移到了视觉编码器昂贵的逐帧处理上。为此,我们引入了 LiteFrame,一种强大且高效的视频编码器骨干网络。为了训练 LiteFrame,我们提出了压缩令牌蒸馏(CTD),这是一种新颖的训练框架,它教会一个紧凑的学生视觉编码器直接预测由大型教师视觉模型生成的、信息密集且经过时空压缩的表征,从而有效绕过了冗余计算。当进一步结合语言模型适配(LMA)时,该方法产生了新的延迟-准确率帕累托前沿——与 InternVL3-8B 相比,LiteFrame 在端到端延迟降低35%的同时,处理帧数增加了8倍,并在多个基准测试上提升了平均视频理解准确率。我们的结果展示了在固定计算预算下解锁更长视频理解的新潜在路径。

查看 arXiv 页面 (https://arxiv.org/abs/2605.17260)查看 PDF (https://arxiv.org/pdf/2605.17260)项目页面 (https://jjihwan.github.io/projects/LiteFrame/)GitHub1 (https://github.com/jjihwan/LiteFrame)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.17260)

在您的 agent 中获取此论文:

hf papers read 2605.17260

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.17260 以从此页面链接。

引用本论文的数据集0

无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.17260 以从此页面链接。

引用本论文的 Space0

无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.17260 以从此页面链接。

包含本论文的收藏0

无收藏包含此论文

请将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

LiteFrame 扩展视频大语言模型效率(6分钟阅读)

TLDR AI

LiteFrame 为视频大语言模型引入了一种高效的视频编码器,采用压缩令牌蒸馏技术,在保持准确率的同时,能够处理多达8倍的帧数并降低35%的延迟,为长视频理解开创了新的帕累托前沿。

AdaCodec:面向视频多模态大模型的预测性视觉编码

Hugging Face Daily Papers

AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。