OmniPack:面向高效全模态大语言模型的统一令牌压缩

Hugging Face Daily Papers 论文

摘要

OmniPack提出了一种无需训练的全模态大语言模型令牌压缩框架,将LLM前结构化压缩与LLM内任务相关语义精炼相结合,在多个基准上实现了优异的性能-效率权衡。

全模态大语言模型(Omni-LLMs)在音视频理解任务上取得了显著性能,但处理长且高度冗余的视觉和音频令牌序列会产生大量计算开销,需要积极的令牌压缩以实现高效部署。现有方法在低令牌预算下往往性能下降:LLM前压缩可能丢弃结构重要且全局分布的证据,而LLM内压缩常常未能充分利用查询条件化的音视频协作。为解决这些局限,我们提出OmniPack,一个无需训练的框架,在LLM之前协调结构压缩,并在LLM内部进行任务相关语义精炼。在LLM之前,OmniPack通过模态特定重要性、全局覆盖和相似性感知合并去除结构冗余。在充分的多模态交互后,它通过文本引导和音视频协作进一步整合多样化、任务相关的表示。在三个Omni-LLM骨干网络上的五个基准上进行的大量实验表明,OmniPack在不同保留比率下始终取得最佳性能-效率权衡,优于所有现有方法。值得注意的是,在Qwen2.5-Omni-7B上,OmniPack保留了98.0%的原始性能,同时将FLOPs降至16.7%,并且仅用原始FLOPs的6.8%仍能保持92.9%的原始性能。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

来源:https://huggingface.co/papers/2608.03812 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

全模态大语言模型(Omni-LLMs)在音视频理解任务上取得了显著性能,但处理冗长且高度冗余的视觉和音频 token 序列会带来大量计算开销,因此需要激进的 token 压缩以实现高效部署。现有方法在低 token 预算下往往性能下降:LLM 前的压缩可能丢弃结构重要且全局分布的证据,而 LLM 内的压缩则往往未能充分利用查询条件下的音视频协作。为解决这些局限,我们提出 OmniPack,一个免训练框架,将 LLM 前的结构压缩与 LLM 内的任务相关语义细化相协调。在 LLM 之前,OmniPack 通过模态特定重要性、全局覆盖和相似性感知合并来移除结构冗余。在充分的多模态交互之后,它通过文本指导和音视频协作进一步整合多样化的任务相关表示。在五个基准测试和三个 Omni-LLM 主干上的大量实验表明,OmniPack 在不同保留比率下始终实现最佳性能-效率权衡,优于所有现有方法。值得注意的是,在 Qwen2.5-Omni-7B 上,OmniPack 保留了原始性能的 98.0%,同时将 FLOPs 降至 16.7%,并且仅用原始 FLOPs 的 6.8% 仍保持原始性能的 92.9%。

查看 arXiv 页面 (https://arxiv.org/abs/2608.03812)
查看 PDF (https://arxiv.org/pdf/2608.03812)
GitHub1 (https://github.com/RowanSu/OmniPack)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03812)

在您的 agent 中获取此论文:

hf papers read 2608\.03812

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型

0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.03812 即可从本页链接到该模型。

引用此论文的数据集

0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.03812 即可从本页链接到该数据集。

引用此论文的 Spaces

0

没有 Space 链接此论文

在 Space README.md 中引用

相似文章

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。

OmniDelta: 面向OmniLLM令牌压缩的技能驱动预算分配

Hugging Face Daily Papers

OmniDelta提出了一种无需训练、技能驱动的框架,用于在OmniLLM的音频和视频模态间分配令牌预算,在保留25%令牌时实现了GPU内存减少22%和1.64倍加速,改善了精度-效率权衡。