OmniScope:全模态大语言模型的模态解耦令牌压缩
摘要
OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。
查看缓存全文
缓存时间: 2026/07/31 21:56
论文页面 - OmniScope:面向全模态大语言模型的模态解耦Token压缩
来源:https://huggingface.co/papers/2607.23193
摘要
现有的用于全模态大语言模型的token压缩方法通常依赖单一模态来决定其他模态中应保留的内容。我们表明这一假设常常不成立:对于同一查询,音频和视频的相关性往往在不同时刻达到峰值。这种跨模态显著性不匹配使得单向引导在激进压缩下容易丢弃包含答案关键线索的内容。我们提出OmniScope,一个无需训练的训练免费token压缩框架,它使用查询作为共享语义锚点,同时分别估计音频和视频的相关性。OmniScope分配各模态专属的token预算,使用锚点增量策略修剪视觉token,以同时保留全局上下文和时间变化信息,并按秒合并音频token以减少冗余同时保持时间连续性。在四个音视频基准测试和两个Qwen2.5-Omni模型规模下,OmniScope在所有压缩设置中均实现了最佳平均准确率。在整体token保留率为25%时,它实现了高达3.53倍的预填充加速和超过15%的GPU显存减少,平均准确率仅下降0.35个百分点。这些结果表明了OmniLLM推理的一个简单设计原则:跨模态共享查询,但不共享显著性估计。代码可在https://github.com/MAC-AutoML/OmniScope获取。
查看arXiv页面 (https://arxiv.org/abs/2607.23193)查看PDF (https://arxiv.org/pdf/2607.23193)GitHub3 (https://github.com/MAC-AutoML/OmniScope)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.23193)
在你的agent中获取这篇论文:
hf papers read 2607\.23193
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型README.md中引用arxiv.org/abs/2607.23193即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接到此论文
在数据集README.md中引用arxiv.org/abs/2607.23193即可从此页面链接到该数据集。
引用此论文的Spaces0
没有Space链接到此论文
在Space README.md中引用arxiv.org/abs/2607.23193即可从此页面链接到该Space。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)即可从此页面链接到该收藏。
相似文章
OmniFocus: 查询引导的模态平衡令牌压缩方法用于全模态大语言模型
OmniFocus 是一种无需训练、查询引导的令牌压缩方法,用于全模态大语言模型,它独立估计视频和音频的重要性,以保留模态特定的证据同时保持对齐,在低令牌保留比率下实现了显著的推理加速,同时精度损失极小。
OmniPack:面向高效全模态大语言模型的统一令牌压缩
OmniPack提出了一种无需训练的全模态大语言模型令牌压缩框架,将LLM前结构化压缩与LLM内任务相关语义精炼相结合,在多个基准上实现了优异的性能-效率权衡。
AVOC: 通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解
AVOC 提出了一种针对全模态大语言模型的检索启发的令牌压缩方法,通过基于相关性、重要性和多样性选择信息丰富的令牌,有效处理长达一小时的音视频输入。该框架在长时音视频理解基准测试中取得了最先进的结果,大幅超越了先前的方法。
OmniDelta: 面向OmniLLM令牌压缩的技能驱动预算分配
OmniDelta提出了一种无需训练、技能驱动的框架,用于在OmniLLM的音频和视频模态间分配令牌预算,在保留25%令牌时实现了GPU内存减少22%和1.64倍加速,改善了精度-效率权衡。
OmniMem: 面向流式音视频大模型的扰动感知记忆压缩
OmniMem 引入了一种面向流式音视频大模型的模态感知记忆分配与扰动感知选择策略,在长视频基准测试上相比压缩基线实现了2-4%的绝对准确率提升。