OmniDelta: 面向OmniLLM令牌压缩的技能驱动预算分配

Hugging Face Daily Papers 论文

摘要

OmniDelta提出了一种无需训练、技能驱动的框架,用于在OmniLLM的音频和视频模态间分配令牌预算,在保留25%令牌时实现了GPU内存减少22%和1.64倍加速,改善了精度-效率权衡。

新兴的全模态大语言模型(OmniLLMs)能够统一理解文本、音频和视频,但其长的音视频令牌序列带来了显著的内存和推理成本。现有的压缩方法主要关注在固定预算下选择重要令牌,而忽略了前面的预算分配问题。我们表明,直接查询与音频/视频的相似度对于模态间预算分配并不可靠,且统一的模态内预算可能会在保留冗余内容的同时遗漏关键证据。为了解决这些限制,我们提出OmniDelta,一种无需训练、技能驱动的框架,将意图感知的模态间分配与内容感知的模态内分配相结合。OmniDelta首先构建音频和视频技能池,根据查询需求调整固定的保留令牌预算,然后利用局部复杂性和时间冗余在音频片段和视频帧上重新分配模态预算。得到的局部预算可以与现有的剪枝策略结合,在保留总保留令牌比例的同时改变预算的分配位置。在四个音视频基准测试中,使用两个Qwen2.5-Omni模型进行的实验表明,OmniDelta在不同剪枝比例下建立了新的精度-效率帕累托前沿。在Qwen2.5-Omni-7B上保留25%令牌时,OmniDelta将GPU内存减少了22.0%,并实现了相较于全令牌推理1.64倍的端到端加速。
查看原文
查看缓存全文

缓存时间: 2026/07/29 03:50

论文页面 - OmniDelta:面向全模态大语言模型令牌压缩的技能驱动预算分配

来源:https://huggingface.co/papers/2607.25669 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

新兴的全模态大语言模型(OmniLLMs)能够统一理解文本、音频和视频,但其长音频-视频令牌序列带来了显著的内存和推理成本。现有压缩方法主要关注在固定预算下选择重要令牌,而未充分探索前置的预算分配问题。我们表明,直接查询与音频/视频的相似度在跨模态预算分配中不可靠,而均匀的模态内预算可能会遗漏关键证据,同时保留冗余内容。为解决这些局限性,我们提出 OmniDelta,一种无需训练、技能驱动的框架,它将意图感知的跨模态分配与内容感知的模态内分配相结合。OmniDelta 首先构建音频和视频技能池,根据查询需求转移固定的保留令牌预算,然后利用局部复杂度和时间冗余性,在音频片段和视频帧上重新分配模态预算。产生的局部预算可以与现有的剪枝策略结合,在保持总保留令牌比率不变的同时,改变预算的分配位置。在四个音频-视频基准测试上使用两个 Qwen2.5-Omni 模型进行的实验表明,OmniDelta 在各种剪枝比率下建立了新的精度-效率帕累托前沿。在 Qwen2.5-Omni-7B 上保留 25% 令牌时,OmniDelta 将 GPU 内存减少 22.0%,并实现相比全令牌推理 1.64 倍的端到端加速。

查看 arXiv 页面 (https://arxiv.org/abs/2607.25669)查看 PDF (https://arxiv.org/pdf/2607.25669)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25669)

在你的智能体中获取此论文:

hf papers read 2607\.25669

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.25669 可从此页链接。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.25669 可从此页链接。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.25669 可从此页链接。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 可从此页链接。

相似文章

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。

面向高效全模态LLM的阶段自适应Token选择方法

Hugging Face Daily Papers

SEATS是一种无需训练的阶段自适应Token选择方法,通过逐步剪枝冗余的视觉和音频Token来降低全模态LLM的计算开销,实现了9.3倍FLOPs减少和4.8倍预填充加速,同时保持96.3%的性能。