位置即是一切:基于MLLM的指代表达分割的免费午餐令牌压缩策略
摘要
本文介绍了PAYN,一种即插即用的令牌压缩方法,专为基于MLLM的指代表达分割设计,仅依赖位置信息,通过保持空间关系一致性,性能超越现有技术。
arXiv:2608.26142v1 公告类型:新
摘要:指代表达分割(RES)旨在从复杂和隐含的文本查询中生成像素级的分割掩膜。虽然多模态大语言模型(MLLMs)的最新进展显著提升了RES性能,但其高昂的计算开销仍然是一个关键瓶颈,然而这很少被探索。为填补这一空白,我们首先在该任务上评估了典型的令牌压缩方法,并观察到性能意外下降。在本文中,我们旨在理解这一现象并寻找解决方案。通过大量实验,我们发现RES的令牌压缩需要保留原始位置嵌入和局部邻近空间结构,这表明视觉令牌位置信息比其他任务更为关键。基于此洞察,我们提出:能否仅基于位置信息设计令牌压缩方法?因此,我们提出了PAYN,一种即插即用、无需训练的令牌压缩方法,仅依赖位置信息。PAYN在每个局部邻近区域保留充分分布的令牌,同时严格保留原始位置索引,从而保持空间关系一致性。在多个RES基准上的实验表明,我们的方法优于现有的令牌压缩方法,验证了在基于MLLM的RES任务中,位置确实是令牌压缩所需的一切。代码可在 https://github.com/YuhanLiu231/PAYN 获取。
查看缓存全文
缓存时间: 2026/08/28 09:20
# 一种基于多模态大语言模型的指代表达分割免费午餐Token压缩策略
来源:https://arxiv.org/html/2608.26142
###### 摘要
指代表达分割(RES)旨在根据复杂且隐式的文本查询生成像素级的分割掩码。虽然多模态大语言模型(MLLMs)的最新进展显著提升了RES性能,但其高昂的计算开销仍是关键瓶颈,而这方面却鲜有研究。为填补这一空白,我们首先在该任务上评估了典型的Token压缩方法,并观察到性能显著下降的现象。本文旨在理解此现象并寻求解决方案。通过大量实验,我们发现RES的Token压缩需要保留原始位置嵌入和局部邻域空间结构,表明视觉Token的位置信息比其他任务更为关键。基于此见解,我们提出:能否纯粹基于位置信息来设计Token压缩方法?因此,我们提出了PAYN,一种即插即用、无需训练且完全依赖位置信息的Token压缩方法。PAYN通过严格保留原始位置索引,同时确保每个局部邻域内保留分布均匀的Token,从而维持空间关系一致性。在多个RES基准上的实验表明,我们的方法优于现有Token压缩方法,验证了在基于MLLM的RES任务中,位置信息确实是Token压缩所需的一切。代码已开源:https://github.com/YuhanLiu231/PAYN。
机器学习,ICML
参见图1
图1:(a)指代表达分割(RES)任务。(b)虽然代表性的Token压缩方法在常规视觉-语言任务上能保留90%以上的原始性能,但在RES任务上性能严重下降,仅保留约20%左右。本文旨在理解并解决此问题。(c)我们方法与竞争方法的保留Token及分割结果可视化。我们仅依赖位置信息的免费午餐方法实现了优越性能。
## 1 引言
指代表达分割(RES)任务旨在根据复杂或隐式的文本描述预测像素级分割掩码(Hu等,2016;Ding等,2025)。如图1(a)所示,不同于使用“狗”等类别的传统分割,RES允许使用“坐在长椅上的狗”这类自由形式的表达式来描述对象,提供了灵活且用户友好的分割方式。为应对这一挑战性任务,当前工作(Wang等,2023;Lai等,2024;Xia等,2024;Pi等,2024;Ren等,2024;Rasheed等,2024;Lan等,2025;Wei等,2025)利用多模态大语言模型(MLLMs)(Bai等,2023;Liu等,2024;Lu等,2024;Chen等,2024c)理解复杂文本和视觉输入,专注于设计有效的多模态表征格式进行分割解码。然而,由于注意力计算随输入序列长度呈二次方增长,MLLMs面临高推理成本(Chen等,2024a;Lin等,2025;Yang等,2025b),这限制了RES的实际部署。据我们所知,鲜有研究针对基于MLLM的RES任务进行加速。为填补这一探索不足的领域,我们从Token压缩方法入手,这是一种广泛采用的加速策略(Liang等,2022;Bolya等,2023),通常通过移除或合并大量冗余视觉Token来降低推理成本(Wang等,2025;Yang等,2025a;Chen等,2026;Zhang等,2026;Tong等,2026)。然而,将当前主流的Token压缩方法应用于基于MLLM的RES模型时,我们惊讶地发现这些方法导致了严重的性能下降,如图1(b)所示。当保留相同比例的视觉Token时,这些方法在常规视觉-语言任务上能保持90%以上的原始性能,但在RES任务上几乎只能保持约20%的原始性能,导致Token压缩后结果几乎崩溃。本文旨在理解此问题为何发生,并基于此解释专门设计基于MLLM的RES任务的Token压缩方法。
我们首先详细评估了当前Token压缩方法在RES任务上的表现。通过(粗略)将现有方法分为基于注意力/相似度的方法(Bolya等,2023;Yang等,2025b;Shang等,2025)和基于多样性/差异性的方法(Wen等,2025;Alvarez等,2025;Zhang等,2025a),我们发现基于多样性的方法表现更好,其核心原因是保留了原始位置嵌入(这在基于多样性的方法中被广泛采用)。为进一步理解为何位置嵌入在RES任务中比其他任务更重要,通过大量实验,我们发现这是因为RES任务需要精确预测每个视觉Token的标签,而其他任务通常仅需理解视觉Token的语义部分,这使得局部邻域位置的微小扰动(如不保留原始位置嵌入)对RES任务的影响远大于其他任务。这引出了我们关于基于MLLM的RES任务Token压缩方法的见解:视觉Token的位置信息远比其他任务重要。
基于此见解,既然位置信息如此重要,我们能否纯粹基于位置信息来设计Token压缩方法?因此,我们提出了PAYN,一种即插即用、无需训练且完全依赖位置信息(不考虑任何语义内容)的Token压缩方法,有效充当了免费午餐方案,如图1(c)所示。具体来说,我们的方法严格保留原始位置索引,同时旨在保留空间均匀分布的Token,从而充分保留局部邻域空间结构。我们提供了该方法的两种实例化:棋盘式空间采样和最远点采样。在多个RES基准上的大量实验表明,我们的方法优于现有的最先进Token剪枝方法,验证了在基于MLLM的RES任务中,位置信息是Token压缩所需的一切。
总结来说,我们的主要贡献如下:
- •我们发现现有Token压缩方法在基于MLLM的RES任务上出现严重性能下降,而这一领域尚未被充分探索。
- •通过实验和分析,我们观察到视觉Token的位置信息在RES任务中比在其他任务中扮演着更关键的角色。
- •基于此观察,我们提出了PAYN,一种简单但有效的免费午餐Token压缩方法,仅依赖位置信息。
- •大量实验表明,我们的方法优于现有的最先进Token剪枝方法,验证了在基于MLLM的RES任务中,位置信息是Token压缩所需的一切。
## 2 相关工作
### 2.1 基于MLLM的指代表达分割
指代表达分割(RES)旨在基于自然语言指代表达分割图像中目标对象的像素(Lai等,2024;Zhang等,2024;Chen等,2024b;Wu等,2024;Qian等,2025;Zhu等,2025a;Liu等,2026)。随着多模态大语言模型(MLLMs)(Liu等,2024)和强大分割模型如SAM(Kirillov等,2023)的快速发展,RES取得了显著进展。LISA(Lai等,2024)开创了嵌入即掩码范式,通过用特殊`<seg>`标记扩展MLLM词汇表来指导分割解码器。遵循这一范式,后续几项工作从不同角度扩展了基于MLLM的RES。GSVA(Xia等,2024)使用多个`<seg>`标记以及`<refuse>`标记来处理多个对象并拒绝空目标。PixelLM(Ren等,2024)用轻量级像素解码器替代SAM,并引入可学习的分割码本生成掩码。InstructSeg(Wei等,2025)提供了跨图像和视频执行语言指令分割的统一框架。与这些嵌入即掩码方法相比,Text4Seg(Lan等,2025)提出了一种文本即掩码范式,通过将图像编码为语义文本描述符序列,将图像分割重新定义为文本生成问题。另一类工作(Wang等,2023;Peng等,2024)利用MLLMs生成用于掩码预测的多边形坐标,但往往难以达到满意的性能。
### 2.2 视觉Token压缩
在MLLMs中,视觉信号比文本表现出更高的空间冗余性,这促使视觉Token压缩以提高效率。从优化需求的角度看,一些方法需要微调模型(Cai等,2025;Ye等,2025b),一些使用校准数据集确定剪枝策略(Lin等,2025;Ye等,2025a),而另一些则以无需训练的方式进行(Yang等,2025b;Zhang等,2025b)。从压缩机制的角度看,现有方法大致可分为基于相似度的方法(如ToMe)、基于多样性/差异性的方法(如Dart、DivPrune)和基于注意力的方法(如VisionZip、PruMerge、Vispruner)。基于相似度的方法将高度相似的Token合并为更少的代表性Token,例如ToMe使用二分图匹配实现。基于多样性的方法也利用Token相似性,但旨在保留彼此差异最大的Token。例如,DivPrune将Token压缩表述为最大-最小多样性问题,选择内部差异最大的Token子集。基于注意力的方法保留高注意力Token,同时剪枝低注意力Token,并可与基于相似度或多样性的方法结合。虽然这些方法在稀疏预测任务上表现良好,但对于RES等密集预测任务的视觉Token压缩在很大程度上尚未被探索(Kong等,2025)。本文提出了一种针对RES的无需训练、即插即用的Token压缩方法。
## 3 重新思考指代表达分割的Token压缩
### 3.1 预备知识
基于MLLM的指代表达分割(RES)旨在根据自然语言指代表达$T$,为图像$I$中的目标对象生成像素级分割掩码$\mathcal{M}$。输入图像$I$由视觉编码器(如SigLIP)编码为视觉Token序列$\mathbf{X}_v \in \mathbb{R}^{M \times d}$,而指代表达$T$编码为语言Token序列$\mathbf{X}_t \in \mathbb{R}^{N \times d}$。通常,视觉Token数量$M$远大于文本Token数量$N$,当由大语言模型(LLM)处理时,会导致巨大的计算开销。为此,采用压缩算子$\mathcal{F}_{comp}$将原始视觉序列投影为紧凑表示$\mathbf{C}$:
$$
\mathbf{C} = \mathcal{F}_{comp}(\mathbf{X}_v), \quad \text{s.t. } \|\mathbf{C}\| < \|\mathbf{X}_v\| \quad (1)
$$
这里$\mathbf{C} = \{c^k\}_{k=1}^K$表示$K$个压缩后的视觉Token集合。这些Token与语言Token$\mathbf{X}_t$拼接后输入LLM:
$$
\mathbf{H}_{out} = \text{LLM}(\text{Concat}(\mathbf{X}_t, \mathbf{C})) \quad (2)
$$
$\mathbf{H}_{out}$表示分割任务的高级引导,可能采取`<seg>`嵌入、文本表示或其他结构化信号的形式。最后,分割掩码$\mathcal{M}$通过解码器(如SAM)根据原始图像特征$f_{img}$和引导$\mathbf{H}_{out}$生成:
$$
\mathcal{M} = \text{Decoder}(f_{img}, \mathbf{H}_{out}) \quad (3)
$$
### 3.2 现有Token压缩方法的评估
在先前的实验中,我们观察到几种现有的Token压缩方法在RES任务上出现显著性能下降。为深入探究此现象,我们对更广泛的Token压缩策略进行了更系统的评估。所有实验在统一...相似文章
LEAP:通过前瞻早期收敛令牌检测释放 dLLM 并行潜力
本文介绍了 LEAP,这是一种无需训练的方法,旨在通过检测早期收敛令牌来加速扩散语言模型(dLLMs)的推理过程。该方法能在不损失准确性的前提下,将去噪步骤减少 30%。
贪心最长匹配分词联合优化
本文提出JOLT,一种整数规划方法,用于优化基于从左到右贪心最长匹配解码(WordPiece)的子词分词。JOLT实现了近乎最优的压缩,缩小了BPE与理论下界之间的大部分差距,使token数量相比BPE最多减少0.78%。
每次我聘请一位语言学家,推理成本就会降低:论语言规则作为有效的提示压缩器
本文提出仅使用语言规则作为提示压缩器,无需LM前向传递,在轻度到中度压缩下达到与先进策略相似的性能。
打破令牌边界的防线:BPE分词如何在LLM对齐中制造可被利用的漏洞
本文指出,BPE分词将关键安全词汇切分为子词片段,在LLM对齐中制造了可被利用的漏洞。字符级扰动通过破坏令牌边界来绕过安全机制,在五个模型系列上实现了对HarmBench提示的80-100%拒绝翻转,其中48%产生了有害输出。
RoPE 在长上下文中既无法区分位置也无法区分词元,可证明
本文证明,基于RoPE的注意力机制在长上下文中无法区分词元位置和身份,解释了LLM在宣称的上下文长度内失败的原因。实验验证表明,针对检索优化的模型在简单列表任务上表现困难。