基于角色条件的子令牌路由:实现高效的视觉-语言-动作策略
摘要
本文介绍了一种基于角色条件的子令牌路由(RoleSub)方法,该方法通过路由子令牌组来高效压缩视觉-语言-动作模型,在降低计算成本的同时,保持在机器人任务上的强大性能。
arXiv:2608.18410v1 公告类型:新
摘要:视觉-语言-动作(VLA)模型处理长多模态令牌序列,使得推理在内存和计算上都很昂贵。现有的效率方法主要减少视觉令牌,但激进的令牌剪枝变得脆弱,因为移除一个令牌会丢弃其整个表示。子令牌压缩提供了一种补充替代方案,通过保留更多令牌同时减少其值宽度。然而,直接将子令牌压缩应用于VLA策略效果较差,因为对感知、语言理解和控制重要的信息在多模态表示中分布不同。
我们引入了基于角色条件的子令牌路由(RoleSub),它学习如何压缩保留令牌的值表示。在视觉令牌缩减后,RoleSub将每个保留的值表示划分到正交空间中的组,并使用轻量级路由器来确定应保留哪些组。路由决策基于令牌表示、学习到的潜在角色表示和语言上下文。相同的机制也可以应用于语言值,允许压缩视觉和语言表示而不移除额外的令牌。
我们在OpenVLA-OFT-7B上对RoleSub进行了评估,跨越四个LIBERO套件。在匹配的视觉-KV预算下,RoleSub在36个设置中的33个优于仅训练令牌的控制,在激进压缩下获得最大收益。结合视觉和语言压缩将总KV减少到原始值的9.2%--11.3%,同时在大多数任务上保持强大的控制性能。这些结果表明,减少保留令牌内的表示为激进VLA压缩提供了令牌剪枝的有效补充。
查看缓存全文
缓存时间: 2026/08/20 10:25
# 角色条件子令牌路由实现高效视觉-语言-动作策略
来源:https://arxiv.org/html/2608.18410
Wei Jiang隶属机构:Futurewei Technologies隶属机构:美国加利福尼亚州圣何塞市95131电子邮件:[\{wjiang@futurewei\.com\](mailto:)Wei Wang隶属机构:Futurewei Technologies隶属机构:美国加利福尼亚州圣何塞市95131电子邮件:[rickweiwang@futurewei\.com](mailto:)
###### 摘要
视觉-语言-动作(VLA)模型处理长序列的多模态令牌,导致推理过程在内存和计算方面成本高昂。现有的效率优化方法主要侧重于减少视觉令牌数量,但激进的令牌剪枝容易变得脆弱,因为移除一个令牌会完全丢弃其所有信息。子令牌压缩提供了一种互补方案,它通过保留更多令牌但降低其值宽度来实现压缩。然而,直接将子令牌压缩应用于VLA策略效果有限,因为对感知、语言理解和控制重要的信息在多模态表征中的分布方式各不相同。
我们提出了角色条件子令牌路由(RoleSub),它学习如何压缩保留令牌的值表征。在视觉令牌缩减之后,RoleSub将每个保留的值表征在一个正交空间中划分为组,并使用一个轻量级路由器来决定保留哪些组。路由决策基于令牌表征、一个可学习的潜在角色表征和语言上下文。相同的机制也可应用于语言表征,从而在不移除额外令牌的情况下实现视觉和语言表征的压缩。
我们在OpenVLA-OFT-7B模型上,使用全部四个LIBERO评测套件对RoleSub进行了评估。在匹配的视觉KV预算下,RoleSub在36个设置中的33个优于仅经过训练的令牌级控制方法,在最激进的压缩下获得了最大提升。结合视觉和语言压缩,可将总KV减少到原始规模的9.2%–11.3%,同时在大多数任务上保持了强大的控制性能。这些结果表明,减少保留令牌内的表征内容,为VLA的激进压缩提供了令牌剪枝的有效补充。
## 1 引言
视觉-语言-动作(VLA)模型通过将大型视觉-语言模型(VLM)的感知和推理能力迁移到动作预测中,已成为通用机器人控制的一种有前景的方法。诸如OpenVLA5 (https://arxiv.org/html/2608.18410#bib.bib1)和OpenVLA-OFT4 (https://arxiv.org/html/2608.18410#bib.bib2)等模型,能够联合处理视觉观测、自然语言指令和机器人状态以生成操作动作,在广泛的任务中表现出色。然而,这种能力伴随着大型多模态Transformer的计算成本。在每个控制步骤,策略需要处理一个以视觉令牌为主的长前缀,同时还包括语言、本体感知和与动作相关的状态。因此,降低这种多模态上下文的成本对于实际的VLA系统至关重要。
现有的VLA加速方法主要在令牌层面进行操作。例如,VLA-ADP9 (https://arxiv.org/html/2608.18410#bib.bib4)和VLA-Pruner8 (https://arxiv.org/html/2608.18410#bib.bib5)会识别与当前任务相关性较低的视觉令牌,并将其从后续计算中移除。类似策略已在VLM中得到广泛研究,包括FastV1 (https://arxiv.org/html/2608.18410#bib.bib6)、VisionZip12 (https://arxiv.org/html/2608.18410#bib.bib7)、SparseVLM14 (https://arxiv.org/html/2608.18410#bib.bib8)和FitPrune13 (https://arxiv.org/html/2608.18410#bib.bib9)。这些方法利用了视觉令牌之间的大量冗余,在中等保留比例下效果显著。它们的压缩单元是整个令牌。一旦移除一个令牌,该令牌携带的所有信息都会丢失。
随着预算的减少,这种粒度变得越来越受限。一个看似重要性一般的视觉令牌,可能仍然包含对象定位、几何关系或后续操作所需的信息。移除该令牌会同时消除所有这些信号。在闭环控制中,这个问题被放大:一个不正确的动作会改变物理状态,从而改变策略在后续步骤中接收到的观测。因此,在VLM中可能仅导致局部预测错误的压缩误差,在VLA轨迹中可能会被传播并放大。
子令牌路由提供了一种降低Transformer KV状态的互补方式3 (https://arxiv.org/html/2608.18410#bib.bib15)。它不是进一步减少保留的令牌数量,而是通过将每个保留令牌中的值向量划分为组,并仅选择其中一个子集来压缩其值表征。查询和键的表征保持不变。因此,令牌级缩减和子令牌路由在两个不同的维度上起作用:一个控制保留多少令牌状态,另一个控制为每个状态保留多少值信息。在LLM和VLM中,将这两个维度结合起来,在激进压缩级别下,比单纯依赖令牌移除能获得更好的精度-KV折衷方案3 (https://arxiv.org/html/2608.18410#bib.bib15)。
然而,直接将子令牌路由应用于VLA策略会导致截然不同的结果。在初步实验中,在视觉令牌剪枝后应用统一S=4、K=1的子令牌路由,在LIBERO-Spatial上仅达到43.8%的成功率。这表明,激进的VLA压缩不仅取决于保留多少信息,还取决于该容量如何在多模态表征中分布。
这种差异对于VLA策略来说是自然的。视觉、语言、本体感知和与动作相关的状态以不同方式参与动作生成,即使是同一模态的令牌,也可能根据任务和控制阶段贡献不同的信息。同时,这些功能预计不会占据Transformer表征中已知或明确可分隔的坐标。很难预先确定哪些维度对应于语义、几何、时间上下文或控制。固定的分解很容易移除那些在与网络其余部分交互后才变得重要的维度。相反,需要的是一个表征,其路由结构本身可以从控制目标中学习。
本文提出了角色条件子令牌路由(RoleSub),它通过一个可学习的潜在分解扩展了子令牌压缩,以适应VLA策略。对于每个保留的令牌,其值表征首先被转换到一个固定的正交空间并划分为组。一个轻量级的角色估计器生成一个软潜在表征,该表征参与决定保留哪些组。重要的是,这些潜在分量不被假定对应于预定义或语义上可识别的角色。它们的组织与策略一起学习,允许模型发现对动作预测有用的路由结构。组的选择还依赖于令牌表征和语言上下文,同时为不同类型的令牌分配独立的预算。正交变换提供了无损的基变换,因此表征仅通过组选择被改变。这为路由器提供了一个结构化的空间,学习如何分配有限的值容量。
在OpenVLA-OFT-7B模型上,使用全部四个LIBERO套件进行评测7 (https://arxiv.org/html/2608.18410#bib.bib3),标准的无需训练的令牌剪枝在本文考虑的激进预算下基本失效。由于RoleSub与压缩后的策略是联合训练的,仅与无需训练的剪枝方法比较,无法区分子令牌路由的收益和自适应训练的收益。因此,我们构建了一个匹配预算的“仅令牌控制”组,它使用与RoleSub相同的训练程序,但不包含子令牌路由。在36种视觉KV配置中的33种上,RoleSub优于这个更强的基线控制组,最大的提升出现在激进压缩和长时程任务中。
实验还揭示了语言令牌级压缩与子令牌压缩之间的强烈不对称性:移除语言令牌会迅速降低控制性能,而保留所有语言令牌并将其值表征压缩到十六分之一时(在独立压缩时),没有产生可测量的损失。这表明,令牌保留和值宽度保留VLA策略中扮演着不同的角色。
结合视觉和语言路由,可将完整的多模态前缀KV减少到其原始大小的9.2%–11.3%,同时在大多数LIBERO套件上保持了强大的性能。长时程控制对激进的语言压缩仍然更为敏感,表明合适的值预算取决于令牌类型和任务需求。
本工作的主要贡献包括:
- •我们引入了RoleSub,它结合了正交值空间分解、可学习的潜在角色表征以及令牌类型相关的预算,将子令牌路由适配于VLA控制。潜在分解是从控制目标中联合学习的,不需要预定义或明确可分隔的语义角色。
- •在匹配的视觉KV预算下,RoleSub在36个LIBERO设置中的33个优于经过训练的“仅令牌控制”,在激进压缩和长时程任务上获得了最大提升。
- •我们展示了在VLA策略中,令牌保留和值宽度保留表现不同。特别是,语言令牌对移除高度敏感,而其值表征在独立压缩时可以压缩高达16倍而无明显损失。结合视觉和语言路由进一步将完整的多模态前缀KV减少到9.2%–11.3%。
## 2 相关工作
#### 视觉-语言-动作模型。
视觉-语言-动作模型通过将动作预测建立在视觉观测、语言指令和机器人状态的基础上,扩展了预训练的视觉-语言表征以用于机器人控制。OpenVLA5 (https://arxiv.org/html/2608.18410#bib.bib1)是一个70亿参数的开源VLA,基于Llama-2语言模型,融合了DINOv2和SigLIP视觉特征,并在大规模机器人演示数据上训练。OpenVLA-OFT4 (https://arxiv.org/html/2608.18410#bib.bib2)通过并行动作解码、动作分块、连续动作预测和ℓ1回归改进了任务适应和推理。OpenVLA-OFT作为本文的主要策略,因为它在提供强大LIBERO基线的同时,保留了研究多模态KV压缩所需的Transformer结构。
#### 用于VLM和VLA的视觉令牌缩减。
减少多模态Transformer成本的一个常见方法是缩短视觉令牌序列。在VLM中,FastV1 (https://arxiv.org/html/2608.18410#bib.bib6)根据早期层中观察到的注意力模式剪枝视觉令牌,而VisionZip12 (https://arxiv.org/html/2608.18410#bib.bib7)选择信息丰富的视觉令牌并移除冗余的令牌。SparseVLM14 (https://arxiv.org/html/2608.18410#bib.bib8)和FitPrune13 (https://arxiv.org/html/2608.18410#bib.bib9)同样利用文本相关性或注意力结构来减少视觉令牌的冗余。最近的方法将令牌缩减适配到VLA策略。VLA-ADP9 (https://arxiv.org/html/2608.18410#bib.bib4)结合了文本引导的令牌重要性和动作感知剪枝,而VLA-Pruner8 (https://arxiv.org/html/2608.18410#bib.bib5)将语义相关性和与动作相关的信息都纳入了视觉令牌选择。这些方法主要在令牌粒度上操作:通过决定哪些视觉令牌应保留来获得效率。RoleSub则在令牌选择之后操作,减少保留令牌内的值表征,当进一步移除令牌变得昂贵时,提供了一个互补的压缩维度。
#### KV缓存与子令牌压缩。
KV缓存压缩已在长上下文语言模型中得到广泛研究。H2O15 (https://arxiv.org/html/2608.18410#bib.bib11)保留最近和重要的令牌,StreamingLLM11 (https://arxiv.org/html/2608.18410#bib.bib12)结合注意力汇和滑动上下文,Quest10 (https://arxiv.org/html/2608.18410#bib.bib10)执行查询感知的相关缓存状态选择。其他方法则减少存储的表征本身。例如,MiniCache6 (https://arxiv.org/html/2608.18410#bib.bib13)利用相邻层之间KV状态的相似性。这些方法共同表明,有用的KV信息在令牌、查询和模型组件之间非均匀分布。
子令牌路由3 (https://arxiv.org/html/2608.18410#bib.bib15)引入了一种互补的压缩形式,通过减少保留令牌内的值宽度来实现。它不是移除更多令牌,而是将每个保留的值向量划分为组,并仅选择其中一个子集,同时保持查询和键路径不变。在LLM和VLM上的实验表明,这种机制可以补充令牌级缩减,特别是在KV预算较小时。本文考虑的VLA设置引入了不同的挑战:直接应用统一的子令牌路由可能严重降低闭环控制性能。RoleSub通过引入正交路由空间、可学习的潜在角色表征以及令牌类型相关的值预算来解决这一场景,而不假设学习的潜在分量对应于预定义的语义角色。
#### 参数高效适配。
参数高效微调提供了一种无需更新完整主干即可适配大型预训练模型的实用方法。LoRA2 (https://arxiv.org/html/2608.18410#bib.bib14)通过低秩因子表示权重更新,已广泛用于大型Transformer的高效适配。RoleSub与低秩适配一起训练路由组件,同时保持预训练主干冻结。相同的适配过程也用于匹配的“仅令牌控制”组,以便将子令牌路由的效果与策略适配到压缩的收益区分开来。
## 3 方法
RoleSub将令牌级缩减与可学习的子令牌路由相结合,用于多模态VLA表征。令牌级缩减控制哪些令牌状态保留在序列中,而子令牌路由控制在每个存活的状态中保留多少值信息。这两种操作在不同维度上起作用,并且可以针对不同类型的令牌独立配置。对于每个选择进行子令牌路由的令牌,RoleSub将其值表征转换到一个正交路由空间,并根据令牌表征、可学习的潜在角色表征和语言上下文选择值组的子集。
考虑一个基于Transformer的VLA策略,包含L个注意力层。在每个控制步骤,策略接收视觉观测、语言指令、本体感知状态和与动作相关的上下文。我们将多模态序列写为
\(X = [X^{\text{vis}}, X^{\text{lang}}, X^{\text{prop}}, X^{\text{act}}]\)。
令\(\mathbf{h}_i^{(\ell)} \in \mathbb{R}^d\)表示令牌i在第l层的隐藏状态,其查询、键和值表征为
\(\mathbf{q}_i^{(\ell)} = W_q^{(\ell)} \mathbf{h}_i^{(\ell)}\),
\(\mathbf{k}_i^{(\ell)} = W_k^{(\ell)} \mathbf{h}_i^{(\ell)}\),
\(\mathbf{v}_i^{(\ell)} = W_v^{(\ell)} \mathbf{h}_i^{(\ell)}\)。相似文章
面向多模态推理的结构化角色感知策略优化
本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。
Reroute,而非移除:面向视觉语言模型的可恢复视觉令牌路由
提出Reroute,一种无需训练的视觉语言模型插件,用可恢复的路由替代不可逆的视觉令牌剪枝,允许令牌在后续阶段重新进入流水线,从而在激进的令牌缩减下提升接地性能,同时保持VQA性能。
Drop-Then-Recovery: 视觉-语言-动作模型究竟有多冗余?
本文研究了视觉-语言-动作(VLA)模型中的冗余现象,发现语言主干在机器人操作任务中高度冗余,而视觉和动作路径则更为关键。作者提出了 Drop-Then-Recovery(DTR)和 GateProbe 方法,用于量化并剪枝不必要的模块。实验表明,移除一半的大语言模型(LLM)模块甚至能提升模型性能。
PolicyTrim: 提升视觉-语言-动作模型的本征策略效率
PolicyTrim是一种基于强化学习的后训练框架,能将视觉-语言-动作模型的动作块利用率提升3倍,并将物理执行步骤减少51.4%,实现高达5.83倍的部署加速。
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。