Drop-Then-Recovery: 视觉-语言-动作模型究竟有多冗余?
摘要
本文研究了视觉-语言-动作(VLA)模型中的冗余现象,发现语言主干在机器人操作任务中高度冗余,而视觉和动作路径则更为关键。作者提出了 Drop-Then-Recovery(DTR)和 GateProbe 方法,用于量化并剪枝不必要的模块。实验表明,移除一半的大语言模型(LLM)模块甚至能提升模型性能。
查看缓存全文
缓存时间: 2026/06/30 23:38
论文页面 - Drop-Then-Recovery: 视觉-语言-动作模型有多冗余?
来源:https://huggingface.co/papers/2606.27755
作者:
,
,
,
,
,
,
,
,
,
摘要
研究表明,视觉-语言-动作模型中的语言主干对于机器人操作任务而言高度冗余,而视觉和动作通路更为关键,这提示未来架构需要更审慎地分配容量。
视觉-语言-动作(VLA)模型能够实现指令驱动的机器人操作,但它们继承了预训练VLM中过大的语言主干(https://huggingface.co/papers?q=language%20backbones),其容量远超短机器指令的需求。这引出一个基本问题:一个VLA模型在闭环控制中实际需要多少容量?本文通过使用Transformer块移除(https://huggingface.co/papers?q=transformer%20block%20removal)作为受控干预手段,研究VLA模型中的架构冗余。我们提出了Drop-Then-Recovery(https://huggingface.co/papers?q=Drop-Then-Recovery)(DTR)分析协议:从预训练VLA模型中移除选定块,然后微调所得模型,以衡量被移除的容量对于下游控制是否必要。为使这一干预更可靠,我们提出了GateProbe(https://huggingface.co/papers?q=GateProbe),一种一次性虚拟门灵敏度度量,用于根据各块对下游动作损失的贡献进行排序。在多种VLA架构、操作基准甚至真实机器人工业场景下,我们发现了移除后恢复能力的显著不对称性:\textit{语言主干(https://huggingface.co/papers?q=language%20backbones)对于标准机器人操作任务高度冗余,而视觉和动作通路(https://huggingface.co/papers?q=action%20pathways)对移除的容忍度则低得多}。在LIBERO(https://huggingface.co/papers?q=LIBERO)上,移除一半的LLM块甚至将OpenVLA-OFT(https://huggingface.co/papers?q=OpenVLA-OFT)在相同下游微调预算下的性能从95.0%提升至98.3%,而仅保留两个语言块仍能恢复基线水平的表现。这些结果表明,当前的VLA基准可能对深层语言接地和组合指令理解(https://huggingface.co/papers?q=compositional%20instruction%20understanding)施加的压力有限,未来的VLA架构应更审慎地在语言、视觉和动作组件之间分配容量。代码可在 https://github.com/s1ghhh/VLADrop 获取。
查看arXiv页面(https://arxiv.org/abs/2606.27755)查看PDF(https://arxiv.org/pdf/2606.27755)GitHub0(https://github.com/s1ghhh/VLADrop)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.27755)
在您的代理中获取此论文:
hf papers read 2606.27755
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用 arxiv.org/abs/2606.27755 可从本页链接到它。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2606.27755 可从本页链接到它。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用 arxiv.org/abs/2606.27755 可从本页链接到它。
包含此论文的收藏2
相似文章
TBD-VLA: 时序块扩散视觉语言动作模型
TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
LabVLA:在科学实验室中落地视觉-语言-动作模型
LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。
StableVLA:迈向无需额外数据的稳健视觉-语言-动作模型
本文为视觉-语言-动作(VLA)模型引入了一种信息瓶颈适配器(IB-Adapter),旨在提升模型在未见过的视觉干扰下的鲁棒性,且无需额外数据,在极小的参数开销下实现了高达30%的性能提升。