Drop-Then-Recovery: 视觉-语言-动作模型究竟有多冗余?

Hugging Face Daily Papers 论文

摘要

本文研究了视觉-语言-动作(VLA)模型中的冗余现象,发现语言主干在机器人操作任务中高度冗余,而视觉和动作路径则更为关键。作者提出了 Drop-Then-Recovery(DTR)和 GateProbe 方法,用于量化并剪枝不必要的模块。实验表明,移除一半的大语言模型(LLM)模块甚至能提升模型性能。

视觉-语言-动作(VLA)模型实现了指令驱动的机器人操作,但它们继承了预训练视觉-语言模型(VLM)中过大的语言主干,其容量远超短机器人指令所需。这引出一个基本问题:VLA 模型中有多少部分对于闭环控制是真正必要的?在本工作中,我们通过 Transformer 模块移除作为受控干预,研究 VLA 模型中的架构冗余。我们提出了 Drop-Then-Recovery(DTR)分析协议:从预训练的 VLA 模型中移除选定模块,然后微调所得模型,以衡量被移除的容量对于下游控制是否必要。为了使这种干预可靠,我们提出了 GateProbe,一种一次性虚拟门控灵敏度指标,用于按模块对下游动作损失的贡献进行排序。在多种 VLA 架构、操作基准测试乃至真实机器人工业场景中,我们发现模块移除后的可恢复性存在强烈不对称性:*语言主干在标准机器人操作任务中高度冗余,而视觉和动作路径对移除的容忍度显著较低*。在 LIBERO 上,移除一半 LLM 模块甚至将 OpenVLA-OFT 在下游微调预算相同的情况下从 95.0% 提升至 98.3%,仅保留两个语言模块仍可恢复基线性能。这些结果表明,当前的 VLA 基准可能对深层语言理解及组合指令理解施加了有限压力,未来的 VLA 架构应在语言、视觉和动作组件之间更审慎地分配容量。代码已开源:https://github.com/s1ghhh/VLADrop。
查看原文
查看缓存全文

缓存时间: 2026/06/30 23:38

论文页面 - Drop-Then-Recovery: 视觉-语言-动作模型有多冗余?

来源:https://huggingface.co/papers/2606.27755

作者:

,

,

,

,

,

,

,

,

,

摘要

研究表明,视觉-语言-动作模型中的语言主干对于机器人操作任务而言高度冗余,而视觉和动作通路更为关键,这提示未来架构需要更审慎地分配容量。

视觉-语言-动作(VLA)模型能够实现指令驱动的机器人操作,但它们继承了预训练VLM中过大的语言主干(https://huggingface.co/papers?q=language%20backbones),其容量远超短机器指令的需求。这引出一个基本问题:一个VLA模型在闭环控制中实际需要多少容量?本文通过使用Transformer块移除(https://huggingface.co/papers?q=transformer%20block%20removal)作为受控干预手段,研究VLA模型中的架构冗余。我们提出了Drop-Then-Recovery(https://huggingface.co/papers?q=Drop-Then-Recovery)(DTR)分析协议:从预训练VLA模型中移除选定块,然后微调所得模型,以衡量被移除的容量对于下游控制是否必要。为使这一干预更可靠,我们提出了GateProbe(https://huggingface.co/papers?q=GateProbe),一种一次性虚拟门灵敏度度量,用于根据各块对下游动作损失的贡献进行排序。在多种VLA架构、操作基准甚至真实机器人工业场景下,我们发现了移除后恢复能力的显著不对称性:\textit{语言主干(https://huggingface.co/papers?q=language%20backbones)对于标准机器人操作任务高度冗余,而视觉和动作通路(https://huggingface.co/papers?q=action%20pathways)对移除的容忍度则低得多}。在LIBERO(https://huggingface.co/papers?q=LIBERO)上,移除一半的LLM块甚至将OpenVLA-OFT(https://huggingface.co/papers?q=OpenVLA-OFT)在相同下游微调预算下的性能从95.0%提升至98.3%,而仅保留两个语言块仍能恢复基线水平的表现。这些结果表明,当前的VLA基准可能对深层语言接地和组合指令理解(https://huggingface.co/papers?q=compositional%20instruction%20understanding)施加的压力有限,未来的VLA架构应更审慎地在语言、视觉和动作组件之间分配容量。代码可在 https://github.com/s1ghhh/VLADrop 获取。

查看arXiv页面(https://arxiv.org/abs/2606.27755)查看PDF(https://arxiv.org/pdf/2606.27755)GitHub0(https://github.com/s1ghhh/VLADrop)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.27755)

在您的代理中获取此论文:

hf papers read 2606.27755

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用 arxiv.org/abs/2606.27755 可从本页链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2606.27755 可从本页链接到它。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用 arxiv.org/abs/2606.27755 可从本页链接到它。

包含此论文的收藏2

相似文章

TBD-VLA: 时序块扩散视觉语言动作模型

Hugging Face Daily Papers

TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。