StableVLA:迈向无需额外数据的稳健视觉-语言-动作模型
摘要
本文为视觉-语言-动作(VLA)模型引入了一种信息瓶颈适配器(IB-Adapter),旨在提升模型在未见过的视觉干扰下的鲁棒性,且无需额外数据,在极小的参数开销下实现了高达30%的性能提升。
查看缓存全文
缓存时间: 2026/05/19 06:30
论文页面 - StableVLA:无需额外数据实现鲁棒的视觉-语言-动作模型
来源:https://huggingface.co/papers/2605.18287
发布于 5 月 18 日
·
提交者:https://huggingface.co/yfdeng10
yfdeng (https://huggingface.co/yfdeng10) 于 5 月 19 日
摘要
视觉-语言-动作模型在面对未见过的视觉干扰时性能会下降,但一个轻量级的基于信息论的适配器模块能以极小的参数开销显著提升鲁棒性。
将训练数据集中所有可能的干扰都涵盖在内是不可行的。这引出了一个关键问题:视觉-语言-动作(VLA)模型在遇到未见过的真实世界视觉干扰(特别是在不完美的视觉条件下)时的鲁棒性如何。在这项工作中,我们基于近期最先进的 VLA 模型进行了系统性研究,发现当引入训练数据中未出现的视觉干扰时,模型性能会显著下降。为缓解这一问题,我们提出了一个基于信息论的轻量级适配器模块,称为信息瓶颈适配器(IB-Adapter),它能有选择地过滤来自视觉输入的潜在噪声。无需任何额外数据或数据增强策略,IB-Adapter 就能使基线模型平均提升 30%,同时仅增加不到 1000 万个参数,展现出显著的效率和有效性。此外,即使使用小 14 倍的骨干网络(5 亿参数)且未在 Open X-Embodiment 数据集上进行预训练,我们的模型 StableVLA 也能达到与 70 亿参数规模的最先进 VLA 相竞争的鲁棒性。在可忽略的参数开销(<1000 万)下,我们的方法能在长程任务上保持准确率,并且在合成和物理视觉损坏条件下均超越了 OpenPi。
查看 arXiv 页面 (https://arxiv.org/abs/2605.18287) 查看 PDF (https://arxiv.org/pdf/2605.18287) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.18287)
在您的代理中获取此论文:
hf papers read 2605\.18287
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0 个
无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2605.18287 即可从此页面链接。
引用此论文的数据集 0 个
无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.18287 即可从此页面链接。
引用此论文的 Spaces 0 个
无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2605.18287 即可从此页面链接。
包含此论文的收藏集 0 个
无收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中即可从此页面链接。
相似文章
CLAP:通过语言-动作对齐实现从VLM到VLA的直接适配
CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。
SimpleMemVLA:一种简单但有效的视觉-语言-动作模型原生视频记忆
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。
TBD-VLA: 时序块扩散视觉语言动作模型
TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
LabVLA:在科学实验室中落地视觉-语言-动作模型
LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。