明处藏匿:基于扩散的视觉-语言-行动模型无限制机器人攻击
摘要
本文提出DURA,一种基于扩散的无限制机器人攻击方法,能够生成视觉上自然的对抗性补丁,在白盒和黑盒设置下干扰视觉-语言-行动(VLA)模型,凸显了物理部署机器人系统的安全风险。
arXiv:2608.10393v1 公告类型:新
摘要:视觉-语言-行动(VLA)模型在多种操作任务中展现出强大的机器人控制能力。然而,其对抗鲁棒性仍未得到充分探索,利用这一弱点可能导致物理世界中的危害。现有针对VLA模型的攻击通常依赖像素空间扰动或白盒访问,导致明显的伪影,并且在实际机器人系统中部署能力有限。在本工作中,我们提出DURA,一种基于扩散的无限制机器人攻击方法,为VLA模型生成视觉上自然的对抗性补丁。DURA支持白盒和黑盒攻击设置,其中黑盒设置仅需受害者模型的预测动作。通过沿着预训练扩散模型的潜在轨迹进行优化,DURA生成视觉上自然的补丁,同时将机器人引导至攻击者指定的目标动作。在仿真和真实物理世界中的大量实验表明,DURA始终优于现有方法。我们的发现暴露了物理部署VLA模型的安全风险,并呼吁更强的防御措施。
查看缓存全文
缓存时间: 2026/08/12 08:23
# 隐于无形:基于扩散的针对视觉-语言-动作模型的无约束机器人攻击 Source: https://arxiv.org/html/2608.10393 Jiahui Han1,2,\*, Yuhui Yao2,3,\*, Xin Wang2,\*,†, Jiafei Cao2, Mingxuan Zhang2, Danfeng Shan1, Huiqi Deng1,2,†, Guanchu Wang2,†, Xia Hu2,† ###### 摘要 视觉-语言-动作(VLA)模型在多种机器人操控任务中展现出了强大的能力。然而,它们的对抗鲁棒性在很大程度上仍未得到充分探索,利用这一弱点可能导致物理世界中的危害。现有的针对VLA模型的攻击通常依赖于像素空间扰动或白盒访问,导致产生明显的伪影,并且在真实机器人系统中的可部署性有限。在这项工作中,我们提出 DURA,一种基于扩散的无约束机器人攻击方法,可为 VLA 模型生成视觉上自然的对抗补丁。DURA 同时支持白盒和黑盒攻击设置,其中黑盒设置仅需受害模型的预测动作。通过沿预训练扩散模型的隐轨迹进行优化,DURA 生成视觉自然的补丁,同时引导机器人朝向攻击者指定的目标动作。在仿真和真实物理世界中的大量实验表明,DURA 始终优于现有方法。我们的研究结果暴露了物理部署的 VLA 模型的安全风险,并呼吁更强的防御。 ††footnotetext:\*同等贡献。 †通讯作者:Huiqi Deng, Guanchu Wang, Xin Wang, 和 Xia Hu。 ## 引言 视觉-语言-动作(VLA)模型已成为通用机器人控制的强大范式(Kimet al.2024 (https://arxiv.org/html/2608.10393#bib.bib8)),将视觉感知、语言理解和动作预测统一在单个策略中。给定图像观察、机器人状态和语言指令,VLA 模型可以直接为开放词汇的操控任务生成动作。从 RT-1(Brohanet al.2022 (https://arxiv.org/html/2608.10393#bib.bib9))和 RT-2(Zitkovichet al.2023 (https://arxiv.org/html/2608.10393#bib.bib10))到最近的 OpenVLA(Kimet al.2024 (https://arxiv.org/html/2608.10393#bib.bib8))、Octo(Teamet al.2024 (https://arxiv.org/html/2608.10393#bib.bib11))、π0(Blacket al.2024 (https://arxiv.org/html/2608.10393#bib.bib12))和 SpatialVLA(Quet al.2025 (https://arxiv.org/html/2608.10393#bib.bib13))等代表性系统,已经在任务、本体和动作表示上展现出不断增强的泛化能力。这些进展指向能够在复杂环境中遵循多样化指令的通用机器人智能体,使 VLA 模型越来越接近在开放世界机器人系统中的部署。 参照图注 图1:对 VLA 机器人(“拿起杯子”)的无约束补丁攻击示意图。顶部:传统的噪声补丁会使机械臂停滞,但非常显眼且仅支持白盒攻击。底部:我们的 DURA 补丁在使机械臂停滞的同时,*视觉自然*、*可黑盒部署*且*语义一致*。 然而,VLA 模型日益增长的自主性也带来了显著的安全风险(Wanget al.2024 (https://arxiv.org/html/2608.10393#bib.bib26),2025b (https://arxiv.org/html/2608.10393#bib.bib24),2026 (https://arxiv.org/html/2608.10393#bib.bib30); Maet al.2026 (https://arxiv.org/html/2608.10393#bib.bib25))。近期研究表明,精心构造的视觉补丁或恶意语言指令可以干扰机器人执行,导致策略冻结、偏离预期任务或遵循目标行为(Zhanget al.2026 (https://arxiv.org/html/2608.10393#bib.bib27); Wanget al.2025a (https://arxiv.org/html/2608.10393#bib.bib14); Joneset al.2025 (https://arxiv.org/html/2608.10393#bib.bib15); Wanget al.2025c (https://arxiv.org/html/2608.10393#bib.bib16))。虽然这些攻击为 VLA 安全风险提供了有价值的证据,但它们仍不符合现实部署条件。具体来说,(1)视觉自然性:现有的视觉补丁通常表现为无意义或显眼的伪影,而不是自然场景内容,使其在真实工作空间中容易被发现;(2)黑盒可部署性:现有的 VLA 攻击通常依赖于特权内部访问,如模型参数、梯度或 logits,这在闭源机器人系统中很少可用;(3)时间效率:它们通常需要对每个实例进行长时间优化来构造单个补丁,这会产生很高的查询或计算成本,限制了其实际使用。这些局限性将核心问题从展示白盒漏洞转变为构造具有真实世界效果的、视觉自然的黑盒对抗扰动。 在这项工作中,我们提出 DURA,一种针对 VLA 模型的基于扩散的无约束机器人攻击,如图1所示。DURA 不是在固定补丁上构造小型范数有界扰动或高频加性噪声,而是将局部补丁内容视为无约束的,并沿预训练扩散模型的隐轨迹进行搜索,利用扩散先验保持视觉自然性,同时 VLA 攻击目标引导机器人朝向攻击者指定的目标动作。 由此产生的隐轨迹框架自然地同时支持白盒和黑盒威胁模型,二者仅在每步攻击方向的估计方式上有所不同。在白盒访问下,DURA 通过将目标动作损失通过 VLA 策略和 VAE 解码器(Kingma and Welling2013 (https://arxiv.org/html/2608.10393#bib.bib56))反向传播来计算隐更新。在黑盒访问下,它仅从动作输出查询中估计更新,无需访问模型参数或梯度。通过在多样化的帧和指令上优化单个补丁,DURA 进一步提高了跨机器人任务和部署条件的可迁移性。 我们在两个 SOTA 开源 VLA 模型上评估了 DURA,即 OpenVLA(Kimet al.2024 (https://arxiv.org/html/2608.10393#bib.bib8))和 π0-FAST(Pertschet al.2025 (https://arxiv.org/html/2608.10393#bib.bib60)),涵盖 LIBERO 仿真基准(Liuet al.2023 (https://arxiv.org/html/2608.10393#bib.bib17))和真实的 Franka 机械臂。结果表明,在黑盒访问下,DURA 的攻击成功率(ASR)显著高于现有基线,同时在常见的输入变换防御下仍然有效,并能迁移到真实的 Franka 机械臂上,作为对机器人行为的可控、按需开关。这些结果凸显了评估和缓解当前 VLA 模型部署级漏洞的紧迫性。 总而言之,我们的主要贡献如下: - 我们提出了 DURA,一种针对视觉-语言-动作模型的基于扩散的无约束机器人攻击。DURA 生成局部、视觉自然且语义合理的补丁,引导机器人策略朝向攻击者指定的动作。 - 我们建立 DURA 作为一个实用的攻击框架,同时适用于白盒和动作输出黑盒设置。通过在扩散引导的补丁空间中搜索,DURA 在攻击效果、视觉自然性和优化效率之间取得了良好的权衡。 - 我们在 OpenVLA 和 π0-FAST 上,跨越 LIBERO 和真实世界的 Franka 机器人进行了全面评估。DURA 在评估的白盒和黑盒设置中实现了 79.3%–100% 的 ASR,优于最强的目标定向基线。真实机器人实验进一步证明了对物理硬件的可控且可重复的目标行为。 ## 相关工作 对视觉-语言-动作模型的对抗攻击。现有的针对 VLA 模型的攻击同时针对视觉和语言输入。在视觉通道上,Wang 等人(Wanget al.2025a (https://arxiv.org/html/2608.10393#bib.bib14))研究了基于补丁的目标,用于破坏或引导机器人
相似文章
DRIFT:通过对抗性补丁攻击使流匹配VLA的去噪轨迹偏离
本文介绍了DRIFT,一种针对流匹配视觉-语言-动作模型(如pi0和pi0.5)的对抗性补丁攻击,表明先前的鲁棒性声明是虚幻的,并且仅攻击第一步去噪既更强又更便宜,能破坏LIBERO基准套件中几乎所有可解决的任务。
TBD-VLA: 时序块扩散视觉语言动作模型
TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。
Drop-Then-Recovery: 视觉-语言-动作模型究竟有多冗余?
本文研究了视觉-语言-动作(VLA)模型中的冗余现象,发现语言主干在机器人操作任务中高度冗余,而视觉和动作路径则更为关键。作者提出了 Drop-Then-Recovery(DTR)和 GateProbe 方法,用于量化并剪枝不必要的模块。实验表明,移除一半的大语言模型(LLM)模块甚至能提升模型性能。
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
@QuixiAI: https://arxiv.org/abs/2509.21401 这是我在至少一小时内看到的最酷的东西 @TroyDoesAI @elder_plinius @ma…
提出了JaiLIP方法,通过使用损失引导扰动生成不可察觉的对抗图像来破解视觉语言模型,实现了高毒性并优于现有方法。