DRIFT:通过对抗性补丁攻击使流匹配VLA的去噪轨迹偏离

Hugging Face Daily Papers 论文

摘要

本文介绍了DRIFT,一种针对流匹配视觉-语言-动作模型(如pi0和pi0.5)的对抗性补丁攻击,表明先前的鲁棒性声明是虚幻的,并且仅攻击第一步去噪既更强又更便宜,能破坏LIBERO基准套件中几乎所有可解决的任务。

流匹配视觉-语言-动作(VLA)模型(如pi0)通过积分学习到的去噪速度场来生成机器人动作,并且据报道能够抵抗那些轻易欺骗自回归VLA的对抗性扰动。我们表明,这种鲁棒性在很大程度上是虚幻的:它源于先前的攻击忽略了多步去噪ODE。我们提出了DRIFT(通过对流匹配轨迹进行输入扰动来实现去噪重定向),一种测试时的通用对抗性补丁,放置在机器人的夹爪上,用于攻击现成策略的去噪速度场。我们的核心发现是反直觉的:只攻击第一步去噪比攻击更宽的步骤窗口既更强又更便宜。我们通过输入空间优化中特有的梯度冲突来解释这一点,而这与训练时后门机制正好相反。在四个LIBERO套件上的pi0和pi0.5上,DRIFT用一个小型单一补丁几乎破坏了所有原本可解决的任务,远超动作空间和嵌入空间的攻击基线。
查看原文
查看缓存全文

缓存时间: 2026/08/06 13:51

论文页面 - DRIFT:通过对抗性补丁攻击使流匹配VLA的去噪轨迹偏离

来源: https://huggingface.co/papers/2608.03207

摘要

流匹配视觉-语言-动作(VLA)模型(如pi0)通过积分学习到的去噪速度场来生成机器人动作,并且据报道能够抵抗那些轻易欺骗自回归VLA的对抗性扰动。我们证明这种鲁棒性在很大程度上是虚幻的:它源于先前的攻击忽略了多步去噪ODE。我们提出了DRIFT(Denoising Redirection via Input perturbation of the Flow-matching Trajectory),这是一种测试时通用对抗性补丁,放置在机器人夹爪上,攻击现成策略的去噪速度场。我们的核心发现是反直觉的:仅攻击第一步去噪比攻击更宽的时间步窗口既更强又更廉价,我们通过输入空间优化所特有的梯度冲突来解释这一点,并且这与训练时后门机制完全相反。在四个LIBERO套件中的pi0和pi0.5上,DRIFT用一个单个小补丁就破坏了几乎所有原本可解决的任务,远超动作空间和嵌入空间的攻击基线。

查看arXiv页面 (https://arxiv.org/abs/2608.03207) 查看PDF (https://arxiv.org/pdf/2608.03207) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03207)

在您的agent中获取此论文:

hf papers read 2608\.03207

还没有最新的CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash

引用此论文的模型

0

没有模型链接此论文

在模型的README.md中引用arxiv.org/abs/2608.03207,即可从此页面链接到该模型。

引用此论文的数据集

0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2608.03207,即可从此页面链接到该数据集。

引用此论文的Spaces

0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2608.03207,即可从此页面链接到该Space。

包含此论文的收藏集

0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该论文。

相似文章

用于优化离散扩散语言模型的漂移目标

arXiv cs.CL

本文提出TokenDrift,一种漂移目标方法,通过将分类预测提升至连续语义空间进行反对称漂移,从而优化离散扩散语言模型。在固定去噪步数下,该方法显著提升了生成质量。