DRIFT:通过对抗性补丁攻击使流匹配VLA的去噪轨迹偏离
摘要
本文介绍了DRIFT,一种针对流匹配视觉-语言-动作模型(如pi0和pi0.5)的对抗性补丁攻击,表明先前的鲁棒性声明是虚幻的,并且仅攻击第一步去噪既更强又更便宜,能破坏LIBERO基准套件中几乎所有可解决的任务。
查看缓存全文
缓存时间: 2026/08/06 13:51
论文页面 - DRIFT:通过对抗性补丁攻击使流匹配VLA的去噪轨迹偏离
来源: https://huggingface.co/papers/2608.03207
摘要
流匹配视觉-语言-动作(VLA)模型(如pi0)通过积分学习到的去噪速度场来生成机器人动作,并且据报道能够抵抗那些轻易欺骗自回归VLA的对抗性扰动。我们证明这种鲁棒性在很大程度上是虚幻的:它源于先前的攻击忽略了多步去噪ODE。我们提出了DRIFT(Denoising Redirection via Input perturbation of the Flow-matching Trajectory),这是一种测试时通用对抗性补丁,放置在机器人夹爪上,攻击现成策略的去噪速度场。我们的核心发现是反直觉的:仅攻击第一步去噪比攻击更宽的时间步窗口既更强又更廉价,我们通过输入空间优化所特有的梯度冲突来解释这一点,并且这与训练时后门机制完全相反。在四个LIBERO套件中的pi0和pi0.5上,DRIFT用一个单个小补丁就破坏了几乎所有原本可解决的任务,远超动作空间和嵌入空间的攻击基线。
查看arXiv页面 (https://arxiv.org/abs/2608.03207) 查看PDF (https://arxiv.org/pdf/2608.03207) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03207)
在您的agent中获取此论文:
hf papers read 2608\.03207
还没有最新的CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash
引用此论文的模型
0
没有模型链接此论文
在模型的README.md中引用arxiv.org/abs/2608.03207,即可从此页面链接到该模型。
引用此论文的数据集
0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2608.03207,即可从此页面链接到该数据集。
引用此论文的Spaces
0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2608.03207,即可从此页面链接到该Space。
包含此论文的收藏集
0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该论文。
相似文章
明处藏匿:基于扩散的视觉-语言-行动模型无限制机器人攻击
本文提出DURA,一种基于扩散的无限制机器人攻击方法,能够生成视觉上自然的对抗性补丁,在白盒和黑盒设置下干扰视觉-语言-行动(VLA)模型,凸显了物理部署机器人系统的安全风险。
DRIFT: 视觉语言模型中用于连续输出解码的残差流适配器
DRIFT 是一种框架,通过将粗预测与迭代流匹配精化相结合,使预训练的视觉语言模型能够进行连续输出解码,从而提升感知和规划任务的性能。
用于优化离散扩散语言模型的漂移目标
本文提出TokenDrift,一种漂移目标方法,通过将分类预测提升至连续语义空间进行反对称漂移,从而优化离散扩散语言模型。在固定去噪步数下,该方法显著提升了生成质量。
@HuggingPapers: Stable-GFlowNet:通过对比轨迹平衡实现多样化且鲁棒的 LLM 红队测试 Naver AI 消除了不稳定的…
Naver AI 推出了 Stable-GFlowNet,这是一种通过对比轨迹平衡来消除生成流网络中不稳定的配分函数估计,从而改善 LLM 红队测试的方法。
@svlevine: 扩散(或流)可生成出色策略,但用强化学习训练它们却出了名的困难:BPTT不稳定,RL…
新论文展示了如何通过用单位矩阵近似流去噪过程的雅可比矩阵来优化用于强化学习的流匹配行动者,使训练变得可行。