BadWAM: 当 World-Action Models 正确想象却错误行动
摘要
BadWAM 引入了一个针对 World-Action Models (WAMs) 的对抗攻击框架,通过微小的视觉扰动打破想象与行动之间的对齐。这些攻击显著降低了任务成功率,暴露了这类模型中的一个漏洞。
查看缓存全文
缓存时间: 2026/07/20 09:43
论文页面 - BadWAM:当世界-行动模型梦对却做错
来源:https://huggingface.co/papers/2607.15207
摘要
世界-行动模型(WAMs)正成为具身控制领域的一种有前景的基础范式:它们不仅预测动作,还学习将动作生成与未来世界预测相耦合的表征。这种耦合通常被视为鲁棒性、可解释性和安全性的来源,因为原则上可以将机器人的动作与其想象的未来进行校验。本文表明这一假设是脆弱的。我们提出BadWAM,一个统一的框架,用于建模和评估世界-行动漂移攻击(World-Action Drift Attacks):一类新的WAM特定对抗攻击,通过微小的视觉扰动破坏WAM所想象的内容与其实际执行的动作之间的对齐。BadWAM沿两个自然标准刻画了这一攻击面:攻击强度与隐蔽性。当攻击者优先考虑破坏时,BadWAM实例化为纯动作对抗攻击,直接驱使模型采取导致任务失败的动作。当攻击者额外优先考虑隐蔽性时,BadWAM实例化为想象保持对抗攻击,旨在在保持模型预测的未来接近其干净想象的同时,诱发有害的动作偏移。这两种攻击共同捕获了WAM特定失效的谱系:从公开的动作劫持到更隐蔽的情况——模型看似想象出合理的未来,却执行了失同步的动作。我们在不同WAM变体上评估了BadWAM。结果表明,在闭环执行下我们的攻击大幅降低了任务成功率。例如,纯动作攻击将模型性能从96.5%的成功率降至43.1%。想象保持攻击的结果进一步暴露了WAM特有的脆弱性:适度的未来保持正则化可以在保持强攻击性能的同时减少未来想象漂移。
查看arXiv页面 (https://arxiv.org/abs/2607.15207) 查看PDF (https://arxiv.org/pdf/2607.15207) 项目页面 (https://liqiiiii.github.io/BadWAM/) GitHub42 (https://github.com/LiQiiiii/BadWAM) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.15207)
在你的agent中获取本篇论文:
hf papers read 2607\.15207
还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.15207即可在此页面链接。
引用此论文的数据集1
cy0307/awesome-egocentric-atlas Viewer• 更新于3天前 • 922 • 2.25k • 6 (https://huggingface.co/datasets/cy0307/awesome-egocentric-atlas)
引用此论文的Space0
暂无Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.15207即可在此页面链接。
包含此论文的合集3
相似文章
BadWorld:对世界模型的对抗性攻击
BadWorld是一种无标签的对抗框架,通过生成不可察觉的扰动来揭示视觉世界模型中的结构漏洞,这些扰动会导致未来展开中的灾难性失败。
世界行动模型:具身智能的下一个前沿
本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。
World Action Models: 综述
本综述全面概述了世界行动模型(WAMs)——即生成未来状态以辅助决策的预测行动系统——并根据所需输出和设计选择对现有工作进行分类。
AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由
AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。