BadWAM: 当 World-Action Models 正确想象却错误行动

Hugging Face Daily Papers 论文

摘要

BadWAM 引入了一个针对 World-Action Models (WAMs) 的对抗攻击框架,通过微小的视觉扰动打破想象与行动之间的对齐。这些攻击显著降低了任务成功率,暴露了这类模型中的一个漏洞。

World-Action Models (WAMs) 正在成为具身控制的一种有前景的基础模型:它们不仅预测动作,还学习将动作生成与未来世界预测耦合的表征。这种耦合通常被视为鲁棒性、可解释性和安全性的来源,因为原则上可以通过机器人的想象未来来检查其动作。在本文中,我们表明这一假设是脆弱的。我们引入了 BadWAM,这是一个用于建模和评估 World-Action Drift Attacks 的统一框架:一种新的针对 WAM 的对抗攻击类型,通过微小的视觉扰动打破 WAM 想象与执行之间的对齐。BadWAM 根据两个自然标准——攻击强度和隐蔽性——来刻画这一攻击面。当攻击者优先考虑破坏时,BadWAM 实例化一种仅动作对抗攻击,直接驱使模型执行导致任务失败的动作。当攻击者额外优先考虑隐蔽性时,BadWAM 实例化一种保留想象的对抗攻击,旨在诱导有害的动作偏移,同时使模型预测的未来接近其干净想象。这两种攻击共同涵盖了 WAM 特有的一系列失败:从公开的动作劫持到更隐蔽的情况——模型看似想象了一个合理的未来,却执行了不同步的动作。我们在不同变体的 WAM 上评估了 BadWAM。结果表明,我们的攻击在闭环执行下显著降低了任务成功率。例如,我们的仅动作攻击将模型性能从 96.5% 的成功率降低到 43.1%。保留想象的攻击结果进一步暴露了 WAM 特有的漏洞:适度的未来保持正则化可以在保持强攻击性能的同时减少未来想象漂移。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:43

论文页面 - BadWAM:当世界-行动模型梦对却做错

来源:https://huggingface.co/papers/2607.15207

摘要

世界-行动模型(WAMs)正成为具身控制领域的一种有前景的基础范式:它们不仅预测动作,还学习将动作生成与未来世界预测相耦合的表征。这种耦合通常被视为鲁棒性、可解释性和安全性的来源,因为原则上可以将机器人的动作与其想象的未来进行校验。本文表明这一假设是脆弱的。我们提出BadWAM,一个统一的框架,用于建模和评估世界-行动漂移攻击(World-Action Drift Attacks):一类新的WAM特定对抗攻击,通过微小的视觉扰动破坏WAM所想象的内容与其实际执行的动作之间的对齐。BadWAM沿两个自然标准刻画了这一攻击面:攻击强度与隐蔽性。当攻击者优先考虑破坏时,BadWAM实例化为纯动作对抗攻击,直接驱使模型采取导致任务失败的动作。当攻击者额外优先考虑隐蔽性时,BadWAM实例化为想象保持对抗攻击,旨在在保持模型预测的未来接近其干净想象的同时,诱发有害的动作偏移。这两种攻击共同捕获了WAM特定失效的谱系:从公开的动作劫持到更隐蔽的情况——模型看似想象出合理的未来,却执行了失同步的动作。我们在不同WAM变体上评估了BadWAM。结果表明,在闭环执行下我们的攻击大幅降低了任务成功率。例如,纯动作攻击将模型性能从96.5%的成功率降至43.1%。想象保持攻击的结果进一步暴露了WAM特有的脆弱性:适度的未来保持正则化可以在保持强攻击性能的同时减少未来想象漂移。

查看arXiv页面 (https://arxiv.org/abs/2607.15207) 查看PDF (https://arxiv.org/pdf/2607.15207) 项目页面 (https://liqiiiii.github.io/BadWAM/) GitHub42 (https://github.com/LiQiiiii/BadWAM) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.15207)

在你的agent中获取本篇论文:

hf papers read 2607\.15207

还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.15207即可在此页面链接。

引用此论文的数据集1

cy0307/awesome-egocentric-atlas Viewer• 更新于3天前 • 922 • 2.25k • 6 (https://huggingface.co/datasets/cy0307/awesome-egocentric-atlas)

引用此论文的Space0

暂无Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.15207即可在此页面链接。

包含此论文的合集3

相似文章

BadWorld:对世界模型的对抗性攻击

Hugging Face Daily Papers

BadWorld是一种无标签的对抗框架,通过生成不可察觉的扰动来揭示视觉世界模型中的结构漏洞,这些扰动会导致未来展开中的灾难性失败。

世界行动模型:具身智能的下一个前沿

Hugging Face Daily Papers

本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。

World Action Models: 综述

Hugging Face Daily Papers

本综述全面概述了世界行动模型(WAMs)——即生成未来状态以辅助决策的预测行动系统——并根据所需输出和设计选择对现有工作进行分类。

AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由

Hugging Face Daily Papers

AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。