幻觉即利用:携带证据的多模态智能体
摘要
本文形式化了多模态智能体中的幻觉到动作转换,并提出了携带证据的智能体(ECA),它使用受限验证器仅授权安全的工具调用,在200个任务的流水线上实现了0%的不安全动作率。
arXiv:2605.19192v1 公告类型: new
摘要: 多模态智能体利用截图、文档和网页来选择工具调用。当虚假的视觉声明触发点击、邮件、提取或转账时,幻觉便不再是答案质量问题,而是授权失败。我们将这种失败模式形式化为幻觉到动作的转换:一个无依据的感知声明提供了条件,使得某个特权动作显得被允许。我们提出了携带证据的多模态智能体(ECA),它将模型生成的自由形式文本视为不可采信的证据。ECA将每个工具调用分解为动作关键谓词,从受限的DOM/OCR/AX验证器获取类型化证书,并由确定性门控仅授予这些证书支持的权限。该架构并不隐藏感知错误,而是将不透明的模型信念转换为具名的验证器、模式及实现残差。通过对1900次攻击的红队测试,该残差直接暴露出来:四次针对性加固将门控绕过率从15%降至1.3%。借助内容派生证书,ECA在200个任务的端到端流水线上实现了0%的不安全动作率(Wilson 95%置信上限2.67%),并在120个任务的浏览器概念验证中实现了同样效果(上限4.3%)。对500个分层任务键的直接HACR审计显示,无依据的动作关键声明在朴素智能体(100.0%)和仅提示防御(49.6%)中会导致不安全执行,但在ECA中不会。对7,488条GPT-5.4基准轨迹的Oracle证书回放可用作门控正确性的完整性检查,而在同一威胁模型下,神经评判基线仍可被绕过。由此得出的原则很简单:模型语言可以提出动作,但外部证据必须授权它们。
查看缓存全文
缓存时间: 2026/05/20 08:28
# 幻觉即利用:携带证据的多模态智能体
来源:https://arxiv.org/html/2605.19192
###### 摘要
多模态智能体通过截图、文档和网页来选择工具调用。当一个虚假的视觉主张触发点击、邮件发送、数据提取或转账操作时,幻觉就变成了授权失败,而不是答案质量错误。我们将这种失效模式形式化为**幻觉到动作的转换**:一个不受支持的感知主张提供了使一个特权动作看似被允许的前提条件。我们提出了携带证据的多模态智能体(ECA),它将模型的自由形式文本视为不可采纳的证据。ECA将每个工具调用分解为动作关键谓词,从受约束的DOM/OCR/可访问性验证器中获取类型化证书,并让一个确定性门控仅授予这些证书所支持的特权。该架构并未隐藏感知错误,而是将不透明的模型信念转化为可在验证器、模式(schema)和实现层面进行审计的残留物。对超过1900次攻击的验证器红队测试直接暴露了这种残留:四个针对性的加固步骤将门控绕过率从15%降至1.3%。使用内容派生的证书,ECA在200个任务的端到端流水线中获得了0%的不安全动作率(Wilson 95%置信上限2.67%),在120个任务的浏览器概念验证中也获得了0%(置信上限4.3%)。对500个分层任务键进行的直接HACR审计显示,在朴素智能体(100.0%)和仅提示防御(49.6%)中,不受支持的动作关键主张会达到不安全执行,但ECA不会。在7488个GPT-5.4基准轨迹上进行的预言器证书重放将门控正确性与规划器行为分离,而在同一威胁模型下,神经法官基线仍然接纳了大多数不安全动作,这进一步印证了:授权特权工具使用时,应使用外部认证的谓词而非模型文本。
## 幻觉即利用:携带证据的多模态智能体
Guijia Zhang¹, Hao Zheng¹, Harry Yang²
¹深圳大学 ²香港科技大学
## 1 引言
当多模态模型控制工具时,幻觉的类型发生了改变。错误的描述仍然是答案质量错误。然而,错误的发票字段或按钮位置却可能触发工具调用。即使没有遵循恶意提示,一个断言了虚假感知前提条件的模型也会让智能体运行时拥有执行不安全动作的依据。当前的评估在错误的分界线上划分这种失效。视觉-语言幻觉研究衡量的是不存在的物体、属性、关系、OCR字符串和推理链(Li 等,2023 (https://arxiv.org/html/2605.19192#bib.bib2);Bai 等,2024 (https://arxiv.org/html/2605.19192#bib.bib3);Liu 等,2025 (https://arxiv.org/html/2605.19192#bib.bib4)),而语言层面的基准测试则检验相关的事实性失败(Bang 等,2025 (https://arxiv.org/html/2605.19192#bib.bib5))。反过来,提示注入和智能体安全研究衡量的是不可信内容是否改变了智能体的行为(Perez 和 Ribeiro, 2022 (https://arxiv.org/html/2605.19192#bib.bib6);Greshake 等,2023 (https://arxiv.org/html/2605.19192#bib.bib7);Bagdasaryan 等,2023 (https://arxiv.org/html/2605.19192#bib.bib8);Debenedetti 等,2024 (https://arxiv.org/html/2605.19192#bib.bib9);Wang 等,2025 (https://arxiv.org/html/2605.19192#bib.bib13))。已部署的多模态智能体结合了这两种失效模式:模型可能读取不可信的视觉内容,推断出一个虚假的世界状态,并将该状态传递给工具。无论是“模型是否产生了幻觉?”还是“模型是否遵循了注入的指令?”,都没有提出对安全性至关重要的问题:一个不受支持的主张是否改变了动作的授权?动作前提条件才是正确的分析单元。浏览器点击只有在目标元素存在且与任务匹配时才是安全的。电子邮件要求收件人和内容源自可信的用户意图。对于文档提取,字段值必须在所述区域中视觉存在。这些谓词是可检查的且针对特定工具。如果运行时将它们接受为自由形式的MLLM文本,那就将观察、解释、指令和权限合并到了一个字符串中。一旦通道合并,提示过滤就无法可靠地区分攻击和模型自身的错误信念。
我们让动作关键的感知携带证据。携带证据的多模态智能体(ECA)为现有的MLLM智能体包裹了一个独立的证据层。MLLM可以解释任务并提出工具调用,但它不能为授权这些调用的谓词发出高信任度证据。受约束的验证器则为OCR片段、UI元素、物体存在、空间关系、文档字段和来源溯源产生类型化证书。然后,一个策略门控仅在动作参数具有所需类型、范围、信任标签和置信度的证书时,才执行工具调用。
参见图注
图 1:携带证据的多模态智能体(ECA)。单个观察 o ∈ O 提供两条严格并行、对称的通道。*上方(不可信)*:MLLM 提出一个动作;动作模式 G_a 声明了必须被认证的谓词。*下方(可信)*:受约束的验证器消费原始观察并发出类型化证书 e = (τ, v, r, s, ν, κ, t, λ)。确定性门控 Π(a, E) 仅在 G_a 中的每个谓词都有证书匹配时才授权执行;自由形式的 MLLM 文本在结构上不可作为证据(×)。
由于 OCR、UI 解析和检测在实际中都会失败,该设计假设不完美的感知而不是隐藏它。ECA 将*不可审计的* MLLM 风险转化为*可审计的* 验证器风险。当 MLLM 产生幻觉时,失败是不可见的,因为用户和系统都无法区分错误信念和正确信念。而当受约束的验证器失败时,失败具有可测量的特征:针对特定输入类的特定谓词上的假阳性,可量化为 ε_p。这种从不透明到透明的转变是架构上的贡献。
从概念上讲,ECA 将信息流控制和能力系统的分离原则专门化到了多模态感知领域,保护那些使动作参数安全的特定谓词。
本文有五个贡献:
1. **形式化与架构。** 我们定义了*幻觉到动作的转换*(H2AC):不受支持的感知主张成为动作权限。ECA 通过要求动作关键谓词具有类型化证据证书来防止这种转换,并给出了跨模态佐证界限(命题2 (https://arxiv.org/html/2605.19192#Thmproposition2))。
2. **多层面评估。** 我们在三个证据层面评估边界:对抗性验证器红队测试(1900次攻击;门控绕过率 15% → 1.3%)、内容派生的 DOM+OCR+可访问性执行(200个端到端和120个浏览器任务上的 0% UAR),以及在 7488 个 GPT-5.4 轨迹上的预言器证书重放。
3. **结构性门控 vs. 神经判断。** 对 500 个任务的直接 HACR 审计显示,不受支持的主张在无防御的智能体中会到达执行,但 ECA 不会。五种 GPT-5.4 判断器变体(79–99% UAR)和一个 Progent 风格的对抗性探测(23.3% UAR vs. ECA 的 0%)表明,在此威胁模型下,神经信任评估是错误的强制点。
4. **带具体修复的对抗性红队测试。** 四个针对性的修复将门控绕过率从 15% 降至 1.3%,覆盖 19 个攻击类别:DOM 来源交叉引用、UTS #39 易混淆字符检测、可访问性-DOM 完整性验证、以及感知哈希 OCR 加固。
5. **端到端部署与模式可扩展性。** 端到端评估达到 0% UAR(Wilson 95% 置信上限 < 3%);没有跨模态佐证时,40% 的信念流攻击绕过门控。一个三阶段模式修复流水线在专家签字后,将谓词召回率从 46% 提升至 12 个工具 API 上的 100%(每个工具 < 1 分钟)。
门控层面的零值是设计属性,其条件取决于验证器的正确性。ε_p 矩阵衡量了该条件在哪里失效以及哪些修复减少了残留。
对于自然语言处理而言,贡献不在于新的解析器或更大的幻觉基准,而在于一个语言到动作的授权边界,它要求多模态上下文中的主张在影响工具权限之前被表示为类型化谓词。
## 2 相关工作
#### 多模态幻觉。
CHAIR 风格指标、POPE 风格探测和统一检测器衡量不受支持的视觉主张(Rohrbach 等,2018 (https://arxiv.org/html/2605.19192#bib.bib1);Li 等,2023 (https://arxiv.org/html/2605.19192#bib.bib2);Chen 等,2024 (https://arxiv.org/html/2605.19192#bib.bib23);Bai 等,2024 (https://arxiv.org/html/2605.19192#bib.bib3)),而扩展推理可能加剧此类错误(Liu 等,2025 (https://arxiv.org/html/2605.19192#bib.bib4))。语言层面的幻觉基准评估事实性失败(Bang 等,2025 (https://arxiv.org/html/2605.19192#bib.bib5))。这些工作都没有区分低影响错误和会翻转工具调用决策的错误。
#### 提示注入与智能体安全。
经典的提示注入导致模型覆盖之前的指令(Perez 和 Ribeiro, 2022 (https://arxiv.org/html/2605.19192#bib.bib6))。间接变种将攻击嵌入网页、电子邮件和检索内容中(Greshake 等,2023 (https://arxiv.org/html/2605.19192#bib.bib7);Yi 等,2025 (https://arxiv.org/html/2605.19192#bib.bib14);Abdelnabi 等,2025 (https://arxiv.org/html/2605.19192#bib.bib15)),而多模态模型将攻击面扩展到图像通道(Bagdasaryan 等,2023 (https://arxiv.org/html/2605.19192#bib.bib8);Nagaraja 等,2025 (https://arxiv.org/html/2605.19192#bib.bib26))。AgentDojo 和 AgentVigil 提供了红队测试环境(Debenedetti 等,2024 (https://arxiv.org/html/2605.19192#bib.bib9);Wang 等,2025 (https://arxiv.org/html/2605.19192#bib.bib13)),而 MELON、Progent 和 TaskShield 则防御指令流攻击(Zhu 等,2025 (https://arxiv.org/html/2605.19192#bib.bib20);Shi 等,2025 (https://arxiv.org/html/2605.19192#bib.bib19);Jia 等,2025 (https://arxiv.org/html/2605.19192#bib.bib21))。ECA 隔离了一条不同的因果路径:模型无需遵循可见的命令,如果它能幻觉出使命令变的多余的谓词的话。
#### 接地、验证与信息流。
检索、OCR、检测和 UI 解析器可以检查模型输出的部分内容,但验证只有在运行时将证据绑定到权限时才提高安全性。信息流控制和能力风格防御提供了缺失的抽象(Wu 等,2024 (https://arxiv.org/html/2605.19192#bib.bib22);Costa 等,2025 (https://arxiv.org/html/2605.19192#bib.bib17);Debenedetti 等,2025 (https://arxiv.org/html/2605.19192#bib.bib18);Beurer-Kellner 等,2025 (https://arxiv.org/html/2605.19192#bib.bib16))。ECA 在动作关键感知谓词的粒度上应用了这一原则,粒度比整个提示或工具权限更细。最接近的系统级相关工作的是 CaMeL(Debenedetti 等,2025 (https://arxiv.org/html/2605.19192#bib.bib18)),它在一个特权运行时中跟踪类型化值。ECA 针对的是不同的受保护单元:浏览器动作仅在诸如 safe_source、ui_element 或 document_field 等谓词通过外部证据通道认证后才能被授权;MLLM 自身的文本永远不会升级为可信值。这种差异之所以重要,是因为危险的对象往往不是注入的命令,而是据称的视觉或文档事实,该事实使一个特权动作看起来是被允许的(机制层面的对比见附录表3 (https://arxiv.org/html/2605.19192#A1.T3))。
更广泛的 VLA 安全领域(Li 等,2026b (https://arxiv.org/html/2605.19192#bib.bib27))将推理时护栏识别为关键防御类别。ECA 通过在类型化证据证书上对提议的动作进行门控来实例化这一原则。这些工作路线提供了部件,但留下了它们交叉的未探索区域:当一个不受支持的感知主张授权了一个工具调用时会发生什么?
## 3 威胁模型与问题定义
### 3.1 智能体设定
一个多模态智能体接收观察 o∈O(截图、DOM 片段、文档或检索内容),并可能执行动作 a∈A(点击、输入、发送邮件、加载 URL 或提取数据)。智能体在将主张转化为动作之前,先将观察转化为主张。令 C(o) 表示智能体在决定一个动作时使用的主张。
###### 定义 1(动作关键谓词)。
在观察 o 和可信指令 u 下,对于动作 a,如果翻转谓词 p(同时保持可信指令和工具策略不变)会改变对 a 在 {允许, 询问, 阻止} 中的正确策略决策,则 p 是动作关键的。
这区分了事实错误与安全相关性。标题中幻觉的物体可能无关紧要,但支付指令中幻觉的收款人就很重要,因为它改变了权限结构。
### 3.2 幻觉到动作的转换
每个安全敏感的动作都携带前提条件,即使智能体运行时将它们保留为隐式。如果存在 p∈Φ_a 使得智能体将 p 视为真,但 p 是假的、不存在的或仅从不可信内容中推导出来的,则动作 a 具有*不受支持的前提条件*。
###### 定义 2(幻觉到动作的转换)。
当 MLLM 生成或采用的某个不受支持的主张满足、替代或掩盖了所需的动作前提条件,从而改变了所执行的动作时,就会发生幻觉到动作的转换(H2AC)。
#### HACR 指标。
我们在行为边界上衡量失败:HACR = N_不安全执行 / N_不受支持的关键主张,其中 N_不安全执行 统计了至少有一个不受支持的动作关键主张的执行的不安全动作,N_不受支持的关键主张 统计了动作关键的不受支持的主张。HACR 不替代幻觉指标;它回答的是哪些不受支持的主张到达了执行。HACR 需要主张层面的不受支持谓词标注。因此,我们在完整的基准测试套件上报告 UAR,并在一个分层的 500 任务子集上报告直接的 HACR 审计(§5.2 (https://arxiv.org/html/2605.19192#S5.SS2.SSS0.Px4))。使用 Claude Opus 4.7 对 150 个主张进行的模型辅助一致性检查在动作关键性上有 95.3% 的符合率,在分组谓词映射上有 κ=0.58。我们不将其视为人工标注间一致的替代(附录A.21 (https://arxiv.org/html/2605.19192#A1.SS21))。
### 3.3 威胁模型
攻击者控制观察的一部分,但不控制可信的用户指令、系统策略或工具实现。我们区分两条攻击路径:(1)**指令路径**,不可信内容中包含智能体遵循的命令;(2)**虚假前提路径**,不可信或模糊的内容导致智能体相信某个前提条件为真(例如,“页面显示了官方域名”)。大多数提示注入防御针对的是指令路径。ECA 兼顾两者,但其主要贡献在于虚假前提路径,因为此类攻击完全绕过了指令分类器。跨模态佐证的可信根基是用户指令、浏览器/操作系统来源元数据,以及在页面内容之外维护的显式白名单。如果攻击者共同控制了 DOM、渲染的像素、可访问性树、视觉探测器或 OCR 引擎,则 ECA 门控的保证退化为基础的验证器假阳性率 ε_p。它在那种对抗性语境中的特定值为 §4.3 和 §5.1 提供了基础。相似文章
LegalHalluLens:类型化幻觉审计与校准的多智能体辩论,实现可信赖的法律AI
本文介绍了LegalHalluLens,一个用于审计法律AI中幻觉的框架,提供类型化幻觉档案和风险方向指数,以提升可信赖部署。
基于智能体AI、嵌套学习与语义缓存的幻觉缓解及AI可持续性
本文提出了一种记忆增强的多智能体架构,采用嵌套学习、连续记忆系统和语义缓存来缓解LLM流程中的幻觉问题,在显著减少事实错误的同时提高了运营效率。
信任但验证:通过事后对抗性审计和多智能体反馈循环减轻医疗幻觉
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。
AI代理中的操作幻觉与安全漂移
本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。
幻觉 = 想象力
一位开发者在构建AI代理封装系统时发现,代理对用户回复的幻觉实际上有助于解决问题,并提议将此类幻觉视为想象中的事件而非错误。