揭示VLM可解释的故障模式

arXiv cs.AI 论文

摘要

本文介绍了Revelio,这是一个通过搜索离散概念组合来系统性地发现视觉语言模型(VLM)中可解释故障模式的框架。应用于自动驾驶和室内机器人领域,它揭示了此前未报道的、可能导致碰撞或安全危险的漏洞。

arXiv:2605.12674v1 公告类型:new 摘要:视觉语言模型(VLM)因其广泛的推理能力和最少的任务特定工程泛化能力,越来越多地应用于安全关键型应用。尽管有这些优势,它们在特定的真实世界场景中可能表现出灾难性故障,从而形成故障模式。 我们引入了REVELIO,这是一个用于系统性揭示VLM中可解释故障模式的框架。我们将故障模式定义为可解释的、领域相关概念的组合(如行人接近度或恶劣天气条件),在这些概念下,目标VLM会持续表现出错误行为。识别此类故障需要在指数级增长的离散组合空间中进行搜索。为应对这一挑战,REVELIO结合了两种搜索程序:一种基于多样性感知的束搜索,能够高效地映射故障景观;以及一种高斯过程汤普森采样策略,能够更广泛地探索复杂的故障模式。 我们将REVELIO应用于自动驾驶和室内机器人领域,揭示了最先进的VLM中此前未报道的漏洞。在驾驶环境中,这些模型通常表现出空间定位能力弱,且未能考虑主要障碍物,导致会引发模拟碰撞的建议。在室内机器人任务中,VLM要么遗漏安全危险,要么表现得过于保守,产生误报并降低运行效率。通过识别结构化和可解释的故障模式,REVELIO提供了可操作的见解,能够支持针对性的VLM安全改进。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:13

# 揭示VLM可解释的故障模式
来源: https://arxiv.org/html/2605.12674

Isha Chaudhary  
UIUC  
&  
Vedaant V Jain*1  
Kumo AI  
&  
Kavya Sachdeva  
UIUC  
&  
Sayan Ranu  
IIT Delhi  
&  
Gagandeep Singh  
UIUC  

###### 摘要

视觉-语言模型(VLM)因其广泛的推理能力和以最少的任务特定工程就能泛化的能力,越来越多地被用于安全关键型应用。尽管有这些优势,它们在特定现实世界情境中仍可能表现出灾难性的失败,构成“故障模式”。我们提出Revelio,一个系统性地揭示VLM中“可解释”故障模式的框架。我们将故障模式定义为可解释的、领域相关概念(例如行人接近度或恶劣天气条件)的组合,目标VLM在这些条件下会持续表现出错误行为。识别此类故障需要在指数级增长的离散组合空间中进行搜索。为应对这一挑战,Revelio结合了两种搜索程序:一种多样性感知的波束搜索,用于高效地绘制故障图景;以及一种高斯过程汤普森采样策略,能够对复杂故障模式进行更广泛的探索。我们将Revelio应用于自动驾驶和室内机器人领域,揭示了最先进VLM中先前未报告的漏洞。在驾驶环境中,模型通常表现出较弱的空间定位能力,且未能考虑主要障碍物,导致其建议会在模拟中引发碰撞。在室内机器人任务中,VLM要么忽略安全风险,要么表现得过于保守,产生误报,降低操作效率。通过识别结构化和可解释的故障模式,Revelio提供了可操作的见解,能够支持有针对性的VLM安全改进。

## 1 引言

视觉-语言模型(VLM)(Wang等,2024 (https://arxiv.org/html/2605.12674#bib.bib191); Liu等,2023 (https://arxiv.org/html/2605.12674#bib.bib190); Team等,2026 (https://arxiv.org/html/2605.12674#bib.bib247))通过跳过对刚性、任务特定感知管道的需求,能够在图像和文本输入上进行开放世界语义推理,使其在自动驾驶汽车(AV)(Zhou等,2024 (https://arxiv.org/html/2605.12674#bib.bib248); Fime等,2025b (https://arxiv.org/html/2605.12674#bib.bib249))和机器人(Huang等,2024 (https://arxiv.org/html/2605.12674#bib.bib205); Bao和Li,2025 (https://arxiv.org/html/2605.12674#bib.bib5))等应用中极具潜力。然而,由于未能充分利用图像和文本模态的信息以及产生幻觉,它们经常出现故障,这使得其立即部署从根本上来说是不安全的。虽然这些灾难性错误看似不可预测,但通常是由特定条件(例如,自动驾驶汽车前方有障碍物并结合某些天气条件,图1 (https://arxiv.org/html/2605.12674#S1.F1))系统地触发的。为了精确告知VLM的固有风险,故障评估必须满足:(1) 现实性,(2) 对开发者具有可解释性,以及 (3) 系统性(揭示一致的漏洞而非孤立的异常)。

参照标题 参照标题 参照标题 参照标题

图1: 具有中等思考能力的 Gemini-3 (Flash) 在第一帧图像中建议 AV 减速(半制动强度),而不是紧急停车,理由是“骑行者距离不够近,不需要停车”,导致在接下来的帧中(在 CARLA (Dosovitskiy 等, 2017 (https://arxiv.org/html/2605.12674#bib.bib169)) 模拟中)与骑行者发生碰撞。

先前的VLM测试方法无法同时满足所有这些标准。静态基准(Duan等,2024 (https://arxiv.org/html/2605.12674#bib.bib251); Windecker等,2026 (https://arxiv.org/html/2605.12674#bib.bib264))在物理上是真实的,但属于被动评估。它们评估预定义的场景,但无法主动搜索广阔的输入空间以发现未知的、一致的漏洞。通过人工策展实现全覆盖是不可行的。相反,对抗性攻击(Zhang等,2024 (https://arxiv.org/html/2605.12674#bib.bib250); Fime等,2025a (https://arxiv.org/html/2605.12674#bib.bib263))提供了一种主动搜索机制,但它们依赖于连续的像素或嵌入层级的改变,这常常会使搜索偏离自然数据流形。因此,它们会产生物理上不真实、不可解释的故障,而不是识别出VLM持续失败的现实配置。最近的系统(Chaudhary等,2025 (https://arxiv.org/html/2605.12674#bib.bib204))使用现实模拟来验证预定义的VLM安全规范。然而,它严格充当给定规范的验证器,缺乏发现漏洞所需的主动搜索。为了克服这些限制,有意义的的安全评估必须将主动发现与语义层面的真实感结合起来。我们建议将搜索空间从像素转移到离散语义。通过主动搜索结构化为可解释“概念”(例如,接近度 ∩ 障碍物类型 ∩ 天气条件)的逻辑合取形式的VLM故障模式,我们超越了轶事式的故障案例,转向风险的结构化抽象,促进有针对性的方法来提高VLM安全性。

**关键挑战。** (1) 虽然开发者对要测试的概念有直观的想法,但他们缺乏正确的抽象来指定和评估这些概念,特别是在研究复杂场景时。 (2) 概念组合的指数级组合空间需要高效的故障模式搜索算法。 (3) 一些最先进的VLM是闭源的(Anthropic,2025 (https://arxiv.org/html/2605.12674#bib.bib252); Google DeepMind,2025a (https://arxiv.org/html/2605.12674#bib.bib219)),无法进行白盒分析。

**本文工作。** 我们提出Revelio,一个新颖的框架,它将领域特定的概念定义为图像场景图(Chang等,2023 (https://arxiv.org/html/2605.12674#bib.bib171))的子图,并将它们转化为用于评估一致故障的场景分布。Revelio集成了可互换的渲染引擎,例如通过Scenic(Fremont等,2019 (https://arxiv.org/html/2605.12674#bib.bib166))集成的行业标准CARLA模拟器(Dosovitskiy等,2017 (https://arxiv.org/html/2605.12674#bib.bib169)),从而允许通过交换概念分类法和模拟器将其扩展到新领域。为了评估闭源VLM,Revelio采用黑盒方法,通过对场景分布进行采样来评估概念集的故障率。为了在指数级组合空间中导航,Revelio提供了两种搜索算法来平衡探索与利用:一种多样性感知的波束搜索,用于快速绘制故障图景;以及一种基于汤普森采样的高斯过程全局搜索。

**贡献**

*   我们开创性地使用现实的、可解释的概念而非孤立的对抗性输入来评估VLM。我们提出了一个新颖的框架,将VLM故障模式正式定义为触发“一致”故障的特定共现领域特定概念集合。
*   我们将故障模式发现作为一个黑盒约束搜索问题,以发现多个故障模式,同时受限于概念之间的物理兼容性约束。为了平衡探索与利用,我们的框架Revelio提供了两种搜索策略:多样性感知的波束搜索和基于高斯过程的汤普森采样。
*   我们的实验揭露了最先进VLM中关键的、先前未知的漏洞。定性分析上,我们强调了VLM在自动驾驶空间定位上的严重脆弱性(例如,在行人附近做出错误的停止/继续决策)以及在室内机器人中过度的、损害性能的过度谨慎。在这两个应用中,模型还一致地忽略了危险元素,如附近的障碍物和尖锐物体。定量分析上,在相同预算下,Revelio平均发现的无引导随机搜索多3-5倍的故障模式。我们的代码可在 https://github.com/uiuc-focal/Revelio 获取。

## 2 相关工作

**具身应用中VLM的安全性与鲁棒性。** VLM越来越多地被集成到自动驾驶汽车和机器人中(Fime等,2025b (https://arxiv.org/html/2605.12674#bib.bib249); Huang等,2024 (https://arxiv.org/html/2605.12674#bib.bib205); MohajerAnsari等,2026 (https://arxiv.org/html/2605.12674#bib.bib266)),其性能已在各种静态基准上得到验证(Xie等,2025 (https://arxiv.org/html/2605.12674#bib.bib258); Zheng等,2022 (https://arxiv.org/html/2605.12674#bib.bib259); Zhao等,2025 (https://arxiv.org/html/2605.12674#bib.bib260); Saxena等,2026 (https://arxiv.org/html/2605.12674#bib.bib261); Windecker等,2026 (https://arxiv.org/html/2605.12674#bib.bib264); Chang等,2026 (https://arxiv.org/html/2605.12674#bib.bib276))。然而,这些精选数据集常常无法识别出聚合指标之外的可解释的系统性漏洞。虽然对抗性攻击方法(Wang等,2026 (https://arxiv.org/html/2605.12674#bib.bib262); Zhang等,2024 (https://arxiv.org/html/2605.12674#bib.bib250); Fime等,2025a (https://arxiv.org/html/2605.12674#bib.bib263); Wu等,2025 (https://arxiv.org/html/2605.12674#bib.bib265))揭示了最坏情况下的行为,但它们通常产生缺乏现实性或泛化能力的单点故障。相比之下,我们的方法针对的是现实、可解释且对应于高层语义概念的故障“模式”,而非特定的、不可行的输入。

**VLM对齐。** 尽管VLM通常会为了安全性而对齐(Liu等,2024 (https://arxiv.org/html/2605.12674#bib.bib267); Meng等,2025 (https://arxiv.org/html/2605.12674#bib.bib268); Zhang等,2025 (https://arxiv.org/html/2605.12674#bib.bib269); Li等,2025 (https://arxiv.org/html/2605.12674#bib.bib270)),但它们仍然保留着可能在高风险场景中造成灾难性后果的潜在漏洞。Revelio识别出这些系统性的故障模式,可以指导为安全关键鲁棒性所需的有针对性的微调。

**AI系统中的语义故障模式。** 现有文献(Kumar等,2019 (https://arxiv.org/html/2605.12674#bib.bib273); Jain等,2026 (https://arxiv.org/html/2605.12674#bib.bib272); Vinay,2025 (https://arxiv.org/html/2605.12674#bib.bib274); Cemri等,2025 (https://arxiv.org/html/2605.12674#bib.bib275))通常通过聚类对抗性攻击产生的故障来事后识别漏洞。与Revelio不同,这些方法通过低层次的文本或像素变异在开放式的输入空间中导航,这通常缺乏现实性,并且无法捕捉物理上可落地的、复合的因素。由于它们在结构上为这种无约束的扰动而设计,将它们应用于基于模拟器的环境将需要大量的重新工程,排除了直接比较的可能性。此外,它们依赖于人工或基于LLM的聚类,这引入了标注者偏差,可能掩盖真正的因果因素。最后,虽然基于概念的可解释AI(XAI)(Poeta等,2025 (https://arxiv.org/html/2605.12674#bib.bib271); Lee等,2024 (https://arxiv.org/html/2605.12674#bib.bib277); Sun等,2023 (https://arxiv.org/html/2605.12674#bib.bib278))使用了概念分类法,但它侧重于解释平均行为,而非主动的压力测试。

## 3 发现可解释的故障模式

我们首先正式定义视觉-语言模型(VLM)M 输入(图像 I 和文本提示 P)的可能特征空间,故障模式将从中系统地识别出来。我们通过“概念”的存在来刻画它们,例如,自车前方有一名骑自行车者(图2(a) (https://arxiv.org/html/2605.12674#S3.F2.sf1))。实际应用通常具有简单且通用的提示,涉及一组固定的相关风险监控和控制动作(例如,“车辆是否应施加紧急制动?”)。因此,场景的关键描述元素在于对所提供的图像的感知。因此,在实际安全关键应用中,VLM的关键故障是由对提示中图像的感知不准确引起的。

参照标题 (a) 概念图像:自行车骑行者、附近障碍物、红色交通灯  
自车-自行车骑行者-雨-障碍物-交通灯(绿色垃圾箱)(红色)-前方-附近-前方  
(b) 图像的场景图  
图 2: 场景图

我们首先定义场景图(Chang等,2023 (https://arxiv.org/html/2605.12674#bib.bib171))G = (V, E, A),它抽象地表示图像 I。G 的节点 V ⊂ U_ent 代表物理实体,如障碍物、行人、交通灯等,来源于所有可能的现实世界实体 U_ent 的符号宇宙。边 E ⊂ U_ent × U_ent 编码节点之间的有向空间和语义关系,例如,自车前方的自行车骑行者或附近的障碍物。A: (V ∪ E) → ℘(U_attr) 使用来自所有属性 U_attr 的符号宇宙中的属性(如方向、材质或实体间距离)来注释每个节点和边。图 2(b) 显示了图 2(a) 的场景图。

### 3.1 概念

一个概念 c 是用户定义的场景图子图,捕获其某些属性。它对应于特定节点、边关系或节点与边的属性映射等组成部分的存在。例如,`自行车骑行者` 是一个具有一个“自行车骑行者”节点的概念,该节点通过将其定位在图像“前方”所必需的默认边连接到“自车”车辆节点,从而产生子图 `自车-自行车骑行者-前方`。基于概念的故障分析需要知道不仅存在哪些对象,而且具体哪些状态属性与故障相关。我们必须能够修改默认的子图属性,例如,将天气实体的属性从默认的晴朗天气修改为雨天。因此,我们引入了概念修饰符 cm,它们是注释函数,在不添加新对象的情况下,指定现有节点/边上的特定属性。cm: (V ∪ E) → ℘(U_A)。所有概念和概念修饰符 Γ 的集合由用户为给定领域定义。对于任何子集 C ⊆ Γ,我们定义一个“锚定场景图” G*_C = (V*, E*, A*),它由 C 中概念所要求的所有节点和边组成,其默认属性被修饰符覆盖。具体来说,概念通过它们各自的节点、边和属性映射的简单联合来组合,而修饰符随后更新所得的属性映射 A*。并非所有组合 C 在物理上都是可能的。设 φ: ℘(Γ) → {true, false} 是一个函数,它基于物理模拟确定任何集合的有效性,对有效组合返回真。概念集的有效性在运行时通过渲染其对应的图像来检查。实际上,

相似文章

CaVe-VLM-CoT:一个可解释的视觉-语言模型框架

arXiv cs.AI

CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。

OneVL:基于视觉语言解释的单步隐式推理与规划

Hugging Face Daily Papers

# 论文页面 - OneVL:基于视觉语言解释的单步隐式推理与规划 来源:[https://huggingface.co/papers/2604.18486](https://huggingface.co/papers/2604.18486) 发布于 4月20日 [\#1 每日论文](https://huggingface.co/papers/date/2026-04-21) 作者:, , , , , , , , , , , , , , , , , , , , ## 摘要 OneVL 提出了一个统一的视觉-语言-行动框架,通过整合语言和 v