低成本概念级局部解释:无训练方法能走多远?

arXiv cs.AI 论文

摘要

本文评估了多模态大语言模型(MLLMs)在图像局部概念命名中的零样本能力,提出了一种可复现的评估协议,在无训练的情况下实现了62-88%的对象级准确率。

arXiv:2606.29069v1 Announce Type: new 摘要:基于概念的可解释人工智能(C-XAI)旨在提供基于语义概念的人类可理解解释,然而由于细粒度概念标注的稀缺性,其验证受到限制。我们评估了中等规模的多模态大语言模型(MLLMs)在严格零样本条件下,通过为对象和部件级别的边界框区域分配标签,执行局部概念命名的能力。我们提出了一种可复现的零样本评估协议,用于概念命名(CoNa),包括(i)针对中等词汇量的封闭集、类别约束提示,以及(ii)基于嵌入相似性的开放集策略Open-CoNa,适用于大规模标签空间。在四个MLLM(7B-32B)上的实验显示,跨数据集的一致性能趋势,达到62%-88%的对象级精确匹配准确率,突显了从局部区域进行无训练概念标注的潜力。我们讨论了局限性和失败模式,并发布了一个可复现的框架,以支持未来的低成本C-XAI研究。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:32

# 低成本基于概念的局部解释:无需训练的方法能达到什么程度?
来源:https://arxiv.org/html/2606.29069
Darian Fernández-Gutiérrez¹,²\*, Rafael Bello¹, Marilyn Bello²及 Natalia Díaz-Rodríguez²
¹拉斯维利亚斯中央大学"玛尔塔·阿布雷乌"计算机科学系,古巴圣克拉拉,50100
²格拉纳达大学计算机科学与人工智能系,西班牙格拉纳达,18071
\*通讯作者:[email protected]

###### 摘要

基于概念的可解释AI(C-XAI)寻求以语义概念为基础的人类可理解解释,然而,由于缺乏细粒度的概念标注,其验证受到限制。我们评估了中等规模的多模态大语言模型(MLLMs)是否能够在严格的零样本条件下,通过为边界框区域(在对象和部件两个层级)分配标签来执行局部概念命名。我们提出了一种可复现的零样本评估协议,用于概念命名(CoNa),其中包含:(i) 针对中等词汇量的封闭集、类别约束提示,以及 (ii) 面向大规模标签空间的基于嵌入相似度的 Open-CoNa 策略。对四种 MLLM(7B–32B)的实验显示,不同数据集上的性能趋势一致,对象级精确匹配准确率达到 62%–88%,凸显了从局部区域进行免训练概念标注的潜力。我们讨论了局限性和失败模式,并发布了一个可复现的框架,以支持未来的低成本 C-XAI 研究。

## I. 引言

近期 MLLM 的零样本能力激励了它们在多模态可解释性中的应用,其中语言利用文本中的最接近表示(如 CLIP[19](https://arxiv.org/html/2606.29069#bib.bib9))为图像提供快速标注能力。然而,多模态模型通常依赖于配对的图像-文本训练,而当前的可解释人工智能(XAI)[1](https://arxiv.org/html/2606.29069#bib.bib12)、[4](https://arxiv.org/html/2606.29069#bib.bib13) 方法在为这类系统提供底层、细粒度的解释方面仍然有限。细粒度标注通常不可用,因此解释通常保持粗糙,对详细检查的支持有限。此外,即使决策过程是透明的,这也不能保证可审计性,尤其是对于非技术受众[2](https://arxiv.org/html/2606.29069#bib.bib7)。

基于概念的可解释AI(C-XAI)旨在通过将解释建立在自然语言语义概念而非原始特征(如像素)上,使其更加符合人类认知[18](https://arxiv.org/html/2606.29069#bib.bib8)。这与高风险人工智能系统的透明度要求(联合国教科文组织原则和欧盟人工智能法案)[7](https://arxiv.org/html/2606.29069#bib.bib14)相符。

近年来MLLM作为零样本学习工具的成功,使得视觉概念的文本编码对可解释视觉概念的自动标注变得有用。然而,在解释视觉语言模型(VLM)的背景下,一个挑战在于模型理解(即识别和定位视觉上的)粒度概念¹,即理解图像任何区域中细粒度和粗粒度的概念。这一点已被VLM展示的语言衍生偏差所证明[15](https://arxiv.org/html/2606.29069#bib.bib15)。

¹ 这种区分在基于概念的可解释AI方法中至关重要,其中解释必须依赖于对终端用户清晰、连贯且可理解的语义单元[10](https://arxiv.org/html/2606.29069#bib.bib5)。

由于手动标注对象和部件级别既昂贵又难以规模化[8](https://arxiv.org/html/2606.29069#bib.bib1),因此评估当前中小规模MLLM是否能在严格的零样本设置下可靠地为局部区域分配语义标签非常重要。这种能力将支持细粒度C-XAI的半自动标注工作流。然而,词汇量大小、区域类型、提示设计以及幻觉等因素对性能的影响仍未被充分理解[12](https://arxiv.org/html/2606.29069#bib.bib20)。

本工作的目标是对中小规模多模态模型(最高32B参数)进行严谨且系统的评估,以确定它们在零样本模式下识别局部视觉概念的能力。为此,我们提出了一个受控的实验协议,其中每个模型接收一张图像和一个限定区域(边界框),以及一组封闭的候选标签,模型必须从中为视觉内容选择最合适的概念类别。分析同时在对象级别和细粒度的部件级别进行,从而能够比较模型对不同语义粒度层次的敏感性。本研究的主要贡献如下:

- • 提出了一种名为概念命名(CoNa)和Open-CoNa的零样本评估协议,用于测量中小规模MLLM为局部视觉区域分配语义标签的能力。该流水线以图像及相应的边界框作为输入,确保受控的、特定区域的评估。
- • 对多个MLLM在对象级和部件级视觉命名准确性以及“未知”类别率进行了分析,使用PASCAL-Part、ADE20K和LIP数据集进行评测,这些数据集均包含概念级标注的真实值。
- • 提供了经验证据,揭示了中等规模MLLM在半自动概念数据集构建工作流中未来集成的潜力和局限性。

## II. 相关工作

越来越多的研究正在考察多模态模型在零样本视觉推理方面的能力和局限性。这些模型在大规模图像-文本语料库上进行预训练,将视觉和语言信息整合到一个共享的嵌入空间中,使其能够在没有任务特定微调的情况下为图像区域分配语义标签。虽然全局能力被广泛研究,但它们在局部概念级命名约束下的行为仍然探索不足。这促使我们对可靠的对象和部件级命名进行系统评估。

多模态模型与零样本视觉推理

大规模多模态预训练学习共享的视觉-语言嵌入,将图像和文本对齐到一个统一的表示空间中。CLIP 表明,在图像-文本对上进行对比训练可以产生强大的语义对齐,并实现无需任务特定微调的零样本识别,为许多后续的多模态基础模型奠定了基础[19](https://arxiv.org/html/2606.29069#bib.bib9)。

本研究重点关注低规模和中等规模的多模态模型(最高32B参数),它们在推理能力与在现实世界中部署的可行性之间提供了良好的平衡。本工作评估的模型——LLaVA 1.6-7B、Gemma 3-12B、Mistral Small 3.1 和 Qwen2.5-VL-32B——是根据它们各不相同的多模态对齐机制及其在区域级推理方面的相关性而选定的。然而,之前对这些模型的评估主要集中于全局任务,如图像描述、OCR 或 VQA,而没有考察它们在受限于从封闭词汇表中识别局部概念时的行为,而这对于 C-XAI 来说是至关重要的要求。

通过概念级命名进行细粒度标注

现有的概念提取技术,如 TCAV[10](https://arxiv.org/html/2606.29069#bib.bib5)、ACE[8](https://arxiv.org/html/2606.29069#bib.bib1) 和概念瓶颈模型[11](https://arxiv.org/html/2606.29069#bib.bib4),依赖于精心策划的概念数据集和监督训练流程。这些方法假设有意义且符合人类认知的概念已经可用,但没有解决自动获取对象级或部件级概念标签的挑战。

最近关于开放词汇检测和部件分割的工作(例如,GroundingDINO[14](https://arxiv.org/html/2606.29069#bib.bib6))可以定位或分割新类别,但这些模型仍然依赖于具有显式视觉-语言对应关系标注的数据集,或者依赖于需要指定要检测哪个概念的可提示检测器。这阻止了评估它们内在理解符合人类认知概念的能力,并且它们的性能通常在部件级别下降。

相比之下,我们的工作评估了MLLM是否可以作为免训练的概念标注器,在无需额外监督的情况下为局部区域分配语义标签。这通过评估它们在具有预定义概念分类法的严格零样本、低成本条件下的内在命名能力,填补了这一空白。

局部识别与零样本约束

Segment Anything Model(SAM)[5](https://arxiv.org/html/2606.29069#bib.bib21) 的引入将定位与分类解耦,实现了模块化流水线,其中一个组件确定区域在哪里,另一个确定它代表什么。遵循这一观点,我们假设区域已被准确定位(例如,通过 SAM³),并重点关注在零样本约束下 MLLM 是否能分配连贯的概念标签。

³ 在本文的实验中,我们使用真实边界框来避免定位误差混淆对命名能力的评估。

重要的是,虽然可提示的分割器(例如,SAM³)需要概念名称作为输入,但为了正确审计 C-XAI,我们不应该假定用户或模型预先知道图像中存在哪些概念。尽管近期取得了进展,但对中等规模 MLLM(≤32B)进行细粒度局部概念识别的系统评估仍然稀缺,特别是在以下方面:(1) 在封闭集约束下的对象级和对象部件级标注,(2) 使用大型标签空间(例如,ADE20K 的标签集无法适应上下文窗口)进行标注,(3) 预处理/分辨率与概念准确性之间的相互作用,以及 (4) 失败模式,如幻觉、歧义和明确的“未知”响应。

本研究通过提出一个可复现的协议来评估多模态模型作为零样本视觉概念标注器在给定概念分割掩码上的可靠性,从而填补这些空白,为基于概念的可解释AI[18](https://arxiv.org/html/2606.29069#bib.bib8)和在安全关键环境中的透明AI提供了经验证据。

## III. 方法论

本节描述了评估协议的设计,用于衡量低规模和中等规模MLLM在严格零样本条件下为局部视觉区域分配语义概念标签的能力。该方法旨在通过标准化所有变量来源(包括类别定义、提示结构、视觉预处理和推理约束)来隔离每个模型的内在视觉-语言对齐能力。整体流水线如图1所示。

参见说明图1:视觉概念命名(CoNa)流水线,封闭词汇设置。输入图像区域和预定义的类别字典通过概念类别约束(封闭方法)提示构建器组合,该构建器形成一个结构化提示,限制MLLM从候选列表中选择恰好一个标签。然后MLLM从允许的选项中生成最合适的概念名称,产生最终分配的标签。

类别字典与封闭集约束

对于每个数据集,概念字典是根据官方对象和部件标注自动提取的,确保真实语义与推理过程中可用的类别之间存在精确对应。添加了一个额外的token unknown,以捕获模糊或无法识别的预测。

除了ADE20K之外,所有数据集都采用封闭集机制。在这种设置下,模型需要从有效词汇中选择恰好一个类别,从而防止词汇漂移、幻觉标签或释义性响应。这一约束通过确保预测与真实值之间的任何差异都反映语义不一致性而非语言变异性,从而可以对概念对齐进行更清晰的评估。

提示构建与响应格式:为了在模型之间保持一致的文本条件,我们实现了标准化的、与数据集无关的提示构建器,所有提示都遵循相同的模板:

“为红色框内的对象选择一个标签。只能从以下选择:{...}。用一个词回答。”

将响应限制为单个词有三个目的:(i) 抑制指令调优模型中常见的生成漂移和长形式幻觉;(ii) 通过减少风格变异性确保跨架构的可比性;(iii) 允许模型输出与封闭集字典之间进行精确匹配。包含多个标记或字典之外类别的任何输出都被视为无效,并自动赋予unknown标签。

视觉预处理与区域划定

为了确保统一的视觉输入,所有图像都通过一个三步流水线处理:(1) 使用真实边界框或从分割掩码导出的紧致裁剪进行区域划定;(2) 使用固定填充进行上下文裁剪,以保留局部线索并避免过于紧致的裁剪;(3) 将所有区域调整为512×512像素,这是为了平衡细节和模型容量而选择的分辨率。这种标准化的预处理防止模型差异由裁剪大小、缩放级别或分辨率变化引起。

用于大型标签空间的基于嵌入的匹配

对于ADE20K,由于大型概念字典(约3000个标签)导致的提示长度约束,封闭集协议不实用。在这种情况下,模型生成一个自由形式的单字预测,然后使用图2中的基于嵌入的流程将其映射到最接近的有效类别。

参见说明图2:开放词汇概念命名(CoNa)流水线:MLLM不接收预定义的可能命名标签列表。相反,它为每个输入图像区域生成一个自由形式的单字描述。这个生成的术语,以及数据集定义的概念字典中的所有类别,都使用文本(此处为nomic-embed-text[17](https://arxiv.org/html/2606.29069#bib.bib16))编码器编码为向量。然后计算生成术语的嵌入与所有字典嵌入之间的余弦相似度(≥τ)。选择相似度最高的字典概念作为最终分配的标签,从而在不事先提供所有可能标签的情况下实现概念标注。
字典标签和模型输出都使用nomic-embed-text[17](https://arxiv.org/html/2606.29069#bib.bib16)文本嵌入进行编码,因为它能产生专门针对语义检索和比较任务优化的稳定嵌入。计算预测术语与每个字典条目之间的余弦相似度,分配对应于超过阈值τ的最高相似度的类别,该阈值经过调整以最大化与真实标签的一致性。

使用词嵌入而非句子嵌入有两个主要原因:(i) 字典来自数据集标签,主要由脱离上下文的名词组成;(ii) 为了评估的简单性(我们使用1-gram回答)。

## IV. 实验

表 I:评估用于零样本分割概念命名的低规模和中等规模 MLLM 的比较。我们考虑:低成本模型(定义为参数<1B的架构?但原文此处可能有误,后文列出的是7B-32B模型。根据表格,模型包括LLaVA-1.6-7B、Gemma-3-12B、Mistral-Small-3.1、Qwen2.5-VL-32B。我们将按原文翻译。)

(注:原文此处表格描述未给出完整表格行,但后续有比较。我们按原文翻译表格标题和接下来的内容。)

表 I:用于零样本分割概念命名的低规模和中等规模 MLLM 的比较。我们考虑:低成本模型(定义为参数低于 1B 的架构)和中成本模型(参数最高 32B)。所有模型均以标准配置加载,未进行任何微调。我们报告了对象级(Obj.)和部件级(Part.)的精确匹配准确率。每个数据集下的最佳结果以粗体显示,可识别的标注表示模型至少在一个类别上获得了正的准确率。

相似文章

基于大语言模型的零样本目标识别

arXiv cs.AI

本文首次系统性地对前沿大语言模型在经典PDDL规划基准上的零样本目标识别能力进行评估,发现部分模型能随证据积累而扩展性能,而另一些模型则始终依赖世界知识先验,不受观测累积影响。

上下文学习运作于概念子空间学习

arXiv cs.LG

本文提出,大型语言模型中的上下文学习通过低维概念子空间运作,任务相关信息集中在表示空间的一小部分中,并在Llama-3-8B和Qwen2.5-7B上通过实验得到支持。

面向以对象为中心的视觉推理的弱监督概念学习

arXiv cs.LG

本文提出了一种两阶段的神经符号框架,利用弱监督(仅需 1% 的标签)结合基于 Slot 的变分自编码器(VAE),学习用于以对象为中心的视觉推理的可解释符号,在领域泛化方面优于基础模型。