工业场景中的零样本学习:新的大规模基准、挑战与基线

arXiv cs.AI 论文

摘要

本文提出了一个用于零样本工业缺陷检测的大规模多模态数据集(MMIO),并介绍了改进文本-视觉提示(RTVP)方法,在该基准上取得了最优结果。

arXiv:2606.07965v1 公告类型:新 摘要:大型视觉语言模型(LVLMs)在视觉任务中取得了显著成功。然而,工业场景与自然场景之间的巨大差异使得应用LVLMs面临挑战。现有的LVLMs依赖用户提供的提示来分割对象,这常常因为包含无关像素而导致性能欠佳。此外,数据的稀缺也使得LVLMs在工业场景中的应用仍未被充分探索。为填补这一空白,本文提出了一个开放工业数据集和一个改进文本-视觉提示(RTVP)方法,用于零样本工业缺陷检测。首先,本文构建了包含8万多个样本的多模态工业开放数据集(MMIO)。MMIO涵盖了多样化的工业类别,包括6个超类与18个子类。MMIO是首个面向工业零样本学习的大规模多场景预训练数据集,并为未来工业场景中的开放模型提供了宝贵的训练数据。基于MMIO,本文专门针对工业零样本任务提出了RTVP。RTVP有两个显著优势:第一,本文设计了一种专家引导的大模型领域自适应机制,并基于Mobile-SAM设计了一种工业零样本方法,增强了大型模型在工业场景中的泛化能力。第二,RTVP直接从图像中自动生成视觉提示,并考虑了先前LVLM忽略的文本-视觉提示交互,从而提升了视觉与文本内容的理解。RTVP在MMIO的零样本和封闭场景中分别取得了42.2%和24.7%的AP,达到了SOTA。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:54

# 工业场景中的零样本学习:新的大规模基准、挑战与基线
来源:https://arxiv.org/html/2606.07965
张泽楷¹,陈庆辉¹,熊毛毛¹,丁世娇¹,苏展志²,姚心杰³,孙一鸣⁴,白聪⁵,张景琳¹

###### 摘要

大型视觉语言模型(LVLMs)在视觉任务中取得了显著成功。然而,工业场景与自然场景之间的巨大差异使得应用LVLM面临挑战。现有LVLM依赖用户提供的提示来分割目标,这常因包含不相关像素而导致性能欠佳。此外,数据稀缺也使LVLM在工业场景中的应用尚未得到探索。为填补这一空白,本文提出了一个开放的工业数据集和一种用于零样本工业缺陷检测的精炼文本-视觉提示(RTVP)。首先,本文构建了包含8万+样本的多模态工业开放数据集(MMIO)。MMIO包含多样化的工业类别,涵盖6个超类和18个子类。MMIO是首个面向工业零样本学习的大规模多场景预训练数据集,为未来工业场景中的开放模型提供了宝贵的训练数据。基于MMIO,本文提出了一种专门用于工业零样本任务的RTVP。RTVP具有两个显著优势:第一,本文设计了一种专家引导的大模型域适应机制,并基于Mobile-SAM设计了工业零样本方法,增强了大型模型在工业场景中的泛化能力。第二,RTVP直接从图像自动生成视觉提示,并考虑了此前LVLM忽略的文本-视觉提示交互,提升了视觉和文本内容的理解能力。RTVP在MMIO的零样本和封闭场景下分别达到42.2%和24.7%的AP,实现了最先进的性能。

## 引言

工业场景中的产品缺陷检测任务对保障用户安全起着重要作用。工业场景中的专家模型(Wang et al. 2022a (https://arxiv.org/html/2606.07965#bib.bib49); Ge et al. 2021 (https://arxiv.org/html/2606.07965#bib.bib11); Li et al. 2022a (https://arxiv.org/html/2606.07965#bib.bib24))通常使用单一领域的单模态数据,并严格遵循类别感知方法,这限制了模型处理多场景数据以及泛化到开放数据集的能力。近期,Segment Anything系列(SAMs)(Kirillov et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib76); Zhao et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib77); Zhang et al. 2023a (https://arxiv.org/html/2606.07965#bib.bib78))在遥感、医学等领域展现出强大的交互性和零样本能力。SAM的独特之处在于人机交互提示的设计,允许基于用户提供的点、线、框提示进行分割。(Zhang et al. 2025 (https://arxiv.org/html/2606.07965#bib.bib123), 2012 (https://arxiv.org/html/2606.07965#bib.bib124); Feng et al. 2021 (https://arxiv.org/html/2606.07965#bib.bib125); Gao et al. 2020 (https://arxiv.org/html/2606.07965#bib.bib126); Zhu et al. 2022 (https://arxiv.org/html/2606.07965#bib.bib127); Zhou et al. 2021 (https://arxiv.org/html/2606.07965#bib.bib128); Zhang et al. 2020 (https://arxiv.org/html/2606.07965#bib.bib129); Miao et al. 2021 (https://arxiv.org/html/2606.07965#bib.bib130); Ma et al. 2019 (https://arxiv.org/html/2606.07965#bib.bib131); Li et al. 2021 (https://arxiv.org/html/2606.07965#bib.bib132); Chen et al. 2025b (https://arxiv.org/html/2606.07965#bib.bib133), a (https://arxiv.org/html/2606.07965#bib.bib134), 2026 (https://arxiv.org/html/2606.07965#bib.bib135); Zhang et al. 2026a (https://arxiv.org/html/2606.07965#bib.bib136), 2023c (https://arxiv.org/html/2606.07965#bib.bib137), 2024 (https://arxiv.org/html/2606.07965#bib.bib138), b (https://arxiv.org/html/2606.07965#bib.bib139))

然而,由于工业场景中图像的背景、尺度和分布与自然场景存在显著差异(图2-a),在工业场景中应用SAM的预训练提示范式面临诸多重大挑战。如图1所示,现有SAM提示模式在处理复杂场景时,需依赖用户的提示(点、框、掩码)(Kirillov et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib76))来分割目标。用户的熟悉程度会显著影响特定提示的效果,并引入无关或噪声像素。

参见图注 图1:传统提示方法与RTVP的比较。RTVP解决了传统手动提示的主观性,并引入文本进一步细化语义。

为解决上述问题,一些方法(Liu et al. 2023c (https://arxiv.org/html/2606.07965#bib.bib79); Zhang et al. 2023b (https://arxiv.org/html/2606.07965#bib.bib80))结合语义模型(Xie et al. 2017 (https://arxiv.org/html/2606.07965#bib.bib31); He et al. 2016 (https://arxiv.org/html/2606.07965#bib.bib30))获取目标的伪掩码。CPT(Yao et al. 2024 (https://arxiv.org/html/2606.07965#bib.bib81))和ReCLIP(Subramanian et al. 2022 (https://arxiv.org/html/2606.07965#bib.bib82))使用视觉提示建立实例之间的关系。在此基础上,Hu等人(Hu et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib84))设计了一种采样策略,从伪模板中提取点和边界框作为SAM的提示,用于分割目标图像。CoCoOp(Yan et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib83))将图像生成的提示转化为条件输入,并与语言提示动态结合。这些方法忽略了伪掩码中的假阳性,且依赖于超参数敏感性。因此,它们严重依赖伪掩码的质量,泛化能力较差。为解决上述问题,本文提出了一种精炼文本-视觉提示(RTVP),以提升LVLM在工业场景中的零样本能力。基于Mobile-SAM(Zhang et al. 2023a (https://arxiv.org/html/2606.07965#bib.bib78))在自然场景中的零样本能力,RTVP进一步增强其在工业场景中的泛化能力。如图1所示,考虑到用户提示的主观性和噪声,RTVP引入了基于Mobile-SAM的专家引导机制,生成粗粒度分割特征,并将分割特征编码到低维空间。针对工业图像独特的稀疏特性,本文对分割特征进行空间-通道像素激活,提取目标的不确定性分数。然后,本文引入稀疏建模样本选择策略,通过不确定性分数从增强特征中提取语义线索,获得精炼的视觉提示。最后,精炼的视觉提示与文本提示进行交互,生成具有语义特定目标的提示嵌入。基于Mobile-SAM的固有能力,RTVP增强了模型的视觉-语言理解和泛化能力,尤其在开放世界和跨域场景中。

应用SAM于工业场景的另一个挑战是,现有的工业检测数据单一,无法找到统一的多域泛化工业场景数据集。为解决上述问题,本文创建了一个大规模多模态工业开放数据集,称为MMIO-80K。MMIO由从18个不同工业缺陷数据集转换而来的8万+样本组成,涵盖冶金、汽车制造、精密电子、纺织、日用品和木材加工等主要工业类别中的各种产品缺陷。MMIO专门针对工业零样本检测中独特的特征分布定制,有效缓解了LVLM对工业领域专业知识缺乏的问题。据我们所知,MMIO-80K是首个为工业零样本检测提出的开放数据集,MMIO-80K可催化LVLM在工业开放领域的发展。

在MMIO封闭场景的检测任务中,RTVP相比YOLOv8、YOLOv9及其他领域专家模型,mAP显著提升。在MMIO的零样本检测任务中,RTVP超越了大多数基准模型。在COCO和LVIS数据集上的泛化实验也表明,RTVP能够泛化到自然场景的检测。综上,本文的核心贡献如下:111扩展版:https://github.com/hellozzk/MMIO

∙ MMIO-80K:据我们所知,本文构建了首个面向工业开放场景的目标检测数据集MMIO-80K。MMIO-80K包含8万+样本,有效缓解了工业开放场景下领域专业知识匮乏的问题。

∙ RTVP:本文提出了可学习的精炼文本-视觉提示,以提升视觉-语言模型在工业场景中的零样本检测能力。RTVP无需用户为每张图像提供特定提示,降低了用户使用负担和噪声,并有效提升了LVLM在工业领域的知识和理解能力。

∙ 卓越性能:大量实验表明,RTVP在工业开放场景检测中具有优越性能。因此,RTVP代表了LVLM在工业检测领域的重要进展,为工业场景中的视觉语言相互理解提供了一种通用方法。

## 相关工作

### 视觉-语言模型的应用

近年来,预训练的大语言模型,如GPT-4(Achiam et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib85))、Llava(Liu et al. 2024 (https://arxiv.org/html/2606.07965#bib.bib86))等,在自然语言处理中展现出强大的零样本学习能力。随后,预训练的视觉-语言模型如CLIP(Radford et al. 2021 (https://arxiv.org/html/2606.07965#bib.bib87))、BLIP-2(Li et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib88))等被扩展到计算机视觉领域。目前有两种应用大预训练模型的方法。一种是将大预训练模型的分割结果作为先验信息辅助下游任务,这需要对模型的中间层进行额外微调。例如,Ahmadi等人(Ahmadi et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib92))将SAM的分割结果作为先验信息用于裂纹等缺陷检测。Wu等人(Wu et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib89))将Adapter模块插入SAM用于医学图像分割任务。另一种方法使用提示引导预训练模型迁移到目标领域。例如,Xu等人(Xu et al. 2023 (https://arxiv.org/html/2606.07965#bib.bib93))提出了一种无需训练的证据提示生成方法,将人类先验信息融入提示中。Zhang等人(Jie and Zhang 2023 (https://arxiv.org/html/2606.07965#bib.bib94))提出了用于阴影检测的生成网络,以生成密集点提示。上述两种方法容易消耗计算资源,且无法保证领域层的训练效果。此外,视觉提示不够精炼,也未考虑文本提示的重要性。相比之下,在生成先验信息方面,本文引入了专家模型辅助Mobile-SAM。在提示方面,本文使用精炼的文本-视觉提示来提供更丰富的目标语义信息。

### 零样本学习的提示技术

提示技术源于NLP。随后,提示被用于引导大预训练模型的零样本学习。然而,提示通常依赖人工特征,导致用户负担和噪声引入。最近,自动提示训练方法被广泛用于零样本任务。例如,AutoPrompt(Shin et al. 2020 (https://arxiv.org/html/2606.07965#bib.bib95))使用基于梯度的方法自动生成提示模板。随着大型模型的发展,细粒度视觉提示被广泛用于零样本检测场景。例如,CPT(Yao et al. 2024 (https://arxiv.org/html/2606.07965#bib.bib81))在图像上引入彩色目标框作为标记。然而,这些提示包含大量噪声。为解决此问题,FGVP(Yang et al. 2024 (https://arxiv.org/html/2606.07965#bib.bib96))、VRP-SAM(Sun et al. 2024 (https://arxiv.org/html/2606.07965#bib.bib97))等提出了精炼视觉提示。然而,这些方法依赖于SAM的适应性,无法迭代优化提示质量。此外,这些方法忽略了文本提示在零样本任务中的作用。相比之下,本文通过连续优化的文本-视觉交互提示来表达更精炼的语义特定目标特征。

表1:MMIO与零样本工业缺陷数据集及通用数据集的比较。

## 多模态工业开放数据集

### 数据集构建

本文创建了一个大规模多模态工业开放数据集,命名为MMIO-80K。MMIO由从18个不同主要工业场景转换而来的8万+样本组成。其中,与日用品相关的玻璃容器数据集是本文收集的一个子集。图2-b展示了玻璃容器图像采集设备。本文针对圆柱形透明物体(如玻璃容器)设计了一种多相机协作机制。具体来说,传送带将容器运送至光电门,触发左侧三台相机拍照。然后,容器旋转180度,右侧三台相机重复上述过程。共采集了625张用于目标检测和标注的图像。每张图像分辨率为700×820,包含五个类别(‘油污’、‘黑点’、‘气泡’、‘拉丝纹’、‘淬火晶粒’)。

本文通过多家企业的开源数据获取了其余17个工业场景的图像和标签。本文初步整理了超过22,000张缺陷图像,并交由专业技术人员进行质量筛选,剔除重复和空白图像,最终获得21,836张不同领域的缺陷图像。本文根据专家建议为每张图像重新添加属性。本文将缺陷按照智能制造的主要场景划分为6个超类,每个超类包含多个场景数据。由于MMIO包含8万+缺陷实体,难以手动将真实类别对应到缺陷。因此,本文使用CLIP提取每个类别的语义向量,并通过余弦距离计算语义向量与图像相关语义之间的相似度得分。此外,通过0.8的阈值筛选出相似度最高的文本-图像匹配对。最后,专家检查了与100个类别关联的文本-图像匹配效果。我们修改了一些相似目标。同一工业产品的样本数量可能相对较少,且可能存在相似缺陷(如孔洞和不规则孔洞),但它们仍属于相似类别。我们将它们分为可见和不可见类别,以区分同一工业产品的不同类别。最终,MMIO拥有21,836张图像和100个类别。

相似文章

基于大语言模型的零样本目标识别

arXiv cs.AI

本文首次系统性地对前沿大语言模型在经典PDDL规划基准上的零样本目标识别能力进行评估,发现部分模型能随证据积累而扩展性能,而另一些模型则始终依赖世界知识先验,不受观测累积影响。

零样本世界模型是发展高效的学习者 [R]

Reddit r/MachineLearning

研究人员引入了零样本世界模型(Zero-shot World Models, ZWM),该方法在仅使用极少数据(单个幼儿的视觉经验)且无需特定任务训练的情况下,即可达到与最先进模型相当的视觉能力。这项工作展示了通往数据效率可与人类发展学习效率匹敌的AI系统的路径。