从基准性能到工具部署:人在回路异常检测
摘要
本文在BowTie制造数据集上评估了19种无监督异常检测模型,发现其性能不如基准测试所暗示的那样稳定,并提出了一个已部署的用于制造零件检测的人机协同框架。
arXiv:2608.07770v1 公告类型:新论文
摘要:自动化异常检测方法通常在精心策划的学术基准上报告出强劲的性能,但它们在真实工业条件下的行为尚不明确。在本工作中,我们在BowTie数据集上评估了19种无监督异常检测模型,该数据集是一个具有挑战性的制造数据集,包含反光表面、细微缺陷和轮廓特定变化。与基准结果相比,我们观察到模型性能不如在MVTec AD等标准基准上通常报告的那样稳定,对预处理高度敏感,且在不同条件下表现不一致,没有单一方法表现出统一的鲁棒性;一项共识审计进一步表明,名义数据质量会影响部署。
基于这些发现,我们开发并初步部署了一个统一的用于制造零件检测的人机协同框架,该框架结合了图像标注、AI辅助缺陷检测和集成验证引擎,取代了先前的人工视觉检查和文档记录工作流。该系统支持热图引导的缺陷审查、SAM优化的候选区域以供检查员接受、拒绝或边界调整,在存在标注的地方进行掩码评估,以及用于检查员一致性和入职培训的审查历史。综合来看,结果凸显了基准性能与部署现实之间的差距,并提供了一个解决该问题的实用框架。
查看缓存全文
缓存时间: 2026/08/11 08:06
# 从基准性能到工具部署:人在回路异常检测 Source: https://arxiv.org/html/2608.07770 Mike Szklarzewski1, CJ George1, Gavin Smithson1, Christopher Stokes1, Dakota Fulp1, William M\. Jones14 Benjamin Wynn2, Alexander Ur3, Agit Yesiloz5, Clint Kallenbach6 Mark Swartz6, Nathan DeBardeleben4, Sharmistha Chakrabarti4 ###### 摘要 自动化异常检测方法在精心整理的学术基准上通常表现出很强的性能,但它们在真实工业条件下的行为却不太清楚。在这项工作中,我们在 BowTie 数据集上评估了 19 个无监督异常检测模型。该数据集是一个具有挑战性的制造数据集,包含反射表面、细微缺陷和颜色配置特有变化。与基准结果相比,我们观察到模型性能不如 MVTec AD 等标准基准上通常报告的那样稳定,对预处理高度敏感,并且在不同条件下表现不一致,没有任何单一方法展现出统一的鲁棒性;一致性审计进一步表明,正常数据质量会影响部署。 基于这些发现,我们开发并初步部署了一个统一的、人在回路的制造部件检测框架,该框架结合了图像标注、AI 辅助缺陷检测和集成验证引擎,取代了先前的人工目视检查和文档记录工作流。该系统支持热力图引导的缺陷审查、经 SAM 细化的候选区域(供检查员接受、拒绝或调整边界)、在存在标注的情况下进行掩码评估,以及用于检查员一致性和培训的审查历史。总而言之,这些结果凸显了基准性能与部署现实之间的差距,并提供了解决该问题的实用框架。 ††脚注文本:*通讯作者:Sharmistha Chakrabarti*([email protected])。本稿件已获准无限制发布,编号为 LA-UR-26-23692。本作品由 Triad National Security, LLC 的员工撰写,该公司根据与美国能源部/国家核安全管理局签订的合同号 89233218CNA000001 运营洛斯阿拉莫斯国家实验室。出版方接受本文发表,即承认美国政府保留以非独占、已付费、不可撤销、全球范围内的许可来发布或复制已发表形式的稿件,或允许他人为美国政府目的这样做。 ## I 引言 现代制造和质量控制系统的规模和复杂性持续增长,对性能、效率和可靠性提出了越来越高的要求。在洛斯阿拉莫斯国家实验室(LANL)等国家实验室环境中,这些挑战因需要设计、制造和评估高度专业化、通常是一次性或小批量的部件而进一步加剧,这些部件直接支撑国家安全使命。与传统大批量制造不同,这些工作流通常涉及定制几何形状、不断变化的设计要求和严格的工程公差,即使是细微缺陷也可能产生显著的下游影响。 这些挑战在缺陷罕见、细微或形态高度可变的场景中尤为明显,例如精密制造和实验系统评估。在这些环境中(BowTie 数据集[18](https://arxiv.org/html/2608.07770#bib.bib1)就是这样一个例子),仅仅识别出异常的存在是不够的;研究人员和检查员必须精确定位并量化缺陷的空间范围,以确保结构完整性并满足严格的工程公差。 然而,在实用的操作工作流中部署异常检测模型会暴露出系统性的瓶颈。许多现有解决方案与命令行界面或“黑盒”推理引擎紧密耦合。这造成了数据标注过程(整理地面真值)、模型推理阶段(生成和可视化预测)以及统计验证(量化模型成功程度)之间持续存在的操作脱节。在最初的目视检查和文档记录工作流中,检查员在独立查看器中手动审查每个部件图像,并将缺陷观察结果和接受/拒绝决定记录在电子表格中。该过程几乎完全依赖个人目视判断,既不保留局部缺陷的判定依据,也不支持检查员之间的一致性比较。因此,我们的目标有两个:首先,通过将图像查看、缺陷标注和 ML 辅助异常定位整合到一个环境中,同时将最终处置权保留在检查员手中,使检查更容易、更一致;其次,创建一个持续改进循环,使最终确定的检查结果成为用于随时间重新训练和重新部署模型的结构化数据。这种更紧密的集成还改善了下游沟通、可复现性和定量评估,同时保留审查历史,用于检查员培训和与专家审核案例的一致性检查。 本文贡献包括:一个在颜色配置和预处理变化下进行的 19 模型 BowTie 基准测试;对正常数据质量的一致性审计;以及一个统一、可扩展的软件框架,包含用于引导式图像标注和审查的 AnnoMate、用于 AI 辅助缺陷定位和分割审查的 MicroSentryAI,以及一个专门的 Validation Engine(验证引擎),用于在存在地面真值的情况下进行基于掩码的评估和与专家参考标注的比较[17](https://arxiv.org/html/2608.07770#bib.bib2)。同样的基于参考的比较也支持检查员培训,允许将受训人员的决策和标注与专家审核案例进行比较。该框架保持各模块解耦但可互操作;第 VI 节给出了架构和工作流细节。为了使这一动机更加具体,本文首先建立 BowTie 研究设计(第 III 节)、实证发现(第 IV–V 节),然后回到将该经验实际应用于统一框架的讨论(第 VI 节)。 ## II 相关工作 工业异常检测(IAD)中的大多数先前工作集中在模型精度、传感管道和自动化监控上,而不是以检查员为中心的标注工作流。关于增材制造中的异常检测以及金属零件或激光定向能量沉积的实际检测系统的综述,强调了过程监控、缺陷定位和面向部署的传感[27](https://arxiv.org/html/2608.07770#bib.bib3), [5](https://arxiv.org/html/2608.07770#bib.bib4), [14](https://arxiv.org/html/2608.07770#bib.bib5)。在标注层面,空间地面真值通常使用 VIA 和 LabelMe 等通用工具创建[11](https://arxiv.org/html/2608.07770#bib.bib6), [26](https://arxiv.org/html/2608.07770#bib.bib7)。这些工具是有效的多边形编辑器,但它们没有与异常模型推理、交互式阈值调整、轮廓简化、同步热力图可视化或人工标注与模型输出之间的相互比较紧密耦合。AnnoMate 旨在弥补这一差距。 更广泛的异常检测文献为 MicroSentryAI 提供了概念基础。基础性综述围绕反复出现的方法家族来组织异常检测,并强调了有限标注、高维数据、低召回率和异常解释等挑战[7](https://arxiv.org/html/2608.07770#bib.bib8), [21](https://arxiv.org/html/2608.07770#bib.bib9)。Anomalib 通过将最先进的模型与训练、推理、基准测试、可视化和超参数调优打包在一起,为无监督异常检测(UAD)提供了通用算法基础[3](https://arxiv.org/html/2608.07770#bib.bib10)。我们的贡献不同之处在于,它将模型执行保留在面向检查员的环境中,用于交互式热力图可视化、阈值调整、轮廓简化,以及将 AI 生成的掩码直接传回标注管道。这一侧重点还进一步受到以下证据的推动:预处理的收益高度依赖方法,而非普遍适用[34](https://arxiv.org/html/2608.07770#bib.bib11)。 异常检测的评估已逐渐从图像级分类转向细粒度空间定位。MVTec AD 和 VisA 等基准通过提供像素级标注和基于重叠的度量来推动这一转变,但它们也假设原始掩码是缺陷的稳定表示[6](https://arxiv.org/html/2608.07770#bib.bib12)。在真实的工业环境中,专家标注者可能对缺陷的存在和位置达成一致,但在其精确边界上存在分歧。因此,IoU、精度和召回率仍然是必要的,但并不总是充分的,而质心距离等面向定位的测量则提供了对一致性的补充视角。我们的评估引擎遵循这一研究方向:它不仅用作对模型进行排名的记分板,还用作校准层,用于与共享、可复现的缺陷空间定义进行比较。 ## III 实验 ### III-A 数据集与拓扑 为了评估现有无监督异常检测(UAD)架构在复杂工业拓扑上的有效性,我们在 BowTie[18](https://arxiv.org/html/2608.07770#bib.bib1)数据集上进行了实验。原始采集集包含分布在 10 个托盘上的 1,360 张标注图像(1,241 张合格,119 张不合格)。与标准基准(例如 MVTec AD[6](https://arxiv.org/html/2608.07770#bib.bib12))不同,该数据集呈现了严峻的真实制造挑战,包括高反射金属表面、微观结构缺陷和背景杂波。颜色配置分配和数量汇总在表 I 中,这些不同颜色配置的代表性图像如图 1 所示。报告的 CP1-CP3 和 Combined 实验排除了托盘 27952G,使用 1,224 张图像(1,130 张正常样本和 94 张缺陷样本)。 为了与本文其余部分的 UAD 术语保持一致,我们将“合格”图像称为正常图像,将“不合格”图像称为缺陷样本。 表 I:原始采集集的标签计数和颜色配置分配。参见图 1 的说明。 Figure 1: CP1–CP3 的代表性托盘图像,并显示被排除的托盘 27952G 作为对比。托盘 27952G 被排除在基准之外,因为其颜色配置和缩放因子与纳入的托盘不一致,且后来被检查员弃用。 因此,BowTie 并非旨在替代公开基准,而是作为一种面向部署的压力测试,这正是近期 IAD 综述和基准论文所主张的意义。最近的综述[16](https://arxiv.org/html/2608.07770#bib.bib13)指出,真实制造数据通常结合了细微缺陷结构、稀缺异常、杂波和特定领域的采集效应,而基准分析[30](https://arxiv.org/html/2608.07770#bib.bib14)表明,一旦评估设置更接近工业实践并强制进行统一跨族比较,模型排名就可能发生实质性变化。我们以这种精神使用 BowTie:测试 Anomalib 可访问的模型在反射金属表面、颜色配置特有的外观变化和有限不合格样本支持的情况下是否仍然鲁棒。 为了刻画不合格类别的异质性,表 II 总结了 CP1-CP3 的缺陷类型数量。虽然数据集包含多种异常类型,但图 2 显示了三种常见缺陷的代表性示例。凹痕(a, b)呈现出细长、类似划痕的形态,往往与镜面反射融为一体。夹杂物(c, d, e)表现为孤立的表面颗粒,其大小和对比度在不同颜色配置下差异很大。最后,缺口(f, g)的范围从细微到较大的边缘缺陷。总而言之,这种广泛的形态多样性使精确定位和鲁棒异常检测变得复杂。 表 II:CP1-CP3 中不合格图像的缺陷类型数量。参见图注。 参见图注(a) 参见图注(b) 参见图注(c) 参见图注(d) 参见图注(e) 参见图注(f) 参见图注(g) Figure 2: CP1-CP3 中不合格类别缺陷的示例。红色框表示缺陷区域和放大插图。示例包括凹痕(a, b)、夹杂物(c, d, e)和缺口(f, g)。 为了进行模型基准测试,我们在图像级别拆分每个颜色配置池,并仅使用正常子集进行训练。每个颜色配置中 20% 的正常池被保留不参与训练,然后分为验证集和测试集;缺陷图像不参与训练,而是在同一颜色配置内划分为验证集和测试集。表 III 给出了第 IV 节中使用的精确基线训练/验证/测试计数。 表 III:按颜色配置划分的基线拆分计数。N = 正常,D = 缺陷。训练仅使用正常图像;验证集和测试集包含留出的正常图像以及来自同一颜色配置的缺陷图像。 ### III-B 评估的架构 我们评估了 19 个兼容 Anomalib 的 UAD 模型[3](https://arxiv.org/html/2608.07770#bib.bib10),涵盖五个常见方法家族:学生-教师差异方法;补丁记忆/特征自适应方法;基于流的密度估计方法;基于重构的方法;以及特征空间密度基线[4](https://arxiv.org/html/2608.07770#bib.bib15), [10](https://arxiv.org/html/2608.07770#bib.bib16), [29](https://arxiv.org/html/2608.07770#bib.bib17), [24](https://arxiv.org/html/2608.07770#bib.bib18), [9](https://arxiv.org/html/2608.07770#bib.bib19), [15](https://arxiv.org/html/2608.07770#bib.bib20), [8](https://arxiv.org/html/2608.07770#bib.bib21), [23](https://arxiv.org/html/2608.07770#bib.bib22), [31](https://arxiv.org/html/2608.07770#bib.bib23), [12](https://arxiv.org/html/2608.07770#bib.bib24), [25](https://arxiv.org/html/2608.07770#bib.bib25), [28](https://arxiv.org/html/2608.07770#bib.bib26), [13](https://arxiv.org/html/2608.07770#bib.bib27), [32](https://arxiv.org/html/2608.07770#bib.bib28), [33](https://arxiv.org/html/2608.07770#bib.bib29), [2](https://arxiv.org/html/2608.07770#bib.bib30), [20](https://arxiv.org/html/2608.07770#bib.bib31), [1](https://arxiv.org/html/2608.07770#bib.bib32)。其中若干方法是混合型而非纯粹的原型,因此这些家族标签被用作解释性的简写,而不是断言每个方法都实例化了单一机制。 这种面向家族的框架遵循了更广泛的 IAD 文献,后者经常将无监督方法组织为反复出现的机制类别,并认为家族级比较比孤立的逐模型排名更具信息量[16](https://arxiv.org/html/2608.07770#bib.bib13), [30](https://arxiv.org/html/2608.07770#bib.bib14)。让 BowTie 与该分类法保持一致,有助于区分广泛的机制行为与单个实现的特异性。 ### III-C 实现细节 所有实验均使用 Anomalib 框架。
相似文章
重新思考边缘持续异常检测:在真实工业条件下的基准测试
本文介绍了一个用于工业检测中持续异常检测的统一基准,解决了不现实的评估和边缘部署约束问题,并提出了DINOSaur,一种无需训练的方法,在边缘硬件上以零遗忘和低于100毫秒的推理速度优于现有方法。
面向原则性持续异常检测:一个系统框架与基准场景
本文介绍了一个系统框架,用于从表格数据集设计可复现的持续异常检测基准,并提供了来自三个网络安全数据集的五个基准场景。
OpenClawBench:真实世界代理执行轨迹中过程侧异常的基准测试
本文介绍了OpenClawBench,这是一个大规模数据集,用于对真实世界AI代理执行轨迹中的过程侧异常进行基准测试。该数据集揭示了任务成功可能掩盖过程失败,9.33%通过oracle测试的执行仍包含异常,并通过一种新颖的分类法提供了结构化监督。
多变量时间序列基准中的异常大多数是单变量的
本文介绍了一种用于多变量时间序列异常检测基准的诊断框架,发现标记的异常大多可以从单个通道检测到,这对跨通道建模的必要性提出了挑战。作者呼吁开发更多结构多样的评估数据集。
当工具失灵:LLM智能体动态重新规划与异常恢复的基准测试
ToolMaze基准测试评估了LLM智能体处理真实世界工具故障的能力,揭示了隐式语义故障导致的性能下降最为显著,而动态重新规划仍是模型扩展或提示工程无法解决的关键瓶颈。