RobustMAD:评估多模态小语言模型在可部署异常检测助手中的实际鲁棒性
摘要
RobustMAD 引入了一个基准,用于评估多模态小语言模型在实际部署的工业异常检测助手中的鲁棒性。它揭示了关键的失败模式,并为下一代系统提供了指导。
arXiv:2607.16243v1 公告类型:新
摘要:多模态工业异常检测助手是下一代智能工厂的关键组成部分,能够支持基于视觉与语言的交互式查询。然而,多模态大语言模型由于计算需求过高以及基于云推理带来的隐私风险,在实地部署中仍不实用。紧凑型多模态小语言模型(MSLM)提供了一种可部署的替代方案,但进展受到缺乏全面的鲁棒性分析以及反映真实工业条件的有意义且具有挑战性的基准的限制。为弥补这一差距,我们开发了 RobustMAD,这是首个以部署为动机的基准,旨在通过涵盖目标理解、异常检测、无解问题以及视觉质量退化等多种开放性问题,全面评估模型的鲁棒性。与传统假设相反,表现最佳的 MSLM 展现了令人期待的能力,甚至意外地超越了更大的 GPT-5 Nano。然而,它们仍无法满足安全关键要求,RobustMAD 揭示了关键鲁棒性差距,这些差距带来了运营风险。特别是,出现了三种重复性失败模式:(i)在细微区分或退化视觉条件下,多模态基础脆弱;(ii)响应不够全面;(iii)对无解或不当问题的逻辑基础薄弱,导致产生幻觉输出。基于这些见解,我们为设计利用其潜在能力的下一代多模态工业检测助手提供了切实可行的指导。代码可在 https://github.com/en-research/RobustMAD 获取。
查看缓存全文
缓存时间: 2026/07/21 06:47
# 评估面向可部署异常检测助手的多模态小型语言模型的实际鲁棒性 来源:https://arxiv.org/html/2607.16243 Anushiya Arunan¹,² [email protected] Xin Li³ [email protected] Yan Qin⁴ [email protected] U-Xuan Tan¹ [email protected] Nhu Khue Vuong² [email protected] Xiaoli Li¹ [email protected] Chau Yuen³,∗ [email protected] ¹新加坡科技设计大学,新加坡 ²新加坡科技研究局(A*STAR),新加坡 ³南洋理工大学,新加坡 ⁴重庆大学,中国 ###### 摘要 多模态工业异常检测助手是下一代智能工厂的关键组成部分,支持基于视觉与语言的交互式查询。然而,多模态大语言模型由于计算需求过高且基于云端的推理存在隐私风险,在实际现场部署中并不实用。紧凑型多模态小型语言模型(MSLM)提供了一种可部署的替代方案,但相关进展因缺乏全面的鲁棒性分析以及能够反映真实工业条件的有意义且具有挑战性的基准测试而受到限制。为弥补这一不足,我们开发了首个面向部署的基准测试——RobustMAD,旨在通过涵盖物体理解、异常检测、不可回答的问题以及视觉质量退化等多种开放式查询,全面评估模型的鲁棒性。与传统假设相反,表现最佳的MSLM展现出令人期待的能力,甚至意外地超越了更大的GPT-5 Nano。然而,它们仍未达到安全关键型应用的要求,RobustMAD揭示了可能带来运营风险的关键鲁棒性差距。具体而言,出现了三种反复出现的失效模式:(i)在细微区分或退化的视觉条件下,多模态基础能力脆弱;(ii)回答不够全面;(iii)在不可回答或不当提出的查询上逻辑基础薄弱,导致产生幻觉输出。基于这些发现,我们为设计下一代多模态工业检测助手提供了可操作的指导,以充分利用其有前景的能力。 **通讯作者 ## 1 引言 在工业环境中,基于实体边缘设备的人工智能代理正日益受到关注,因为它们有望提升人类生产力,减少重复性的人工劳动和单调乏味。在此背景下,用于工业异常检测的多模态视觉助手构成了下一代智能工厂的关键组成部分(Jiang等,2025(https://arxiv.org/html/2607.16243#bib.bib34))。近期基础多模态大语言模型(MLLM)的进展极大地扩展了工业异常检测的能力——从僵化的、仅依赖视觉的异常检测系统,转向更具交互性的、基于视觉和语言的开放式查询与检测报告。然而,MLLM,尤其是专有模型,在实际工厂环境中实用性有限,原因在于边缘设备上的计算资源限制,以及将敏感工业数据传输至云端服务所涉及的隐私问题。鉴于这些限制,研究焦点已适时转向多模态小型语言模型(MSLM),这些模型通常具有40亿或更少的参数,多为开源,并且适合在资源受限的设备上进行本地部署(Jin等,2025(https://arxiv.org/html/2607.16243#bib.bib36);Ahmed等,2025(https://arxiv.org/html/2607.16243#bib.bib37))。 近期的工作集中于扩展高效MSLM的基础能力,在多种标准基准测试中显著缩小了与中等规模模型的性能差距(Yang等,2025(https://arxiv.org/html/2607.16243#bib.bib16);Yao等,2024(https://arxiv.org/html/2607.16243#bib.bib18);Ahmed等,2025(https://arxiv.org/html/2607.16243#bib.bib37))。然而,在受控评估中表现优异的基准性能并不一定能转化为实际应用中的鲁棒性能(Gong等,2025(https://arxiv.org/html/2607.16243#bib.bib33))。真实世界的工业检测环境高度复杂,具有以下特点:(i)需要密集的领域知识;(ii)图像质量动态变化;(iii)用户查询可能存在不当或非标准化;(iv)回答是开放式的,没有预定义的多项选择答案。因此,为了实现实际鲁棒性,模型必须理解检测任务背后的逻辑,并能在基于用户查询的各种问题变体中进行有根据的推理。 **现有差距。** 然而,目前严重缺乏对MSLM的全面鲁棒性分析,也缺乏用于真实世界工业异常检测的具有挑战性的有意义的基准测试——这构成了在现场实现高效多模态异常检测的重大障碍。现有的大多数基准测试重点关注大型模型,而这些模型不适合在资源受限的环境中进行设备端推理;更关键的是,它们并未有意义地评估模型在面对真实、多样且实用用户查询时的鲁棒性(Jiang等,2025(https://arxiv.org/html/2607.16243#bib.bib34))。受此差距驱动,我们旨在(i)阐明当前最先进的MSLM在多大程度上已准备好作为准确、有用且鲁棒的视觉检测助手进行部署;(ii)描述下一代MSLM为实现实际鲁棒性所需的关键能力和设计优先级。作为对更广泛鲁棒性挑战的初步示例,图1(https://arxiv.org/html/2607.16243#S1.F1)展示了即使在查询措辞上的细微变化(这在实际检测环境中很常见),也可能导致模型响应截然不同,并可能在安全关键的产品检测中造成灾难性后果。 参见图注 图1:最先进MSLM逻辑基础脆弱性。尽管模型在中性查询(查询A)下正确识别了外露电线,但在寻求确认的查询(查询B)下,它未能进行有根据的推理并幻想出“无缺陷”状态。这说明实际查询措辞的变化可能因鲁棒性差距而在安全关键检测中产生灾难性的假阴性结果。 **我们的工作。** 我们提出了RobustMAD(鲁棒多模态异常检测),这是首个面向部署动机的基准测试,用于评估MSLM在工业异常检测中的鲁棒性——这是一个有望从设备端MSLM中显著受益的领域。RobustMAD明确设计用于捕捉核心实际挑战,包括领域密集推理、非标准化和不当的用户查询、开放式检测推理以及现实的视觉质量变化。我们的基准测试全面涵盖了两种主要类型的鲁棒性:**知识型鲁棒性**,评估模型在面对多样化、不完美且需要密集领域知识的查询时的推理能力;以及**视觉质量鲁棒性**,评估模型对动态装配线中常见图像质量扰动(如运动模糊和低光照)的敏感度。我们利用流行的MVTec AD(Bergmann等,2019(https://arxiv.org/html/2607.16243#bib.bib32))和VisA(Zou等,2022(https://arxiv.org/html/2607.16243#bib.bib31))异常检测数据集中的410张代表性图像,精心策划了4,510个多项选择题和7,380个开放式问题,涵盖四个知识型鲁棒性类别。这些类别旨在共同捕捉真实世界异常检测的多样化需求:**通用物体理解**、**独立异常检测**、**成对异常检测**以及**不可回答或不当查询检测**。考虑到数据效率,我们有意识地优先考虑高质量、有意义的挑战性问题,而非单纯的数据规模。通过系统性地覆盖各种挑战,如需要密集领域知识的科学物体、细微缺陷、真实视觉质量扰动、跨图像推理、开放式查询以及特别值得关注的不可回答问题,RobustMAD首次实现了对现代MSLM脆弱性和失效模式的严格评估(见表1(https://arxiv.org/html/2607.16243#S1.T1))。 借助RobustMAD,我们对最先进的MSLM以及作为参考的中等规模开源和专有模型进行了广泛的经验评估。尽管表现最佳的MSLM展现出令人惊讶的有前景的基线能力——甚至超越了像Phi-4-Multimodal-Instruct(6B)和专有GPT-5 Nano这样更大的模型——但我们发现了被标准基准测试和聚合准确率指标所掩盖的关键鲁棒性差距。特别是在开放式评估下,出现了三种反复出现的失效模式:(i)脆弱的多模态基础能力,在超出宏观视觉属性的推理中,面对细微区分或退化视觉条件时失败;(ii)回答不够全面,缺乏工业检测标准所需的精确性和解释细节;(iii)在不可回答或不当查询上逻辑基础薄弱,导致错误、幻觉化的答案,忽略了缺失的证据。为了能够标准化评估这些行为,我们为LLM评判器设计了一个多维度、以用户为中心的评分方案,该方案根据实际要求评估MSLM的回答,包括技术准确性、全面性、相关性和风格清晰度。 RobustMAD基准测试及我们的发现共同提供了对当前MSLM在工业异常检测中准备情况的及时评估,揭示了构成重大运营风险的关键失效模式,并为设计下一代多模态检测助手提供了实用指导。 表1:提出的RobustMAD与传统工业异常检测(IAD)数据集及代表性多模态评估基准的对比。 | 特征 | Real-IAD (Wang等, 2024) | AdversarialVQA (Li等, 2021) | VisualRobust VQA (Ishmam等, 2025) | MMAD (Jiang等, 2025) | RobustMAD (Ours) | |---|---|---|---|---|---| | 领域 | IAD | 通用 | 通用 | IAD | IAD | | 输入模态 | 仅图像 | 图像、文本 | 图像、文本 | 图像、文本 | 图像、文本 | | 需要密集领域知识? | ✓ | ✗ | ✗ | ✓ | ✓ | | 跨图像推理? | ✗ | ✗ | ✗ | ✓ | ✓ | | 复杂开放式查询? | ✗ | 简短式OE | 简短式OE | ✗ | ✓ | | 真实否定查询? | ✗ | ✗ | ✗ | ✗ | ✓ | | 视觉质量鲁棒性? | ✓ | ✗ | ✓ | ✗ | ✓ | | 评估指标 | AUROC | 准确率 | 准确率 | 准确率 | 带多维评分的LLM评判器 | | 分析覆盖范围 | 仅视觉 | MLLM | MLLM | MLLM | MSLM(含参考MLLM) | 我们的主要贡献总结如下: 1. 据我们所知,我们首次对MSLM在多模态工业异常检测中的鲁棒性进行了全面评估——这是一个MSLM对设备端部署至关重要但尚未得到充分探索的领域。 2. 我们开发了RobustMAD,这是一个严格的基准测试,通过涵盖物体理解、异常检测、不可回答问题以及视觉质量退化的多样化开放式检测查询,系统地评估模型鲁棒性,从而揭示了标准基准测试根本无法捕捉到的更深层次的失效模式。 3. 我们设计了一个多维度、以用户为中心的评分方案,从技术准确性、全面性、相关性和清晰度四个方面全面评估MSLM,实现了对开放式响应的标准化和量化评估。用于评估的经人工验证的参考答案也已发布,以支持更广泛社区的未来研究。 4. 我们发现即使是通用型MSLM也展现出令人惊讶的优势,挑战了关于模型规模效益的传统假设,同时也揭示了先前分析中很大程度上被忽视的关键失效模式。基于这些发现,我们为设计下一代多模态检测助手提供了可操作的指导。 本文其余部分组织如下。第2节(https://arxiv.org/html/2607.16243#S2)回顾相关工作并强调我们旨在填补的空白。第3节(https://arxiv.org/html/2607.16243#S3)介绍我们的RobustMAD基准数据集,包括数据创建流程和关键统计信息。第4节(https://arxiv.org/html/2607.16243#S4)讨论实验结果,识别失效模式,并为下一代MSLM提供实用指导。最后,第5节(https://arxiv.org/html/2607.16243#S5)总结全文并展望未来工作方向。 ## 2 相关工作 我们将先前的工作组织成与本研究最相关的三个领域:(i)多模态小型语言模型基准测试;(ii)多模态工业异常检测;(iii)关注鲁棒性的视觉问答。综合来看,这些工作表明,对MSLM的全面鲁棒性分析以及用于评估真实世界工业异常检测的有意义的、具有挑战性的基准测试严重缺乏,凸显了实现高效现场多模态异常检测方面的重大空白。 ### 2.1 多模态小型语言模型基准测试 与其大规模对应模型相比,对小型语言模型,特别是多模态小型语言模型的全面分析仍然相对稀缺。SLM-Bench(Pham等,2025(https://arxiv.org/html/2607.16243#bib.bib30))是首个针对小型语言模型(SLM,非多模态)的全面基准测试,评估其在多种自然语言任务、通用知识领域、硬件配置以及环境影响上的表现。类似但不够全面的评估也在调查研究中进行(Jin等,2025(https://arxiv.org/html/2607.16243#bib.bib36);Ahmed等,2025(https://arxiv.org/html/2607.16243#bib.bib37)),用于在标准视觉-语言基准数据集(Goyal等,2017(https://arxiv.org/html/2607.16243#bib.bib8);Fu等,2025(https://arxiv.org/html/2607.16243#bib.bib9);Lu等,2024(https://arxiv.org/html/2607.16243#bib.bib7);2022(https://arxiv.org/html/2607.16243#bib.bib6))上对MSLM性能进行基准测试。然而,这些研究均未深入考察MSLM的鲁棒性,也未涉及工业异常检测——这一领域可从设备端部署的MSLM中显著受益。 ### 2.2 多模态工业异常检测基准数据集 通常,工业异常检测被视为一个计算机视觉问题,聚焦于物体级或像素级的缺陷检测(Pemula等,2025(https://arxiv.org/html/2607.16243#bib.bib24);Jayasekara等,2023(https://arxiv.org/html/2607.16243#bib.bib4);Zhang等,2022(https://arxiv.org/html/2607.16243#bib.bib3))。近期融合多模态视觉-语言输入的尝试仍处于早期阶段,大致分为两个方向:通过定性案例研究评估特定最先进MLLM(例如GPT-4V)的异常检测能力(Cao等,2023(https://arxiv.org/html/2607.16243#bib.bib23)),以及通过精心设计的提示策略(Xu等,2024(https://arxiv.org/html/2607.16243#bib.bib22))或在异常检测数据集上微调(Gu等,2024(https://arxiv.org/html/2607.16243#bib.bib25))来定制MLLM进行异常检测。与这些零散的努力相对,MMAD基准测试(Jiang等,2025(https://arxiv.org/html/2607.16243#bib.bib34))通过人工标注的异常图像(带真实异常类别和描述)以及相应的多轮对话来评估MLLM在异常检测中的能力。然而,MMAD专注于大型语言模型,并未评估视觉质量鲁棒性,也未纳入不可回答的问题或基于查询逻辑的推理——这些都是实际检测环境中的关键要素。
相似文章
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
压力下的风险:语言模型对抗鲁棒性的计算感知评估
本文提出了一种针对LLM对抗鲁棒性的计算感知评估框架,提出了基于FLOPs的风险-计算曲线和度量指标,以更好地评估攻击成本,发现对齐训练具有非单调效应,且计算成本因模型和危害类别而异。
Robust-U1:多模态大语言模型能否自我修复受损视觉内容以实现鲁棒理解?
Robust-U1 是一个框架,通过监督微调、双奖励强化学习和联合多模态推理,使多模态大语言模型能够自我修复受损的视觉内容,在鲁棒性基准测试上达到了最先进水平。
压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。
面向多模态在线分布式工业异常检测的参数高效多类智能调度
本文提出MODIAD,一种面向多模态在线分布式工业异常检测的框架,通过多类智能调度问题和资源高效类级低秩自适应(REC-LoRA)策略解决资源约束问题。在MVTec 3D-AD和Eyecandies数据集上的实验展示了卓越的性能和效率。