多模态异常检测:综述

arXiv cs.LG 论文

摘要

这篇综述论文全面概述了多模态异常检测,基于正常性和异常假设组织方法,并讨论了基础模型在推动该领域发展中的作用。

arXiv:2608.24937v1 公告类型:新 摘要:多模态异常检测(MMAD)从异构数据源中检测罕见的异常事件,正日益用于安全和可靠性关键的应用中,如工业检测和网络安全。然而,文献在领域和模态组合上分散,现有综述通常按架构而非在多模态设置中异常如何定义和分离来组织方法。我们从假设驱动的角度调查MMAD。我们形式化问题,识别其核心挑战的五个内在特征,并将先前工作组织为两个互补的范式。第一个,正常性假设方法,通过表示学习、跨模态对齐和知识增强建模规律性。第二个,异常假设方法,通过粗粒度、结构和语义异常注入锐化决策边界。我们还研究了基础模型如何通过可扩展预训练、灵活的跨模态迁移和新兴的推理能力重塑MMAD。最后,我们编译了跨领域的代表性基准和评估协议,并强调了稳健、适应性和可解释的MMAD系统的开放问题和未来方向。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:27

# 多模态异常检测:一篇综述  
来源:https://arxiv.org/html/2608.24937  

## 多模态异常检测:综述  
出版ID:pubid: 0000–0000/00$00.00 © 2026 IEEE  

Zexin Wu, Chuan Luo, Shiru Chen, Xudong Liu, Chunming Hu, Renyu Yang  

**致谢**:手稿于2025年12月29日收到;2026年5月25日修订;2026年7月13日接受。本工作部分得到中国国家重点研发计划(资助号:2024YFB4505901)、北京市自然科学基金(编号:L241050)、中国国家自然科学基金(资助号:62402024)以及中央高校基本科研业务费的支持。(通讯作者:任宇)  

**致谢**:牟旭东和刘旭东来自北京航空航天大学计算机科学与工程学院,中国北京100191(邮箱:[email protected], [email protected])。  

**致谢**:吴泽鑫、罗传、胡春明和任宇来自北京航空航天大学软件学院,中国北京100191(邮箱:[email protected], [email protected], [email protected], [email protected])。  

**致谢**:陈世如来自山东浪潮智能生产技术有限公司,中国济南250101(邮箱:[email protected])。  

#### 摘要  
多模态异常检测(MMAD)从异构数据源中检测罕见的异常事件,正日益应用于工业检测和网络安全等对安全性与可靠性要求关键的领域。然而,现有文献在不同领域和模态组合中显得零散,且现有综述通常按架构而非异常在多模态环境中的定义和分离方式来组织方法。我们从假设驱动的角度对MMAD进行综述。我们形式化了问题,识别了其核心挑战背后的五个内在特性,并将现有工作组织为两个互补的范式。第一类是**正常性假设**方法,通过表征学习、跨模态对齐和知识增强来建模规律性。第二类是**异常性假设**方法,通过粗粒度、结构化和语义异常注入来锐化决策边界。我们还研究了基础模型如何通过可扩展的预训练、灵活的跨模态迁移和新兴的推理能力重塑MMAD。最后,我们汇编了跨领域的代表性基准测试和评估协议,并指出了鲁棒、自适应和可解释的MMAD系统的开放问题和未来方向。  

#### 索引关键词:多模态异常检测、正常性假设、异常性假设、基础模型、假设驱动分类法  

## I 引言  
异常检测(AD)识别偏离正常行为的观测值[110, 167]。由于许多AD应用对安全性和可靠性至关重要——例如工业检测、医疗保健、监控、金融和网络安全——该领域已活跃数十年[150, 30]。传统方法通常使用单模态数据并在单一观测空间中建模正常性,但当异常微弱、部分被观测或具有模态依赖性时,它们往往失效。随着异构数据源的兴起,多模态异常检测(MMAD)已成为经典AD的自然延伸。通过结合图像、时间序列、文本、音频和传感器信号等多种模态的证据,MMAD可以检测在任何单一模态中看似正常的异常事件[87]。多模态集成还提高了对噪声、缺失数据和部分故障的鲁棒性,从而对复杂系统提供更准确的视图[27]。  

然而,多模态性也通过引入异构性和对齐问题重塑了该问题,并加剧了粒度不匹配、语义歧义和数据分布演变等挑战。几篇综述研究了MMAD及相关领域。现有综述涵盖了使用RGB、3D和多模态输入的工业视觉异常检测[87],用于视听事件理解的多模态数据集[76],以及多模态时间序列分析的进展[70]。其他针对特定领域的综述从协作和融合角度研究多模态事件检测和表征学习[162, 152]。然而,这些工作要么针对特定领域(例如RGB/3D工业图像、视听基准、时间序列信号),要么讨论通用学习工具而未提供MMAD的整体视图。  

将基础模型(FMs)应用于MMAD的兴趣正在迅速增长。在大规模、多样化的语料库上预训练的FMs提供了强大的表征学习和跨模态对齐能力,这是特定任务架构难以实现的[123, 7]。这使得零样本和小样本异常检测成为可能,特别是在标记异常稀缺的情况下[188, 64]。基于FM的方法还支持灵活的融合和迁移,减少了手工流程并简化了适应新模态或异常类型的过程[185, 179, 71]。然而,现有的以FM为中心的综述在很大程度上描述了通用AD流程(例如FM作为编码器或解释器),而没有系统地将多模态预训练、跨模态对齐和FM驱动的推理与MMAD的具体挑战联系起来。因此,它们的分类法与异常检测的本质联系薄弱,倾向于强调架构新颖性而非清晰解释检测机制。  

在本综述中,我们从假设驱动的角度看待MMAD。我们不按模态或模型族对方法进行分组,而是根据它们关于**正常性**和**异常性**的假设来组织它们。我们通过两个视角回顾MMAD方法:(i) 基于正常性的方法,建模样式规律并隐式定义异常;(ii) 基于异常性的方法,显式构建对比以标记超出正常范围的事物。在每个视角中,我们追溯从经典单模态技术到现代多模态方法的发展历程,展示它们的假设如何与MMAD特有的挑战相互作用。将分类法植根于异常检测本身,可以统一视角来看待方法在多模态环境中如何定义、揭示和分离异常行为。该框架阐明了现有方法(包括基于FM的方法)的优势和局限性,并指出了开放的差距和未来的研究方向。  

图1总结了本综述的路线图。本文的主要贡献如下:  
- 据我们所知,我们首次从假设驱动的角度对MMAD进行了系统性综述,为研究领域提供了统一且可解释的视角。  
- 我们分析了MMAD的内在本质,并提炼出一组基本挑战,解释了为什么许多问题仍只得到部分解决。  
- 我们通过正常性和异常性假设的互补视角,回顾了来自顶级会议和期刊的广泛研究,总结了它们在应对MMAD挑战时的目标、能力和局限性。  
- 我们通过基础模型驱动的假设融合视角,识别了新兴趋势并制定了MMAD的未来研究方向,强调了可靠的异常假设生成、语义跨模态推理和终身适应。  

本文其余部分组织如下。第II节定义了MMAD并分析了其核心挑战。第III节和第IV节分别从正常性和异常性中心的角度回顾了假设驱动的方法,重点介绍了基础模型的影响。第V节总结了基准测试和应用,第VI节讨论了开放问题,第VII节是结论。  

## II 预备知识  
### II-A 多模态异常检测的定义  
多模态异常检测旨在整合多样且异构的信息,以识别显著偏离正常分布的罕见异常样本[110]。通过利用跨模态互补性,它可以揭示在单模态视图中可能因数据有限而被掩盖的复杂异常模式。  

设 $\mathcal{X}=\{\mathbf{x}^{(1)},\dots,\mathbf{x}^{(K)}\}$ 为具有 $K$ 个异构模态的多模态样本,其中 $\mathbf{x}^{(k)}\in\mathbb{R}^{d_{k}}$ 是来自模态 $k$(例如文本、图像、时间序列、音频)的观测值。为建模缺失模态,设 $\mathcal{M}\subseteq\{1,\dots,K\}$ 为已观测模态的集合,并定义 $\mathcal{X}_{\mathcal{M}}:=\{\mathbf{x}^{(k)}\}_{k\in\mathcal{M}}$。  

MMAD 旨在通过一个评分函数 $f(\cdot)$ 学习异常分数 $\mathcal{S}$,该分数衡量样本偏离联合正常分布 $\mathcal{P}_{\text{normal}}$ 的程度:  
$$\mathcal{S}=f(\mathcal{X},\mathcal{M}):=f(\mathcal{X}_{\mathcal{M}})\in\mathbb{R}.$$  
测试样本的决策规则为:  
$$\text{Label}(\mathcal{X},\mathcal{M})=\begin{cases}1\ (\text{异常}),&\text{如果 }\mathcal{S}>\tau,\\ 0\ (\text{正常}),&\text{如果 }\mathcal{S}\leq\tau,\end{cases}$$  
其中 $\tau$ 是预定义的阈值,通常在验证集上确定。  

与单模态异常检测相比,MMAD 必须同时捕捉模态内的规律性(在每个 $\mathbf{x}^{(k)}$ 中)和跨模态依赖性(在 $\mathcal{M}$ 中),这引入了跨模态不一致性、模态不平衡和缺失模态等挑战。该表述强调了三个值得特别关注的问题:  
(i) 由于异常是相对于正常性定义的,多模态正常性应明确指定并与目标任务对齐,捕捉模态内规律性和跨模态结构一致性;否则,检测结果可能不可靠。  
(ii) 异常检测通常在极端类别不平衡下运行,在多模态场景中,异常可能源于罕见的跨模态交互,而非单一模态。  
(iii) 参照[167],区分异常检测(AD)、新奇检测(ND)、离群值检测(OD)和分布外(OOD)检测至关重要,它们在问题设置和假设上有所不同,并且在多模态上下文中由于信息源交互而变得更加微妙。例如,AD 检测偏离已建立的正常模式的偏差,ND 将新样本视为潜在的新类别,OOD 强调在多类别设置中的鲁棒性,而 OD 识别给定数据集中的离群值。  

这些考虑凸显了 MMAD 固有的复杂性,并为下一节对其关键挑战的详细讨论提供了动机。  

参考图1:多模态异常检测的概念路线图。该图说明了从异常检测的内在本质到多模态引发的挑战、假设驱动的建模范式以及 MMAD 中新兴的未来机遇的演进。  

### II-B MMAD 的本质问题  
MMAD 的复杂性可以解构为异常检测本身的固有挑战以及多数据源集成带来的复杂性。我们沿两个维度总结这些本质问题:异常的内在特性以及多模态性引入的加剧因素。  

#### II-B1 异常检测的内在特性  
在核心层面,异常检测解决的是对“未知”和“罕见”的追求。主要瓶颈是**异常稀缺性**:现实世界的异常极其罕见,因此几乎无法收集代表性的故障模式数据集。这种数据匮乏导致长期的**知识缺陷**,因为异常的机制、统计分布和边界条件仍然知之甚少。**异常多样性**也出现在单模态环境中,使得建模本质上具有挑战性,例如时间序列中的点式和模式级异常,图像中的像素级和区域级异常。**概念漂移**进一步挑战任何部署,因为正常性的概念在非平稳环境中不断演变。  

#### II-B2 多模态性引入的加剧因素  
引入多个模态带来了**模态异构性**,来自不同传感器的数据表现出不一致的分布、异步采样和矛盾的信号。重要的是,多模态性放大了AD的固有挑战。当稀缺的异常信号必须在未对齐的特征空间中协调时,知识缺陷会恶化。异常多样性扩展到跨模态层面,除了跨模态异常(包括空间、关系、时间或语义上的),一个事件可能在单一数据流中表现正常,但通过模态间冲突显现出异常。概念漂移也变得多维且更难校准,因为不同模态可能以不同的速度甚至相反的方向演变。  

总之,MMAD 的格局由五个关键特征定义:模态异构性、知识缺陷、异常多样性、异常稀缺性和概念漂移。  

### II-C MMAD 的主要挑战  
尽管在规模扩展和高维建模方面取得了进展,MMAD 仍面临几个未解决的挑战。  

#### II-C1 CH1:异构性导致的模态差异  
文本、图像、时间序列和音频等模态在特征空间中表现出显著的分布异构性[154]。异常可能在不同模态中表现不同,有效的检测可能需要整合多个流。例如,在机器人抓取过程中,微小滑移会在力/力矩时间序列信号中引起明显的摩擦变化,但在视觉上难以察觉。如果没有准确的语义对齐,模型可能表现出视觉偏差,错过滑移,甚至在装配过程中导致碰撞。因此,实现语义对齐的表示至关重要。目标是让模态相互补充,而不是作为产生冲突预测的“争吵的专家”。  

#### II-C2 CH2:知识缺陷导致的边界模糊  
正常与异常之间的边界通常因有限的专家指导和弱或嘈杂的标注而模糊。一个统计异常值在专业领域中可能是一个罕见但合法的运行状态,这使得边界优化变得复杂[113]。

相似文章

多变量时间序列基准中的异常大多数是单变量的

arXiv cs.LG

本文介绍了一种用于多变量时间序列异常检测基准的诊断框架,发现标记的异常大多可以从单个通道检测到,这对跨通道建模的必要性提出了挑战。作者呼吁开发更多结构多样的评估数据集。