多模态大语言模型安全格局的演变:新兴威胁与防护措施综述

arXiv cs.LG 论文

摘要

一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。

arXiv:2608.07535v1 公告类型:新 摘要:多模态大语言模型(MLLMs)通过模态对齐和融合整合异构模态,从而实现更强的理解和推理能力。然而,这种架构上的转变重塑了机器学习的安全格局。模型复杂性的增加和跨模态交互引发了新的威胁,包括受损的模态集成、模态错位和融合安全风险,反映出威胁建模已超越单模态假设的转变。这些转变反过来又对安全解决方案施加了新的约束,而现有基于单模态学习的框架并未涵盖这些约束。基于这些挑战,本综述对多模态大语言模型安全格局的演变进行了系统分析。我们首先提出一个基于多模态的安全威胁分类法,并分析威胁模型的转变,涵盖对抗性攻击、数据投毒、越狱和幻觉。随后,我们总结了更新后的安全假设,并据此整理了多模态大语言模型安全策略的最新进展。最后,我们讨论了开放挑战和未来方向,以为多模态系统开发更合理且可扩展的安全机制提供参考。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:05

# 多模态大语言模型的安全格局演变:新兴威胁与防护措施综述

来源:https://arxiv.org/html/2608.07535

Xi Li¹ · Shu Zhao² · Xiaohan Zou³ · Fei Zhao¹ · Fuxiao Liu² · Yusen Zhang⁴ · Cheng Han⁵ · Yushun Dong⁶ · Jiaqi Wang⁷

¹阿拉巴马大学伯明翰分校,²NVIDIA,³宾夕法尼亚州立大学,⁴哥伦比亚大学,⁵密苏里大学堪萨斯城分校,⁶佛罗里达州立大学,⁷奥本大学

###### 摘要

多模态大语言模型(MLLMs)通过模态对齐和模态融合集成异构模态,从而增强理解与推理能力。然而,这种架构转变重塑了机器学习的安全格局。模型复杂度的增加和跨模态交互带来了新型威胁,包括受损的模态集成、模态错位以及融合阶段的安全风险,这反映了威胁建模正超越单模态假设发生转变。这些转变反过来对安全解决方案施加了新的约束,而现有基于单模态学习的框架无法涵盖这些约束。基于上述挑战,本综述对MLLMs不断演变的安全格局进行了系统性分析。我们首先提出一种基于多模态的新兴安全威胁分类法,并分析了威胁模型的转变,涵盖对抗攻击、数据投毒、越狱攻击和幻觉。随后,我们总结了更新后的安全假设,并据此梳理了MLLM安全策略的最新进展。最后,我们讨论了开放挑战和未来方向,以期为多模态系统开发更具原则性且可扩展的安全机制提供参考。

## 1 引言

现代多模态学习采用大型模型(如大语言模型,LLMs)来集成多种模态(例如文本、图像、音频和视频),以增强理解和决策能力(Li等,2022a;Alayrac等,2022;Liu等,2023b;Brown等,2020;DeepSeek-AI,2025;team,2024),从而支持医疗健康、自动驾驶和法律裁决等应用。其基础在于模态对齐(将异构特征映射到共享表示空间)和模态融合(集成对齐信息以进行更全面和准确的推理)(Yin等,2024a;Wang等,2023b;Zhu等,2023b;Xu等,2023;Baltrušaitis等,2018)。

随着向多模态架构的转变,机器学习的安全格局正在经历重大变革。多模态学习的独特性质引入了新的安全挑战:(1) 额外模态通过引入自身漏洞扩大了攻击面;(2) 跨模态交互可能表现出语义不一致,并被利用来诱导对抗性错位;(3) 融合过程可能被利用,其中单独看来良性的恶意信号在组合时可能触发有害行为。这些新兴威胁反映了威胁建模的转变:攻击者只需对系统进行部分访问,并且可以发掘输入空间之外的攻击面,从而导致跨模态漏洞。

这些转变进一步对安全解决方案施加了超越经典单模态假设的新约束。例如,防御机制不能再预设哪个模态受损或具体的威胁类型,而必须与模态对齐和模态融合等核心多模态目标保持一致,同时还需要监控模型内部阶段。应对这些约束需要既有效又具成本效益的安全机制,包括保持模态间连贯性的安全感知微调、集成安全性的偏好优化,以及免训练的推理时解决方案。这些变化促使我们撰写一篇关于多模态大语言模型(MLLMs)安全的全面综述。

近期综述(总结于表1)提供了关于攻击、防御和评估协议的有价值概述(Liu等,2024e;Wang等,2024d;Fan等,2024;Wang等,2024e;Jin等,2024;Ye等,2025;Liu等,2025b),但大多采用单模态分类法,按训练/测试威胁或按视觉侧与文本侧攻击分别组织研究。这些视角可能无法完全捕捉多模态系统特有的风险,尤其是源自跨模态交互的风险。此外,先前综述主要枚举威胁和防御,对多模态安全的范式转变(如威胁模型和安全约束的演变)讨论有限,为多模态安全未来研究提供的指导有限。

基于上述空白,本综述对MLLMs所塑造的演变安全格局进行了系统性分析(图1),核心贡献如下:

- • 我们提出了一种新的MLLMs新兴安全威胁分类法,这些威胁源于复杂的模型架构和跨模态交互,包括受损的模态集成、跨模态错位以及融合阶段的风险。我们进一步总结了这些威胁所反映的不断演变的威胁建模。
- • 我们总结了多模态环境下安全解决方案所需更新的假设,并在此框架内对多模态安全的最新进展进行了分类,包括监督安全微调、基于偏好的优化和免训练方法。
- • 随着安全研究从单模态系统转向多模态系统,我们强调需要应对MLLMs日益增加的结构复杂性和交互动态性,并概述了未来研究的关键方向。

尽管我们广泛讨论MLLM安全,但大部分文献集中于视觉-语言模型(VLMs),这是研究最广泛的实例。尽管如此,我们的关键概念同样适用于具有额外模态(例如音频、视频和感觉输入)的MLLMs。

本文其余部分组织如下:第2节回顾单模态安全基础;第3节介绍MLLMs特性、新兴威胁分类法和演变的威胁模型;第4节总结更新后的安全假设及近期安全解决方案进展;第5节讨论未来方向;第6节总结。

图1:多模态视角下演变的安全格局,以视觉-语言大模型为例进行说明。

| 综述 | 发表场所 | 威胁 | 解决方案 | MM分类法 | 安全演变 | 关键贡献 |
|------|----------|------|----------|----------|----------|----------|
| Liu等 (2024e) | IJCAI | ✓ | ✓ | | ✓ | VLM安全简要概述和基本分类 |
| Fan等 (2024) | SMC | ✓ | ✓ | | ✓ | 图像诱导攻击与防御概述 |
| Wang等 (2024e) | FCS | ✓ | ✓ | ✓ | ✓ | VLM安全:攻击、防御与评估 |
| Jin等 (2024) | arXiv | | ✓ | | ✓ | LLMs和MLLMs越狱攻击的全面综述 |
| Wang等 (2024d) | EMNLP | ✓ | | | ✓ | 越狱格局从LLMs到MLLMs的演变 |
| Ye等 (2025) | arXiv | ✓ | ✓ | ✓ | ✓ | 基于生命周期的VLM安全分类:攻击、防御与评估 |
| Liu等 (2025b) | TNNLS | ✓ | ✓ | | ✓ | VLM攻击与评估数据集/模型概述 |
| 本综述 | - | ✓ | ✓ | ✓ | ✓ | 基于MM分类法的MLLM安全及安全格局演变的深入分析 |

表1:近期MLLM安全综述。A:对抗攻击;P:投毒攻击;J:越狱攻击;H:幻觉;MM分类法:基于多模态的分类法;安全演变:安全格局演变;VLM:视觉-语言模型。

## 2 现有安全格局

为提供必要的背景,我们回顾了主要由单模态学习塑造的成熟安全格局。我们遵循标准的攻击者访问定义:白盒(完全模型知识)、黑盒(仅查询访问)和灰盒(部分知识,例如训练数据、无参数的架构或logits)。

### 2.1 对抗攻击

对抗攻击旨在通过在输入中添加不可感知的扰动,在推理时诱导错误输出。攻击者在无需访问训练数据的情况下操纵测试时输入,可在黑盒(Chen等,2017a)或白盒(Goodfellow等,2015;Madry等,2018b;Carlini和Wagner,2017)设置中运行。此类扰动通常通过基于优化的方法生成,这些方法要么针对特定错误输出,要么最大化预测误差,同时满足基于范数的约束(例如 \(l_\infty, l_2\)),以保持感知上的不可见性,尤其是对于图像。

防御旨在增强对细微扰动的鲁棒性,通常假设可完全访问受害模型,有时还需要一个小的干净验证集。对抗训练(Madry等,2018a)通过迭代生成对抗样本并训练模型正确分类来提高鲁棒性,而随机平滑(Cohen等,2019;Li等,2019)则注入高斯噪声并平均预测结果,以平滑决策边界抵御小扰动。

### 2.2 数据投毒

数据投毒通过注入恶意训练样本操纵模型行为,假设攻击者能够访问训练集。攻击范围从降低整体性能的标签翻转(Xiao等,2012;Zhang等,2021)到通过触发器模式诱导定向错误行为同时保持干净准确率的后门攻击。触发器可采取多种形式,包括细微扰动(Nguyen和Tran,2021;2020;Saha等,2020)、图像中不可感知的视觉模式(Gu等,2019;Chen等,2017b),以及文本中的特定令牌(Li等,2021a)、句子(Dai等,2019)或写作风格(Qi等,2021)。

投毒防御旨在降低投毒数据的影响,同时保持模型效用。训练前防御检测并移除训练集中的可疑样本(Tran等,2018;Paudice等,2018);训练时防御利用白盒访问在优化过程中选择可靠样本或减少投毒效应(Diakonikolas等,2019;Shen和Sanghavi,2019;Li等,2021b;Levine和Feizi,2021;Wang等,2022);训练后防御使用白盒访问和小型干净集检测被投毒的模型(Wang等,2019;2023c)、识别被投毒的输入(Gao等,2019;Li等,2022b),或强制良性行为(Liu等,2018;Li等,2021c;Zeng等,2022;Li等,2025a)。

### 2.3 越狱攻击

越狱攻击通过精心构造提示词绕过LLM安全机制,从而产生未经授权而非误导性的输出。白盒攻击优化对抗性前缀或后缀(Zou等,2023;Jones等,2023;Zhu等,2023c);灰盒攻击利用logits访问操纵提示词和令牌选择(Guo等,2024;Zhao等,2024b),或通过小规模投毒进行有限重训练(Qi等,2024b;Zhan等,2024;Yang等,2023)。黑盒攻击利用角色扮演或上下文推理绕过安全对齐(Wang等,2023a;Wei等,2023;Li等,2023c)。其他方法包括LLM生成的对抗提示词(Deng等,2024;Liu等,2024d)和罕见语言规避(Yuan等,2024)。

越狱防御旨在维持安全对齐。黑盒防御通过过滤或预处理对抗提示词来中和有害意图(Alon和Kamfonas,2023;Jain等,2023),而白盒防御通过安全微调(Bianchi等,2024;Deng等,2023)、基于人类反馈的强化学习(RLHF)(Ouyang等,2022)或模型自我纠错来加强防护栏,以减少不安全输出(Sun等,2023b)。

### 2.4 幻觉

幻觉指生成自信但事实错误或缺乏依据的信息(Huang等,2025b),源于训练数据、目标函数或解码过程的局限性。它主要是一个可靠性问题,而非涉及主动攻击者的安全问题。常见原因包括噪声或有偏数据(Bender等,2021;Sheng等,2020)以及解码策略问题。幻觉通常通过改进数据质量、训练方法和解码算法来缓解。

相似文章

多语言语言模型中有毒内容检测与缓解策略综述

arXiv cs.CL

本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。

关于语言模型安全性和滥用的经验教训

OpenAI Blog

OpenAI 分享了在语言模型安全性和滥用方面吸取的经验教训,讨论了衡量风险的挑战、现有基准的局限性,以及他们开发的新型毒性和政策违规评估指标。该文章还强调了对劳动力市场影响的担忧,以及继续研究大规模AI部署社会影响测量的必要性。