MCBench: 面向全模态大语言模型的多语境安全评估基准

arXiv cs.CL 论文

摘要

MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。

arXiv:2606.05177v1 公告类型: 新 摘要: 现有的多模态安全基准仅关注视觉输入,无法评估处理视觉、音频和文本的全模态大语言模型(Omni LLMs)。我们提出了MCBench,这是一个包含1196个场景的基准,涵盖四个安全类别,需要整合多种模态才能进行准确的安全评估。每个不安全场景都与一个仅存在微小差异的安全场景配对,以评估模型的敏感性。我们对最先进模型的评估揭示了重大挑战。全模态大语言模型在处理微妙或非物理风险时表现困难,但在存在显著视觉或听觉线索时表现较好。对推理轨迹的分析表明,尽管模型能够提取模态特定信息,但它们往往无法有效整合这些线索进行安全判断。我们的发现表明,当前的全模态大语言模型在安全关键场景中缺乏稳健的跨模态推理能力,这凸显了改进多模态安全的架构和训练策略的必要性。
查看原文
查看缓存全文

缓存时间: 2026/06/05 08:05

# 面向全模态大语言模型的多情境安全评估基准  
来源:https://arxiv.org/html/2606.05177  

Luong Abraham Kim Kaur Omari Haffari Vu Qu Phung TamasJunaeAmarRollinGholamrezaTrangLizhenDinh¹莫纳什大学,澳大利亚 ²国防科学与技术组织,澳大利亚  
\{tien.luong, gholamreza.haffari, trang.vu1, lizhen.qu, dinh.phung\}.monash.edu, \{amas.abraham, junae.kim, amar.kaur, rollin.omari\}@companyA.com  
(https://arxiv.org/html/2606.05177v1/mailto:%7Btien.luong,%20gholamreza.haffari,%20trang.vu1,%20lizhen.qu,%20dinh.phung%7D.monash.edu,%20%7Bamas.abraham,%20junae.kim,%20amar.kaur,%20rollin.omari%[email protected])  

###### 摘要  
现有多模态安全基准仅关注视觉输入,无法评估处理视觉、音频和文本的全模态大语言模型(Omni LLMs)。我们提出 MCBench 基准,包含覆盖四个安全类别的 11961196 个情境,这些情境需要整合多种模态才能进行准确的安全评估。每个不安全情境都配有一个仅最小化上下文元素不同的对应安全情境,以评估模型的敏感性。我们对最先进模型的评估揭示了重大挑战。全模态大语言模型在存在微妙或非物理风险时表现困难,但当存在显著的视觉或声学线索时表现更好。对推理轨迹的分析表明,尽管模型能够提取特定模态的信息,但它们常常无法有效整合这些线索以做出安全判断。我们的发现表明,当前的全模态大语言模型在安全关键场景中缺乏稳健的跨模态推理能力,这凸显了对改进架构和训练策略以提升多模态安全性的需求。  

###### 关键词:多模态模型,安全评估,多模态基准  

## 1 引言  

大语言模型(LLMs)已通过多模态训练数据的近期进展[schuhmann2022laionb, Bain21, mei2023wavcaps]和架构创新[alayrac2022flamingo, li2023blip, gong21b_interspeech]超越了纯文本处理。近期工作开发了能够同时处理视觉、音频和语音的全模态大语言模型(Omni LLMs)[comanici2025gemini, xu2025qwen2]。这些模型在复杂多模态推理任务上表现出色,并越来越多地部署在从虚拟助手[pichai2024gemini]到医疗保健领域[corrado2023multimodal]的真实世界应用中。随着全模态大语言模型在安全敏感应用中日益普及,确保它们在识别和响应不安全情况时的可靠性变得至关重要。  

当前的多模态安全基准[zhou2025multimodal, qu-etal-2025-self, wang-etal-2025-cant]仅关注视觉内容,评估视觉线索本身提供足够信息进行安全判断的场景。这种设计将评估限制在视觉语言模型上,无法评估同时处理视觉、音频和语音的全模态模型。虽然存在全模态基准[li2025omnibench, chen2025savvy],但它们评估的是通用推理能力而非特定于安全的推理。此外,现有安全基准依赖单模态场景,未能反映真实世界的复杂性——安全评估需要跨多种模态(包括视觉、声学和语言语境)综合信息。  

表 1:MCBench 与其他全模态和安全基准的比较。MCBench 专注于评估全模态大语言模型在多情境场景中的安全感知能力。A、V、S 分别表示音频、视觉和语音话语。  

为弥补这些空白,我们提出 MCBench,这是首个专为评估全模态大语言模型在多情境环境中的安全感知能力而设计的多模态多情境安全基准。表 1 (https://arxiv.org/html/2606.05177#S1.T1) 展示了我们的基准与现有多模态安全基准的比较。MCBench 包含 11961196 个多情境安全场景,涵盖四个粗粒度分类:物理伤害、社会伤害、非法伤害和财产损害。为研究全模态大语言模型的过度敏感性和不敏感性,我们收集不安全场景及其对应安全场景,这些场景仅在最小上下文元素上有所不同。因此,基准数据集由不安全-安全场景对组成。  

我们首先与 Claude-Sonnet-4.5 模型协作,探索细粒度类别和场景对,以更好地覆盖真实世界安全情境。然后,我们利用现有的生成模型为每个场景生成对应的多模态输入(音频和图像)。为确保基准质量,我们在场景设计和数据生成阶段都纳入人类专家,以过滤不现实的场景和低质量的多模态输入。  

我们使用 MCBench 对广泛使用的开源和商业全模态大语言模型进行安全感知分析。结果揭示出被评估模型安全感知方面的三个关键发现。首先,当前全模态大语言模型在评估社会和法律责任场景时表现困难,而在物理伤害和财产损害类别上表现良好。其次,视觉上下文具有挑战性,但为模型提供的信息线索有助于做出准确的安全判断。第三,安全评估的失败主要源于全模态大语言模型推理能力的局限性。更具体地说,尽管这些模型能够从多模态输入中成功提取安全判断所必需的真值谓词,但常常无法综合这些线索做出准确预测。此外,我们的消融研究表明,当前全模态大语言模型缺乏稳健的平衡多情境整合机制。当遇到模糊线索时,这些模型表现出过度敏感性,专注于单一潜在令人担忧的信号,同时忽略来自其他模态的矛盾证据。这导致在安全场景中系统性地出现假阳性,即孤立线索在缺乏恰当上下文整合时可能显得令人担忧。  

总结而言,我们的贡献有三方面:  
- • 我们提出 MCBench,专注于评估全模态大语言模型在多情境环境中的安全感知能力。  
- • 我们在基准上分析了最先进的开源和商业模型。分析揭示,现有全模态大语言模型在涉及微妙或非物理安全风险(社会伤害和非法伤害)的场景中表现困难,而在具有显著视觉和声学线索的类别(物理伤害和财产损害)上表现显著更好。  
- • 通过分析推理轨迹,我们发现模型能够提取相关信息但缺乏有效的跨模态整合能力。模型还表现出过度敏感性,基于单一令人担忧的线索而非全面评估所有可用证据来做出安全判断。  

## 2 多模态多情境安全基准  

### 2.1 概述  

**问题定义。** 我们将多模态多情境安全问题定义如下:给定一个全模态情境数据三元组 \(T=\{I,A,S\}\),其中 I、A 和 S 分别表示图像、音频片段和语音话语,模型必须基于输入模态将安全标签 \(R(I,A,S) \in \{\text{safe},\text{unsafe}\}\) 分类。由于安全评估由视觉、声学和语言语境的组合决定,多模态语言模型必须有效聚合所有模态的信息线索以做出准确的安全评估。  

**数据集描述。** 我们构建了多模态多情境安全基准(MCBench),由不安全-安全场景对组成,以评估多模态语言模型在从视觉、音频和语音三种模态获取语境的复杂场景中评估安全水平的有效性。如图 1 (https://arxiv.org/html/2606.05177#S2.F1) 所示,每个数据实例包含一个自然语言查询和表示当前情境的多模态上下文。多模态上下文包括一张图像、一个音频片段和一个语音话语。此外,提供真值标签及相应的谓词,以确定输入情境的安全评估。谓词是我们基准的关键组成部分,因为它能够更深入地分析全模态大语言模型聚合多模态输入以进行决策的能力。  

请见图注  
图 1:一个基准数据示例  

请见图注  
图 2:基准分类涵盖 4 个粗粒度类别。  

**基准分类。** 图 2 (https://arxiv.org/html/2606.05177#S2.F2) 展示了我们基准中用于评估多模态语言模型的安全分类。我们采纳了先前工作[zhou2025multimodal]中的三个现有粗粒度类别:物理伤害、财产损害和非法伤害,并提出了一个新的类别“社会伤害”,以更全面地覆盖多情境安全场景。[zhou2025multimodal]中的细粒度类别主要侧重于用于安全评估的视觉上下文,因此未能充分覆盖多情境安全场景。为弥补这一空白,我们为每个粗粒度类别定义了新的细粒度类别,以更好地契合多情境安全问题。完整分类详见下文:  

- • **物理伤害** 包含三个细粒度类别:暴力和持械威胁、环境危害、公共安全与医疗紧急情况,涵盖一般领域的安全问题,如儿童和公共安全。  
- • **社会伤害** 涵盖与社会方面相关的安全问题,进一步分为:基于身份的排斥(例如仇恨言论和歧视)、信息相关违规(例如虚假信息和社会操纵)、剥削与人际伤害(例如骚扰和欺凌)。  
- • **非法伤害** 包括涉及导致非法后果的活动相关的安全问题,进一步分为:针对人的犯罪(例如儿童剥削和武器犯罪)和针对系统与财产的犯罪(例如金融和网络犯罪)。  
- • **财产损害** 涵盖导致人员或财产严重损害的有害行为相关的安全场景,分为:能源与公用系统危害(例如燃气泄漏和火灾)、环境与结构威胁(例如天气相关损害)、化学、工业与车辆损害(例如危险材料和工业故障)。  

### 2.2 数据收集  

为构建 MCBench,我们设计了一个两阶段数据收集框架。第一阶段,我们利用大语言模型为分类中的每个粗粒度类别生成多样化的安全场景。第二阶段,我们使用图像和音频生成模型为每个场景创建合成的多模态内容。图 3 (https://arxiv.org/html/2606.05177#S2.F3) 展示了 MCBench 的数据生成框架。  

请见图注  
图 3:基准构建的整体流程,包括两个阶段:多情境安全场景生成和多模态数据生成。  

**第一阶段:多模态安全场景生成。** 我们利用 Claude-Sonnet-4.5[anthropic2024claude]为四个粗粒度安全类别系统性地开发细粒度子类别。我们向模型提供每个粗粒度类别的详细定义和示例,然后迭代地提示模型提出粒度更细的子类别,并由人类专家进行精炼。通过这一过程,我们为每个粗粒度类别获得两到三个细粒度子类别。  

在下一步中,我们提示 Claude-Sonnet-4.5 为每个细粒度子类别生成不安全场景。为确保场景需要跨多个模态进行推理,我们首先指导模型使用 If-Then 逻辑结构制定不安全场景:\(L = \text{IF } \langle \text{condition 1} \rangle \text{ AND } \langle \text{condition 2} \rangle \text{ AND } \ldots \text{ THEN UNSAFE}\),其中多个上下文条件共同导致不安全情况。然后,我们通过修改每个不安全场景中的一个或两个条件来生成对应的安全场景,从而创建仅在最小上下文元素上有所不同的配对实例。  

对于每个不安全-安全场景对,我们提示模型生成详细的文本描述,这些描述可作为第二阶段图像和音频生成模型的提示。具体来说,我们得到一个元组 \((T_I, T_A, S, R, L)\),其中 \(T_I\) 和 \(T_A\) 分别是图像和音频上下文的文本描述,S 是语音话语,\(R \in \{\text{safe},\text{unsafe}\}\) 是真值安全标签,L 是安全评估的 If-Then 谓词。  

在最后一步,我们手动验证并精炼生成的场景。我们剔除不现实或包含与常识不一致的逻辑错误的场景。我们还审查和纠正 If-Then 谓词,确保每个谓词为安全评估提供合理的推理,并与真实世界的理解一致。  

**第二阶段:多模态数据生成。** 使用第一阶段中的文本描述,我们用 Gemini-Flash-2.5[comanici2025gemini]合成上下文图像,用 Stable Audio 1.0[evans2025stable]合成上下文音频。我们直接使用图像描述 \(T_I\) 作为图像生成模型的提示来生成相应的图像 I。然而,某些涉及敏感内容(例如儿童安全)的场景由于 Gemini-Flash-2.5 的安全策略而无法生成。我们将这些场景从基准中排除,因为它们缺乏完整的多模态上下文。  

对于音频生成,我们观察到当前的音频生成模型擅长合成单个声音事件,但在处理复杂的多事件声景时存在困难。因此,我们将复杂的音频描述 \(T_A\) 分解为单个声音事件并分别生成。例如,上下文音频描述“一个药瓶打开,随后是写告别信”可以分解为模板 \(\langle \text{sound event 1}, \text{relationship}, \text{sound event 2} \rangle\)。我们提示 Claude-Sonnet-4.5 从每个 \(T_A\) 中提取这种结构化表示,然后生成相应的音频 A,其中时间关系为“随后是”或“同时”。每个声音事件随后使用 Stable Audio 1.0 合成为 6 秒的音频片段。最后,我们根据关系组合片段:顺序片段首尾拼接,同时片段重叠 3 秒以实现自然混合。  

作为最终质量控制步骤,我们手动验证生成的多模态内容(图像和音频)与第一阶段中文本场景描述之间的一致性。合成内容未能准确反映预期场景的实例将被从数据集中移除。通过这一筛选过程,我们获得最终的基准数据集 \(\mathcal{D} = \{(I_i, A_i, S_i, R_i, L_i)\}_{i=1}^N\),其中每个实例包含:(1) 包含图像、音频片段和语音话语的多模态上下文 \((I_i, A_i, S_i)\);(2) 真值安全标签 \(R_i \in \{\text{safe},\text{unsafe}\}\);(3) 解释安全评估的谓词 \(L_i\)。表 2 (https://arxiv.org/html/2606.05177#S2.T2) 总结了数据集统计。MCBench 包含覆盖四个粗粒度安全类别的 11961196 个多模态场景。  

表 2:多模态情境的数据统计

相似文章

IMCBench:面向图像基础医疗对话的多模态大语言模型基准

arXiv cs.AI

IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。

多模态大语言模型能理解OCT吗?

Hugging Face Daily Papers

本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。