Multi2AV-Safety:多模态到音频-视频生成的安全基准测试

arXiv cs.AI 论文

摘要

Multi2AV-Safety是首个用于评估多模态到音频-视频生成安全性的基准,覆盖了所有11种非单例条件配置,包含11,024个攻击实例,并揭示了有害语义从良性输入中显现的组合风险。

arXiv:2608.26535v1 公告类型:新 摘要:音频-视频生成正从提示驱动合成迅速转向多模态条件,其中文本、图像、音频和视频可以共同塑造生成的输出。这一转变改变了安全评估的本质:有害意图可能不再存在于任何单一输入中,而是从原本良性或弱有害条件跨模态和时间的交互中显现。然而,现有的安全基准主要以提示为中心或与固定条件接口绑定,使得此类组合风险难以系统研究。为弥合这一差距,我们引入Multi2AV-Safety,据我们所知,这是首个安全基准,覆盖音频-视频生成的所有11种非单例T/I/A/V条件配置,包含11,024个攻击实例。在Multi2AV-Safety上的评估揭示了代表性多模态安全防护在攻击机制和危害证据结构上的系统性弱点。我们的评估显示了两种互补的失败模式:有害语义可以从单独良性输入的组合中显现,而显式有害线索在与良性多模态上下文混合时可能更难检测。总之,这些结果将\emph{组合风险感知}确定为保障多模态条件音频-视频生成的核心能力差距:当前安全防护无法可靠地跨模态和时间整合安全证据,即使所有条件输入都是可观察的。该数据集将于2026年10月公开发布。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:35

# Multi2AV‑Safety:面向多模态到音视频生成的安全基准测试
来源:https://arxiv.org/html/2608.26535

苗昌涛††注:项目负责人。单位:独立研究者
吴百奇 单位:浙江大学
陆志远 单位:合肥工业大学
杨康 单位:合肥工业大学
赵佩玮 单位:合肥工业大学
陈俊驰 单位:中国科学技术大学
刁云峰 单位:合肥工业大学
刘赫 单位:独立研究者
楚琪††注:通讯作者。单位:中国科学技术大学
龚韬 单位:中国科学技术大学
余能海 单位:中国科学技术大学

###### 摘要

音视频生成正迅速从基于提示的合成转向多模态条件输入,其中文本、图像、音频和视频可以共同影响生成结果。这一转变改变了安全评估的本质:有害意图可能不再存在于任何单一输入中,而是从原本无害或弱有害的条件跨模态和时间的交互中涌现。然而,现有的安全基准测试大多仍以提示为中心或受限于固定的条件输入接口,使得这类组合风险难以进行系统性研究。为弥合这一差距,我们引入了 Multi2AV‑Safety,据我们所知,这是首个覆盖音视频生成全部 11 种非单一模态文本/图像/音频/视频条件配置的安全基准,包含 11,024 个攻击实例。在 Multi2AV‑Safety 上的评估揭示了代表性多模态安全防护机制在攻击机制和有害证据结构方面的系统性弱点。我们的评估揭示了两种互补的失败模式:单独无害的输入组合可能产生有害语义;而明确的有害线索在混入良性多模态上下文后则变得更难检测。这些结果共同指出了*组合风险感知*是保障多模态条件音视频生成的核心能力缺口:即使所有条件输入都可观测,当前的安全防护机制也无法可靠地整合跨模态和时间的安全证据。

参见标题 图1:Multi2AV‑Safety 概览:11,024 个攻击实例,涵盖文本、图像、音频和视频的所有 11 种多模态组合,四种攻击机制,五类有害内容。## 1 引言

音视频生成正超越基于提示的合成,转向多模态条件输入,其中文本指令、参考图像、语音和视频上下文共同塑造生成结果(HaCohen 等,2026)。更重要的是,多模态条件改变了安全相关证据在输入中的表达方式。在仅文本条件的情况下,不安全意图通常在提示中明确表达。相比之下,多模态条件产生了两种互补的风险形式:*组合危害*(Composed Harm),即有害语义仅通过跨模态或时间的独立无害输入的联合解释而出现;以及*稀释危害*(Diluted Harm),即明确的有害线索在混入良性多模态上下文后变得难以检测。这些风险无法通过逐模态评估可靠捕获,凸显了孤立分析条件输入的局限性(Ma 等,2025)。

然而,这种条件输入集合的视角仅部分反映在现有的生成安全基准中。先前的工作已从文本条件的图像或视频生成(Miao 等,2024;Dai 等,2024)扩展到文本-图像条件和组合或时间攻击(Ma 等,2026;Lee 等,2026),但大多数基准仍然只考虑一种或两种输入模态。这种有限的覆盖范围使得难以表征那些证据分布在输入中、被良性上下文掩盖、或仅通过多模态或时间组合才显现的风险。这也使得归因变得复杂:当安全性能下降时,无法确定原因是攻击本身、缺失的模态信息,还是未能整合跨输入的安全证据。这要求建立一个统一的评估空间,系统地覆盖文本、图像、音频和视频条件输入的所有组合,同时明确攻击机制和有害证据结构。

基于这一视角,Multi2AV‑Safety 对多模态条件音视频生成进行了系统性的红队评估,明确地将多模态结合作为安全的一个独立维度进行评估(图1)。据我们所知,它是首个系统性地覆盖文本(T)、图像(I)、音频(A)和视频(V)全部 11 种非单一组合配置的多模态条件音视频生成安全基准。其 11,024 个攻击实例跨越二至四种模态条件、四种攻击机制和五类有害内容,并明确标注了有害证据在模态和时间上的分布。这种分解设计支持机制分层和证据感知分析,能够更精确地将安全失败归因于攻击类型、证据结构或多模态组合。配对的输入侧和输出侧评估进一步通过评估成功攻击是否被拦截,将此归因与防护机制的有效性联系起来。在这些设置下,*组合危害*和*稀释危害*都暴露出相同的弱点:即使能访问所有条件输入,安全防护机制也难以识别跨模态和时间交互产生的风险,揭示了*组合风险感知*的更广泛局限。我们的贡献有两方面:

- •我们引入了 Multi2AV‑Safety,首个系统性地覆盖多模态条件音视频生成全部 11 种非单一 T/I/A/V 条件配置的安全基准,包含 11,024 个攻击实例,涵盖四种攻击机制和五类有害内容。
- •我们的评估揭示了两种组合安全风险:*组合危害*和*稀释危害*,表明仅访问所有条件模态不足以识别跨模态和时间的风险。

## 2 相关工作

#### 生成模型安全基准。

现有的图像和视频生成安全基准主要检查有害、越狱或对抗性提示在固定条件接口下是否导致不安全输出。I2P 和 T2ISafety 专注于图像生成,而 SafeSora 和 T2VSafetyBench 将此类评估扩展到视频生成(Schramowski 等,2023;Li 等,2025;Dai 等,2024;Miao 等,2024)。它们共同建立了广泛的内容和攻击策略覆盖,但主要在预设的条件设置下研究安全,而非多个条件输入之间的交互。

#### 多模态生成中的组合风险。

近期工作表明,风险可能源于条件输入之间的交互。SafeGen-Bench 和 Multimodal Pragmatic Jailbreak 揭示了跨模态组合危害,而 SceneSplit 展示了时间碎片化的风险(Ma 等,2026;Liu 等,2025;Lee 等,2026)。这些现象在不同的条件和攻击设置下被研究;Multi2AV‑Safety 将它们置于一个统一的条件空间中,同时保持攻击机制和有害证据结构明确,总结于表1。

表 1:代表性媒体生成安全基准的范围。 “Multi” 表示两个或更多独立的有害输入载体;“Joint” 表示任何单独输入都无法获取的危害。输入攻击构建有害证据基准 / 数据集 T I A V 输出直接 越狱 对抗 时间 单一 多重 联合
I2P (Schramowski 等, 2023) ✓\checkmark – – – I ✓\checkmark – – – ✓\checkmark – –
T2ISafety (Li 等, 2025) ✓\checkmark – – – I ✓\checkmark – – – ✓\checkmark – –
T2I-RiskyPrompt (Zhang 等, 2026) ✓\checkmark – – – I ✓\checkmark ✓\checkmark ✓\checkmark – ✓\checkmark – –
JailbreakDiffBench (Jin 等, 2025) ✓\checkmark – – – I/V – ✓\checkmark ✓\checkmark – ✓\checkmark – –
MPJ (Liu 等, 2025) ✓\checkmark – – – I – ✓\checkmark – – – – –
SafeSora (Dai 等, 2024) ✓\checkmark – – – V ✓\checkmark – – – ✓\checkmark – –
T2VSafetyBench (Miao 等, 2024) ✓\checkmark – – – V ✓\checkmark ✓\checkmark – – ✓\checkmark – –
SceneSplit (Lee 等, 2026) ✓\checkmark – – – V – ✓\checkmark – ✓\checkmark ✓\checkmark – –
ConceptRisk / TI2V (Ma 等, 2025) ✓\checkmark ✓\checkmark – – V ✓\checkmark – ✓\checkmark – ✓\checkmark ✓\checkmark –
SafeGen-Bench (Ma 等, 2026) ✓\checkmark ✓\checkmark – – V ✓\checkmark ✓\checkmark – – ✓\checkmark – ✓\checkmark
VVA-Bench (Sun 等, 2026) ✓\checkmark ✓\checkmark – – V – ✓\checkmark – ✓\checkmark ✓\checkmark – –
Multi2AV-Safety ✓\mathbf{\checkmark} ✓\mathbf{\checkmark} ✓\mathbf{\checkmark} ✓\mathbf{\checkmark} AV ✓\mathbf{\checkmark} ✓\mathbf{\checkmark} ✓\checkmark ✓\mathbf{\checkmark} ✓\mathbf{\checkmark} ✓\mathbf{\checkmark} ✓\mathbf{\checkmark}
#### 多模态生成的安全防护机制。

防护机制同样从基于 Llama Guard 3 Vision 的图文审核(Chi 等,2024)和基于 SafeWatch 的视频安全(Chen 等,2025)发展到基于 ConceptGuard 的生成专用多模态检测(Ma 等,2025)以及基于推理的防护机制,如 GuardReasoner-VL、GuardTrace-VL 和 GuardReasoner-Omni(Liu 等,2025;Xiang 等,2026;Zhu 等,2026)。更广泛的模态访问增加了可观测的安全证据,但并不能保证其跨模态的正确整合,这推动了我们的组合风险评估。

## 3 Multi2AV‑Safety

受第1节中归因问题的启发,Multi2AV‑Safety 系统性地变化多模态组合,同时明确追踪危害来源以及有害证据在模态和时间上的分布。相同的构建原则应用于所有 11 种条件配置,模态组合、攻击机制和有害证据结构被视为独立的设计维度,总结于表2和图1。

### 3.1 分解式基准设计

令 \(\mathcal{M}=\{T,I,A,V\}\) 表示可用条件模态的集合。我们将每个基准实例表示为

\(x = (s, S, \{u_m\}_{m\in S}, a, e, h)\),其中 \(s\) 表示目标语义场景;\(S \subseteq \mathcal{M}\),且 \(2 \leq |S| \leq 4\),指定了活跃的条件模态;\(u_m\) 是模态 \(m\) 的具体输入;\(a\) 表示攻击机制;\(e\) 表征有害证据结构;\(h\) 表示有害类别。条件空间覆盖 T/I/A/V 的所有 \(\binom{4}{2} + \binom{4}{3} + \binom{4}{4} = 11\) 个非单一子集。明确这些因素是我们设计的核心:\(a\) 捕获*如何*引入目标危害,而 \(e\) 捕获识别该危害所需证据*在何处或何时*变得可用。

我们将有害证据结构参数化为 \(e = (\mathcal{C}, k, \rho)\),其中 \(k\) 表示在单独评估时为有害的活跃条件模态数量。在可局部归因的情况下,\(\mathcal{C} \subseteq S\) 表示这些有害模态,且 \(k = |\mathcal{C}|\)。我们将 \(k=0\) 分配给组合情况,即没有单个模态,或对于时间攻击而言的时间段,本身传递完整的有害语义。这定义了三种证据模式:*组合危害*(\(k=0\)),即危害仅通过多模态或时间组合产生;*稀释危害*(\(0 < k < |S|\)),即有害证据嵌入在良性上下文中;以及*完全危害*(\(k = |S|\)),即每个活跃模态单独评估都是有害的。我们使用 \(\rho \in \{local, joint, temporal\}\) 进一步区分决定性证据是可局部归因的、跨模态联合涌现的,还是跨时间段涌现的。为了构建三模态和四模态情况,我们通过扩展选定的双模态风险场景,添加与场景一致的额外条件,同时保留目标场景 \(s\) 和有害类别 \(h\)。

### 3.2 场景策展与多模态实现

每个基准实例始于一个与模态无关的目标风险场景,该场景指定了底层事件、有害语义和有害类别。对于直接攻击(Direct)案例,大多数有害文本种子来源于 Adversarial Nibbler(Quaye 等,2024)、I2P(Schramowski 等,2024)、T2I-RiskyPrompt(Zhang 等,2026)、T2ISafety(Li 等,2025)、SafeSora(Dai 等,2024)和 T2VSafetyBench(Miao 等,2024)。Claude Sonnet 4.6 将这些种子适配到音视频生成,并在相同的有害分类法下生成少量额外场景(Anthropic,2026b)。越狱(Jailbreak)、对抗(Adversarial)和时间(Temporal)案例的种子来源和构建过程在第3.3节单独描述。

对于每个有害场景,我们构建一个匹配的良性对应物,在保留底层事件和上下文的同时移除安全关键概念。GPT-5 生成初始改写(OpenAI,2025),随后由专家验证语义一致性。这些有害-良性配对使我们能够控制有害证据是存在于单个输入中,还是仅通过它们的组合才出现。

给定活跃条件集 \(S\),每个场景随后被实现为对齐的文本、图像、音频或视频条件。每个条件并不复制相同的内容,而是表达共享场景的一个兼容部分,允许将有害证据定位到特定模态或分布式

相似文章

MME-Safety:一个用于MLLMs安全评估的细粒度基准

arXiv cs.CL

MME-Safety 是一个经过严格验证的基准,用于评估多模态大语言模型的安全性,具有四维标注框架和一个分层框架,以评估风险场景、危害严重程度和特定模态的隐蔽性水平。