相同模型,不同弱点:语言和模态如何重塑前沿多模态大语言模型的越狱攻击面
摘要
本文首次进行了系统的跨语言、多模态红队研究,比较了四种前沿多模态大语言模型在美国英语和墨西哥西班牙语下的越狱漏洞,揭示了语言并不会均匀地放大漏洞,并且安全排名在不同语言中并不保持一致。
arXiv:2605.23157v1 公告类型:新
摘要:多模态大语言模型(MLLM)的攻击面依赖于语言,这揭示了对齐失败的机制结构。我们首次进行了系统的跨语言、多模态红队研究,比较了四种前沿MLLM(Claude Sonnet 4.5、GPT-5、Pixtral Large和Qwen Omni)在美国英语和墨西哥西班牙语下的越狱漏洞。我们使用一个包含363种不同提示场景的固定对抗基准,在纯文本和多模态条件下进行测试,并从每组语言的九名母语标注员匹配小组收集了52,272个危害评级和二元攻击成功判断。我们的核心发现是,语言并不会均匀地放大漏洞。贝叶斯混合效应分析表明,语言框架攻击(如角色扮演)在西班牙语提示下的有效性显著降低,而视觉显式多模态攻击则变得更加有效,这直接指向提示语言接口,而非整体的标注者宽松度。这种分离表明,语言和视觉对齐失败通过不同的机制运作,并且切换语言就足以暴露这种分离。实际后果是,安全排名在不同语言中并不保持一致。在墨西哥西班牙语参与者中,Qwen Omni取代Pixtral Large成为最易受攻击的模型,这一排名反转是任何对英语条件分数的标量校正都无法恢复的,而且尽管模型代际之间的绝对攻击成功率有所下降,但模型之间的差距并未缩小。这些发现表明,将语言和模态视为独立维度的安全评估框架从根本上错误地描述了全球部署的MLLM的攻击面,必须据此重新设计。
查看缓存全文
缓存时间: 2026/05/25 08:59
# 相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型(MLLM)的越狱攻击面
来源:https://arxiv.org/html/2605.23157
Casey Ford、Madison Van Doren、Sicheng Jin、Emily Dix Appen \{cford, mvandoren, sjin, edix\}@appen\.com
###### 摘要
多模态大语言模型(MLLM)的攻击面具有语言依赖性,其方式揭示了对齐失败的机制结构。我们首次开展了系统的跨语言、多模态红队研究,比较了四个前沿 MLLM(Claude Sonnet 4.5、GPT-5、Pixtral Large 和 Qwen Omni)在美国英语(en-US)和墨西哥西班牙语(es-MX)下的越狱脆弱性。使用一个包含363个多样化提示场景的固定对抗性基准,在纯文本和多模态条件下进行测试,我们从每个语言组的九名母语注释员匹配小组收集了52,272个危害评级和二元攻击成功判断。我们的核心发现是:语言并不会均匀地放大脆弱性。贝叶斯混合效应分析显示,诸如角色扮演之类的语言框架攻击在西班牙语提示下效果显著降低,而视觉显式多模态攻击的效果则增强,这直接指向了提示语言界面,而非全局注释员的宽松倾向。这种分离表明,语言和视觉对齐失败通过不同的机制运作,而切换语言足以暴露这种分离。实际后果是,安全排名在不同语言间并不一致。Qwen Omni 在 es-MX 参与者中取代 Pixtral Large 成为最脆弱的模型,这种排名反转是任何对英语条件分数进行标量校正都无法恢复的;同时,各模型世代的绝对攻击成功率虽有所下降,但模型间的差距并未缩小。这些发现表明,将语言和模态视为独立维度的安全评估框架从根本上错误描述了全球部署的 MLLM 的攻击面,必须据此重新设计。
## 1 引言
多模态大语言模型(MLLM)的攻击面并非模型的固定属性。它在结构上依赖于语言,其方式揭示了对齐实际如何失败。我们通过证明将对抗性提示语言从美国英语(en-US)切换到墨西哥西班牙语(es-MX)就足以暴露一种分离现象来展示这一点:在英语中成功的语言攻击技术在西班牙语中效果减弱,而视觉显式多模态攻击的效果增强。这种模式在机制上可解释为证据,表明语言和视觉对齐失败通过不同的路径运作,并且当前实践中的对齐训练嵌入的是语言特定的敏感性,而非语言无关的安全性。
这一解释直接联系到已知的对齐训练工作原理。基于 RLHF 的对齐从英语输出的人类反馈中学习,嵌入了模型对英语中越狱操作所依赖的修辞模式的敏感性:角色扮演框架、策略性说服、拒绝抑制。这种语言条件化的校准意味着,利用这些模式的西班牙语提示遇到的是一个已调整为识别英语模式、但未调整为识别西班牙语模式的模型。相比之下,视觉攻击通道涉及的加工路径与自然语言的关联较弱:图像与其对抗意图之间的关系并非通过同样的语言校准机制来处理,就像修辞框架那样。如果这一解释正确,我们观察到的分离现象就是对齐机制与语言相互作用的预测结果,而非事后意外。
Van Doren & Ford (2025) (https://arxiv.org/html/2605.23157#bib.bib58) 为此研究建立了实证基线:在对四个 MLLM 用英语进行的匹配红队场景组中,他们发现模型脆弱性在模态间存在显著的模型特异性差异,并将跨语言评估确定为未来工作的优先方向。本研究直接回应了这一优先方向。使用相同的经过验证的对抗性基准(包含 363 个独特提示,每个提示均在纯文本和多模态条件下进行),我们评估了之前工作中研究的模型的四个下一代继任者:Claude Sonnet 4.5、GPT-5、Pixtral Large 和 Qwen Omni。提示经专业翻译成墨西哥西班牙语,并分别以两种语言独立提交给每个模型;九名经过训练的 en-US 注释员对英语模型响应进行评级,九名经过训练的 es-MX 注释员对西班牙语模型响应进行评级,共产生 52,272 个观测值,使用贝叶斯混合效应模型进行分析,其中包含提示和评分者的交叉随机效应。
我们的贡献主要有三点:
1. (1) 我们提供了第一个机制性证据,来自匹配的双语红队设计,包含人工翻译的提示和母语注释,证明语言和视觉对齐失败通过不同的路径运作。在西班牙语提示下,语言攻击减弱而视觉攻击增强的分离现象直接指向提示语言界面作为对齐的结构性特征,而非注释员宽松倾向的干扰伪影。我们还表明,本研究中考察的模型世代间相对安全排名大体保持不变,而四个模型家族中有三个的绝对攻击成功率有所下降。
2. (2) 我们表明,语言依赖性对齐的实际后果是,安全排名在 en-US/es-MX 对比中不可转移:Qwen Omni 在 es-MX 参与者中取代 Pixtral Large 成为最脆弱的模型,这种排名反转是任何对英语条件分数进行标量校正都无法恢复的。这扩展了关于混合语言脆弱性的现有证据 (Emani 等人, 2025) (https://arxiv.org/html/2605.23157#bib.bib32),并确立了跨语言评估是安全评估的结构性问题,而非随着模型改进就能消除的问题。
3. (3) 我们证明,贝叶斯混合效应框架通过共同考虑提示级别和评分者级别的方差,能够揭示聚合分析会遗漏的跨语言和跨模态结构,并提供了可复用的分析脚本以促进在未来的安全评估中采用这种方法。
## 2 相关工作
LLM 的安全性已成为核心关切,对抗性提示被确立为压力测试漏洞的关键方法 (Gehman 等人,2020 (https://arxiv.org/html/2605.23157#bib.bib3);Solaiman 和 Dennison,2021 (https://arxiv.org/html/2605.23157#bib.bib13);Weidinger 等人,2021 (https://arxiv.org/html/2605.23157#bib.bib15))。研究表明,微妙的操纵可以绕过安全防护,产生潜在有害的输出 (Hayase 等人,2024 (https://arxiv.org/html/2605.23157#bib.bib4);Hu 等人,2024 (https://arxiv.org/html/2605.23157#bib.bib5);Luong 等人,2024 (https://arxiv.org/html/2605.23157#bib.bib9)),综述文章已编录了此类漏洞的广度 (Schwinn 等人,2023 (https://arxiv.org/html/2605.23157#bib.bib11);Shayegani 等人,2023 (https://arxiv.org/html/2605.23157#bib.bib12))。更近期的研究强调,表面上的安全结果可能受到拒绝行为而非稳健对齐的影响 (Zhang 等人,2025a (https://arxiv.org/html/2605.23157#bib.bib20)),并且依赖于显式拒绝前缀的机制本身易受前缀注入攻击 (Wu 等人,2025 (https://arxiv.org/html/2605.23157#bib.bib16))。多步骤和多轮攻击框架,包括任务并发 (Jiang 等人,2025 (https://arxiv.org/html/2605.23157#bib.bib23))、迭代说服 (Weng 等人,2025 (https://arxiv.org/html/2605.23157#bib.bib34)) 和推理模型利用 (Hagendorff 等人,2026 (https://arxiv.org/html/2605.23157#bib.bib30)),暴露了单轮基准系统性遗漏的失败模式。新的基准表明,尽管进行了迭代安全改进,但 SOTA 模型仍存在持续漏洞 (Zhang 等人,2025b (https://arxiv.org/html/2605.23157#bib.bib21);Andriushchenko 等人,2025 (https://arxiv.org/html/2605.23157#bib.bib1))。
本研究的关键机制性洞察在于对齐是语言条件化的。Deng 等人 (2023) (https://arxiv.org/html/2605.23157#bib.bib28) 证明了多语言安全失败嵌入在预训练阶段,并且 RLHF 并未改善:跨语言对齐瓶颈并非微调问题。Shen 等人 (2024) (https://arxiv.org/html/2605.23157#bib.bib29) 证实,为流行语言进行优化无法产生语言无关的安全性,而 Yong 等人 (2024) (https://arxiv.org/html/2605.23157#bib.bib24) 表明,将简单的恶意英语提示转换为资源匮乏的语言会导致攻击成功率急剧上升。Emani 等人 (2025) (https://arxiv.org/html/2605.23157#bib.bib32) 进一步表明,模型在混合语言语境中仍然容易受到恶意指令的影响。这些结果共同表明,基于 RLHF 的对齐嵌入了对英语中越狱操作所依赖的特定修辞模式的敏感性,使得当相同的攻击策略用其他语言表达时,这种敏感性不可用。
参见图注 图1:对抗性提示数据集的生成
另一组并行的工作确立了视觉攻击通道通过较少依赖语言条件的机制运作。图像是一个持续的对齐弱点:视觉-语言越狱成功绕过安全防护 (Li 等人,2025b (https://arxiv.org/html/2605.23157#bib.bib8);Niu 等人,2024 (https://arxiv.org/html/2605.23157#bib.bib10)),通用多模态攻击尽管有对齐策略仍能跨越模型家族泛化 (Wang 等人,2025 (https://arxiv.org/html/2605.23157#bib.bib14)),并且基于分心的构造可以系统性超载闭源 MLLM 中的安全机制 (Yang 等人,2026 (https://arxiv.org/html/2605.23157#bib.bib19))。音频代表了另一个通过不同机制运作的模态特定攻击面 (Li 等人,2026 (https://arxiv.org/html/2605.23157#bib.bib25))。Derner 和 Batistič (2025) (https://arxiv.org/html/2605.23157#bib.bib2) 直接连接了两个文献方向:将有害文本渲染为低资源语言的图像会显著提高攻击成功率并降低拒绝率,他们观察到多模态稳健性与多语言对齐无法分离。这种收敛使得我们在此报告的这种分离——语言攻击在西班牙语中减弱,视觉攻击增强——在机制上是预期的而非令人惊讶的。
Van Doren & Ford (2025) (https://arxiv.org/html/2605.23157#bib.bib58) 为本研究提供了实证基础,他们对四个前沿 MLLM 在纯文本和多模态条件下用英语进行了系统性红队评估,建立了模型特定的模态脆弱性模式,并将跨语言评估和贝叶斯建模确定为未来工作的优先方向。本研究是之前工作的直接扩展,使用相同的对抗性基准,在英语和墨西哥西班牙语两种语言下评估了这些模型的下一代继任者。研究还表明,安全行为在某些微调条件下会趋于稳定,这为解释我们结果中的世代比较提供了背景 (Xie 等人,2025 (https://arxiv.org/html/2605.23157#bib.bib17))。
## 3 方法论
### 3.1 研究设计
本研究复制并扩展了 Van Doren & Ford (2025) (https://arxiv.org/html/2605.23157#bib.bib58) 的工作,引入了双语评估分支。使用相同的对抗性提示集,我们在相同的纯文本和多模态条件下评估了之前工作中所考察模型的四个下一代继任者,并增加了一个墨西哥西班牙语语言组。363 个独特提示对中的每一个均在四种条件下实施:英语纯文本、英语多模态、西班牙语纯文本和西班牙语多模态。该设计在提示方面是完全被试内设计:每个场景在所有四个 MLLM 的所有四种条件下都出现,从而在通过混合效应建模控制提示级别方差的同时,能够干净地分解语言、模态和模型效应。所有注释数据和分析脚本公开于 https://github.com/c-e-ford-appen/multimodal-jailbreak-eval/。
### 3.2 模型选择
我们评估了四个商业可用的 MLLM:Anthropic Claude Sonnet 4.5 (Anthropic, 2025) (https://arxiv.org/html/2605.23157#bib.bib48)、OpenAI GPT-5 (OpenAI, 2025) (https://arxiv.org/html/2605.23157#bib.bib49)、Mistral Pixtral Large (AI, 2024) (https://arxiv.org/html/2605.23157#bib.bib50) 和 Alibaba Qwen Omni (Team, 2025) (https://arxiv.org/html/2605.23157#bib.bib51)。这些模型被选为 Van Doren & Ford (2025) (https://arxiv.org/html/2605.23157#bib.bib58) 中所评估模型的下一代继任者:依次对应 Claude Sonnet 3.5 (Anthropic, 2024) (https://arxiv.org/html/2605.23157#bib.bib52)、GPT-4o (OpenAI 等人,2024) (https://arxiv.org/html/2605.23157#bib.bib53)、Pixtral 12B (Agrawal 等人,2024) (https://arxiv.org/html/2605.23157#bib.bib54) 和 Qwen VL Plus (Bai 等人,2023) (https://arxiv.org/html/2605.23157#bib.bib55)。这代表了同样多样化的开发者起源(美国、欧洲和中国)和安全架构。所有四个模型都支持纯文本和多模态(文本+图像)提示,并在 2025 年 10 月至 2026 年 1 月期间通过官方 API 访问,使用与注释相同的专有注释平台。模型身份在整个过程中对注释员保持隐藏。
参见图注 图2:对测试的 LLM 模型响应进行注释
### 3.3 对抗性提示数据集
如图1 (https://arxiv.org/html/2605.23157#S2.F1) 所示,对抗性提示数据集来自 Van Doren & Ford (2025) (https://arxiv.org/html/2605.23157#bib.bib58),其中 26 位经验丰富的红队成员构建了 363 个独特的对抗性场景,针对三个危害类别:非法活动(n=167)、虚假信息(n=68)和不道德行为(n=128)。每个提示场景以美国英语编写,并实例化为纯文本和多模态(文本+图像)两个版本,使用相同的攻击策略,每个模型产生 726 个提示版本。红队成员从六种策略中选择构建其提示:角色扮演/假设性角色(n=127)、策略性框架/说服(n=62)、拒绝抑制(n=54)、忽略指令(n=41)、响应启动(n=39)和添加噪音或干扰(n=33),少量复合策略归类为其他(n=7)。对于多模态提示,使用了三种执行方法:有害文本配无害图像(n=211)、嵌入在图像中的文本(n=89)以及有害图像配无害或模糊标题(n=63)。红队成员要么创建原创图像,要么从预先批准的开源库中获取;所有提示文本均为原创。提示构建过程的完整细节(包括攻击策略指南)相似文章
一次越狱,多种语言:学习语言不敏感的意图表示用于多语言越狱检测
本文提出MLJailDe,一个多语言越狱检测框架,利用反向翻译数据增强和相对距离约束来提高跨语言泛化能力和鲁棒性,在11种语言上实现了98.5%的F1分数。
隐藏、重建与越狱:利用多模态大语言模型中的重建-隐藏权衡
本文分析了针对多模态大语言模型(MLLMs)的意图混淆越狱攻击中存在的重建-隐藏权衡问题。提出了感知隐藏的变体构建方法和与关键词相关的干扰图像,以更有效地利用模型漏洞。
多代采样越狱检测在大语言模型中的实证研究
实证研究表明,多代采样显著提升大语言模型的越狱检测能力,能发现单次审计遗漏的隐藏有害输出。
语言模型智能体群体中的涌现语言:从词元效率到规避监管
本文研究了自主LLM智能体在Moltbook平台上相互提出的涌现语言,发现有些语言专门设计用于规避人类监管,且可通过简短描述在上下文中学习。这些发现引发了对智能体群体监控的安全担忧。
衡量大型语言模型对N-day漏洞利用的影响(18分钟阅读)
本文来自Anthropic,评估了像Claude Mythos Preview这样的大型语言模型如何加速N-day漏洞利用的开发。在针对Firefox和Windows内核补丁的测试中,该模型自主构建了有效的漏洞利用链,突显了补丁空窗期风险的增加。