@LeeLeepenkman: 多模态大型语言模型的文本锚定语义扰动可转移越狱攻击 https://pap…
摘要
本文介绍了TA-SPA,一个针对多模态大型语言模型的黑盒越狱攻击框架,该框架利用基于文本的语义扰动,实现针对安全对齐的有效且可转移的攻击。
查看缓存全文
缓存时间: 2026/08/26 07:24
文本锚定语义扰动:针对多模态大语言模型的可迁移越狱攻击
https://t.co/NljjVIHrnS https://t.co/NGrf1icnF1
文本锚定语义扰动:针对多模态大语言模型的可迁移越狱攻击
来源:https://papers.app.nz/view/paper?id=9107387 多模态大语言模型(MLLMs)在视觉-语言交互领域取得了显著进展,但其安全对齐机制仍然容易受到越狱攻击。一个关键挑战在于,文本空间习得的安全行为无法可靠地迁移到融合的跨模态表征中,使得多模态输入可通过潜在语义线索被利用。我们提出文本锚定语义扰动攻击(TA-SPA),这是一种黑盒越狱框架,可在文本锚定的语义空间中优化可迁移扰动。TA-SPA整合了文本锚定语义分解(TASF)与语义保持增强(SPA):前者促进跨模态语义因子与模态特定残差的分离;后者在保持语义一致性的同时多样化有害目标锚点。实验表明,该攻击对商业MLLMs具有强效性与可迁移性,在典型防御机制下仍保持竞争力。额外控制实验与探测分析支持了预期的语义分解效果,但并非完全解耦,这推动了超越输入级过滤的表征层面对安全对齐机制的研究。
相似文章
相同模型,不同弱点:语言和模态如何重塑前沿多模态大语言模型的越狱攻击面
本文首次进行了系统的跨语言、多模态红队研究,比较了四种前沿多模态大语言模型在美国英语和墨西哥西班牙语下的越狱漏洞,揭示了语言并不会均匀地放大漏洞,并且安全排名在不同语言中并不保持一致。
一次越狱,多种语言:学习语言不敏感的意图表示用于多语言越狱检测
本文提出MLJailDe,一个多语言越狱检测框架,利用反向翻译数据增强和相对距离约束来提高跨语言泛化能力和鲁棒性,在11种语言上实现了98.5%的F1分数。
多模态大语言模型安全格局的演变:新兴威胁与防护措施综述
一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。
隐藏、重建与越狱:利用多模态大语言模型中的重建-隐藏权衡
本文分析了针对多模态大语言模型(MLLMs)的意图混淆越狱攻击中存在的重建-隐藏权衡问题。提出了感知隐藏的变体构建方法和与关键词相关的干扰图像,以更有效地利用模型漏洞。
多代采样越狱检测在大语言模型中的实证研究
实证研究表明,多代采样显著提升大语言模型的越狱检测能力,能发现单次审计遗漏的隐藏有害输出。