@LeeLeepenkman: 多模态大型语言模型的文本锚定语义扰动可转移越狱攻击 https://pap…

X AI KOLs Timeline 论文

摘要

本文介绍了TA-SPA,一个针对多模态大型语言模型的黑盒越狱攻击框架,该框架利用基于文本的语义扰动,实现针对安全对齐的有效且可转移的攻击。

多模态大型语言模型的文本锚定语义扰动可转移越狱攻击 https://t.co/NljjVIHrnS https://t.co/NGrf1icnF1
查看原文
查看缓存全文

缓存时间: 2026/08/26 07:24

文本锚定语义扰动:针对多模态大语言模型的可迁移越狱攻击

https://t.co/NljjVIHrnS https://t.co/NGrf1icnF1


文本锚定语义扰动:针对多模态大语言模型的可迁移越狱攻击

来源:https://papers.app.nz/view/paper?id=9107387 多模态大语言模型(MLLMs)在视觉-语言交互领域取得了显著进展,但其安全对齐机制仍然容易受到越狱攻击。一个关键挑战在于,文本空间习得的安全行为无法可靠地迁移到融合的跨模态表征中,使得多模态输入可通过潜在语义线索被利用。我们提出文本锚定语义扰动攻击(TA-SPA),这是一种黑盒越狱框架,可在文本锚定的语义空间中优化可迁移扰动。TA-SPA整合了文本锚定语义分解(TASF)与语义保持增强(SPA):前者促进跨模态语义因子与模态特定残差的分离;后者在保持语义一致性的同时多样化有害目标锚点。实验表明,该攻击对商业MLLMs具有强效性与可迁移性,在典型防御机制下仍保持竞争力。额外控制实验与探测分析支持了预期的语义分解效果,但并非完全解耦,这推动了超越输入级过滤的表征层面对安全对齐机制的研究。

相似文章