广度胜过深度:通过面向广度的后缀搜索改进基于GCG的越狱优化
摘要
该论文介绍了BOSS,一个面向广度的后缀搜索框架,可改进针对大型语言模型的基于GCG的越狱攻击,提高攻击成功率的同时减少优化时间。
arXiv:2609.02172v1 公告类型:新
摘要:基于优化的越狱攻击,如贪心坐标梯度(GCG),通过在白盒源模型上优化对抗后缀,实现了强大的有效性和可迁移性。然而,现有的基于GCG的方法依赖于平均对抗损失和深度贪心搜索,这可能会过度强调容易越狱的行为,而忽略后缀空间中的有前景区域。我们提出了BOSS,一个即插即用的框架,通过面向广度的后缀搜索改进基于GCG的越狱优化。BOSS使用尾部聚焦对抗损失(TFAL)、标准源损失和行为覆盖来选择终端后缀,然后探索多个短轨迹,并有选择地继续有前景的后缀。在公开基准测试上的实验表明,BOSS在多个基于GCG的方法中提高了攻击成功率,同时减少了优化时间。
查看缓存全文
缓存时间: 2026/09/03 05:52
The request was rejected because it was considered high risk
相似文章
SAFEGuard: 检测基于优化的越狱攻击,通过有害语义分析和流畅度测量
SAFEGuard 是一个统一检测框架,利用有害语义分析和流畅度测量来检测针对大型语言模型的基于优化的越狱攻击,性能优于现有最佳基线方法。
ICO:通过迭代上下文优化增强语义偏移越狱攻击
本文指出语义偏移越狱攻击因忽视上下文的语义偏移能力而受限,并提出迭代上下文优化(ICO)——一种黑盒框架,通过迭代优化上下文来提高对基础模型的攻击成功率。
一个后缀破解所有:针对合并模型家族的 Basin-Aware 越狱攻击
本文揭示了即使在组成模型安全对齐的情况下,模型合并中存在的越狱风险,并提出了 Basin-Aware Jailbreak (BAJ),用于在合并模型家族中生成可转移的对抗性后缀。
对抗性风格优化:基于GRPO的风格触发器优化增强VLM越狱攻击
本文发现多模态大语言模型(MLLMs)存在风格不一致性:其理解能力鲁棒,但安全机制可被风格触发器绕过。提出对抗性风格优化(ASO),利用GRPO微调图像编辑模型以增强越狱攻击。
优化对抗安全表征:激活引导的对抗性后缀与拒绝的几何结构
本文介绍了激活引导的GCG和Soft-GCG方法,通过针对大语言模型内部的拒绝表征来优化对抗性后缀,实现了比标准GCG快33倍的加速,并揭示了分布式的安全机制。