多代采样越狱检测在大语言模型中的实证研究
摘要
实证研究表明,多代采样显著提升大语言模型的越狱检测能力,能发现单次审计遗漏的隐藏有害输出。
arXiv:2604.18775v1 公告类型: new
摘要:检测大语言模型的越狱行为仍具挑战,尤其是强对齐模型极少输出有害内容时。本研究基于 JailbreakBench Behaviors 数据集及多种对齐强度不同的生成模型,对真实场景下的输出型越狱检测进行实证分析。我们评估了基于词法的 TF-IDF 检测器与基于生成不一致性的检测器在不同采样预算下的表现。结果显示,单输出评估系统性低估越狱风险,增加采样次数可揭示更多有害行为。从单次生成增至适度采样时提升最显著,继续扩大采样预算则收益递减。跨模型实验表明,检测信号可部分泛化,相关模型家族间迁移更强。类别级分析进一步指出,词法检测器同时捕获行为信号与主题线索,而非纯粹有害行为。总体而言,适度多样本审计可更可靠、更实用地评估模型脆弱性并提升大语言模型的越狱检测效果。代码将开源。
查看缓存全文
缓存时间: 2026/04/22 08:29
# 大语言模型越狱检测中多代采样方法的实证研究 来源:https://arxiv.org/html/2604.18775 \\orgdiv 计算机科学学院,\\orgname诺丁汉大学,\\orgaddress\\city诺丁汉,\\country英国 ###### 摘要 检测大语言模型的越狱行为仍然极具挑战,尤其对强对齐模型而言,其有害输出极少出现。本文在真实场景下,基于 JailbreakBench Behaviors 数据集及多种对齐强度不同的生成模型,对输出端越狱检测进行实证研究。我们评估了词法 TF-IDF 检测器与生成不一致性检测器在不同采样预算下的表现。结果显示,单输出评估系统性低估了越狱脆弱性:随着采样次数增加,更多有害行为被揭示。从单代到适度采样(约 3 次)的收益最大,继续增大采样预算则呈边际递减。跨模型实验表明,检测信号可部分迁移,同一家族模型间迁移性更强。类别级分析进一步指出,词法检测器同时捕获了行为信号与主题线索,而非纯粹的有害行为。总体而言,适度多采样审计能更可靠、更实用地估计模型脆弱性并改进越狱检测。代码将开源。 ###### 关键词 大语言模型,越狱检测,多代采样,AI 安全,对抗评估 ## 1 引言 大语言模型(LLMs)已广泛应用于搜索、内容生成、编程辅助与决策支持等场景\[1,2\]。其快速普及使其成为消费级产品与医疗、金融、法律等高风险领域的核心组件\[3\]。广泛部署对可靠性与安全性提出更高要求。随着能力增强与易用性提升,鲁棒性、可控性与滥用问题成为可信 AI 研究的焦点\[4,5\]。 安全是 LLM 安全的关键环节。尽管指令微调与 RLHF\[6\] 等对齐方法不断进步,模型仍易受对抗提示策略(即越狱攻击)影响\[7,8\]。这些攻击利用指令跟随与安全约束之间的交互,使模型在存在防护的情况下仍生成有害或违规输出\[9\]。研究表明,此类攻击易于构建且跨模型、跨对齐设置均有效\[10,11\],提示当前对齐技术尚无法提供可靠的安全保证。 现有研究多聚焦于改进对齐或设计检测方法,而对越狱脆弱性的评估本身关注不足。常见局限是仅用单次输出来评估脆弱性与检测性能\[12,13\]。虽便利,但 LLM 对同一输入可产生不同输出\[14,15\]。在安全关键场景,这种随机性至关重要:模型可能某次拒绝有害请求,另一次却遵从。图 1 示意该问题并提出关键问题:单输出评估在对抗 prompt 下遗漏了多少行为? 本文在真实场景下对输出端越狱检测进行实证研究。我们评估词法基线与生成不一致性两种检测方法,跨多种对齐强度的生成模型,并分析不同采样预算(单输出到多代)对脆弱性估计与检测可靠性的影响。 我们得出三点主要发现: 1. 单输出评估低估越狱脆弱性,增加采样可揭示更多有害行为; 2. 适度多采样(约 3 次)即可捕获绝大部分可观测脆弱性,更大采样预算收益有限且可能引入方差; 3. 检测信号可部分跨模型迁移,但受行为模式与词法线索共同影响。 结果表明,多采样审计能更可靠、更实用地评估与检测 LLM 越狱行为。引入少量随机生成即可在计算成本可控的前提下提升脆弱性估计与检测效果。本工作呼吁从单输出评估转向考虑采样的评估协议,以更好反映 LLM 部署时的随机特性。 ## 2 相关工作 ### 2.1 LLM 安全与对齐 大语言模型通常通过指令微调与 RLHF 对齐,将人类偏好融入训练以减少有害输出\[6,16\]。这些方法显著提升了模型平均行为。然而,越来越多研究表明,对齐不足以保证对抗鲁棒性:强对齐模型仍会被精心构造的输入诱导出有害输出\[17\]。因此,安全成为 LLM 安全的核心关切,尤其在开放或用户直面环境。 ### 2.2 越狱攻击 越狱攻击旨在绕过对齐机制,利用指令跟随与安全约束的交互,使模型生成受限或有害内容。实证研究显示,此类攻击在广泛模型上成功率很高,包括经过深度对齐的模型\[18,19\]。攻击可跨架构迁移,表明其利用的是共享弱点而非特定实现细节。现代技术 increasingly 采用间接策略,如提示改写、角色扮演、多步推理以隐藏恶意意图\[7\];间接提示注入则把指令隐藏在外部看似无害的内容中\[20\],使表面分析更难察觉。 ### 2.3 越狱检测方法 检测方法可按利用信息类型分类\[21,22\]。基于提示的方法分析输入 prompt,计算高效且易部署,但对改写敏感。利用内部信号(隐藏态、梯度)的方法信息更丰富,但受限于黑盒场景无法获取内部状态。基于输出的方法仅依赖生成文本,适用于真实部署,但常依赖表层特征或规则,泛化能力受限。 ### 2.4 输出层检测及其局限 早期工作依赖人工评估与规则过滤器\[16,17\]。近期转向统计特征,如似然度与风格特征\[24,25,26\]。词法方法高效但难捕获隐含意图;语义方法通过多输出间不一致性捕捉深层行为信号\[27,28\],鲁棒性更好但仍受评估设置影响。普遍局限是假设单输出足以代表模型行为,忽略生成随机性。 ### 2.5 随机性与多代采样 LLM 通过随机解码生成文本,同一 prompt 可产生不同响应\[29\]。该特性被用于自一致性等方法提升推理性能\[30\]。在安全场景,随机性意味着模型可能某次拒绝、某次遵从,单输出评估会遗漏罕见但关键失败。最新研究表明,多输出间的不一致本身可作为对抗行为信号\[28\]。因此,安全评估协议应显式考虑生成随机性。 ### 2.6 研究空白与定位 现有越狱检测工作多在单输出设定下评估,难以全面捕捉模型行为,可能低估脆弱性,且采样策略与检测性能的交互缺乏系统研究。本文将越狱检测框定为多采样审计问题,系统研究每 prompt 聚合多代对越狱成功率与检测性能的影响,考察采样预算、跨模型迁移与类别级差异,提供更全面的输出端越狱检测视角。 ## 3 方法 ### 3.1 问题形式化 本文将越狱检测定义为二元分类任务:对每条生成响应判定安全/不安全。该形式在文本分类与机器生成文本检测中常见\[26,24\]。检测仅依赖输出文本,模拟真实黑盒场景,输入 prompt 与内部状态不可见,相比基于提示或内部信号的方法更受限但更实用。 ### 3.2 数据与生成模型 我们使用专为评估模型对抗行为设计的 JailbreakBench-Behaviours 数据集\[31\],含行为目标与类别标签,支持超越简单分类的分析。
相似文章
一次越狱,多种语言:学习语言不敏感的意图表示用于多语言越狱检测
本文提出MLJailDe,一个多语言越狱检测框架,利用反向翻译数据增强和相对距离约束来提高跨语言泛化能力和鲁棒性,在11种语言上实现了98.5%的F1分数。
相同模型,不同弱点:语言和模态如何重塑前沿多模态大语言模型的越狱攻击面
本文首次进行了系统的跨语言、多模态红队研究,比较了四种前沿多模态大语言模型在美国英语和墨西哥西班牙语下的越狱漏洞,揭示了语言并不会均匀地放大漏洞,并且安全排名在不同语言中并不保持一致。
面向大推理模型的基于强化学习的越狱攻击中的注意力引导奖励
本文研究了对大型推理模型(LRM)的越狱攻击,揭示了攻击成功率与注意力模式相关。作者提出了一种基于强化学习的越狱方法,将注意力信号纳入奖励函数,并采用多样化的说服策略,在多个基准测试中实现了显著更高的攻击成功率。
MJ: 基于分解信用分配的多轮LLM越狱
本文提出了DC-GRPO,一种面向多轮LLM越狱学习的回合级信用分配框架,在多个基准测试中实现了超过98%的攻击成功率,优于现有方法。
中间层知道什么:从熵动力学检测越狱攻击
本文通过使用logit lens分析跨层的标记级预测熵轨迹,研究了越狱尝试如何被编码在大语言模型的内部表示中。研究发现,中间层的熵动力学比聚合统计更具区分性,提供了一种无需训练且跨多个模型一致的检测方法。