鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI 论文

摘要

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

arXiv:2607.20472v1 公告类型:新 摘要:当用户向语言模型询问有害内容时,这是真正的攻击,还是一个被误解但出于善意的提问?这种模糊性是LLM安全的核心挑战之一。假设最坏情况的模型会伤害合法用户,而假设最好的模型则容易被利用。在多轮对话中,问题更加复杂,因为攻击者的真实意图可能只在多次交流中逐步显现,然而现有的安全框架采用上下文赌博机的处理方法,忽略了对话的轨迹。 为此,我们提出对话批评者引导采样(DCGS)框架,通过在每个对话轮次推断用户意图来解决这一问题。DCGS不是应用关于安全与否的固定规则,而是基于完整的对话历史学习用户的可能意图,并据此生成回复。形式上,我们将对抗性对话建模为马尔可夫决策过程,并在单个词元和话语(完整回复)层面上学习基于价值和遗憾的批评者,通过动作-价值批评者对候选回复进行评分。我们证明,这种推理时重加权近似于基础策略的指数倾斜,保证了任何有限候选池的期望回报改进,这是群体相对目标所不具备的特性。在CARES-18k、WildJailbreak、Redbench和Harmbench上的评估表明,DCGS在对抗性对话任务上优于强大的鲁棒基线和前沿模型。DCGS还能迁移到前沿模型,在不进行微调的情况下提高其鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:00

# 稳健评判器:保护LLM免受多轮攻击  
来源:https://arxiv.org/html/2607.20472  

Roman Belaire rbelaire\.2021@phdcs\.smu\.edu\.sg & Arunesh Sinha arunesh\.sinha@rutgers\.edu & Pradeep Varakantham pradeepv@smu\.edu\.sg  

###### 摘要  

当用户向语言模型提出有害请求时,这是真正的攻击,还是一个被误解但出于善意的提问?这种歧义性是LLM安全性的核心挑战之一。总是假设最坏情况的模型会伤害合法用户;总假设最好情况的模型则容易被利用。在多轮对话中,这一问题变得更加复杂,因为攻击者的真实意图可能只在多次交互中逐渐显露,而现有的安全框架采用上下文赌博机的处理方式,忽略了对话的轨迹。为此,我们提出了对话评判器引导采样(DCGS),这是一个通过在每一轮对话中推断用户意图来解决此问题的框架。DCGS不是应用关于安全与否的固定规则,而是基于完整的对话历史学习用户可能的意图,并据此生成响应。形式上,我们将对抗性对话建模为马尔可夫决策过程,并在单个标记和话语(完整响应)级别学习基于价值和遗憾的评判器,通过动作-价值评判器对候选响应进行评分。我们证明了这种推理时权重调整近似于对基础策略的指数倾斜,保证在任何有限候选池中期望回报的改进,这是群体相对目标所不具备的特性。在CARES-18k、WildJailbreak、Redbench和Harmbench上的评估表明,DCGS在对抗性对话任务上优于强大的稳健基线和前沿模型。DCGS还可以迁移到前沿模型,无需微调即可提高其稳健性。  

## 1 引言  

部署在开放环境中的大型语言模型面临一个无法通过单轮对话解决的对手识别问题:看似有害的请求可能来自一个好奇的、善意的用户,而听起来无害的查询可能是复杂多轮攻击的开端。默认拒绝以解决这种歧义性的模型会令合法用户失望;默认服从的模型则容易被利用。相反,正确的响应不取决于任何单个消息的表面价值,而取决于对话伙伴不可观察的意图。  

现有安全框架在结构上无法很好地处理这个问题。LLM安全性研究涉及三大方向:基于分类器的危害检测、用于对抗发现的红队测试,以及直接塑造模型行为的安全训练。在安全训练中,从业者通常将对齐、无害性和对抗稳健性视为统一目标,尽管每个目标针对的是性质不同的场景。对齐和无害性训练降低了表现良好的模型在正常条件下造成伤害的可能性。对抗稳健性则应对更复杂的环境:用户可能主动且策略性地引导模型产生有害输出。将这些目标混为一谈,或优化帮助性与无害性之间单一的固定权衡[35 (https://arxiv.org/html/2607.20472#bib.bib81),1 (https://arxiv.org/html/2607.20472#bib.bib36)],会导致分类错误;两者之间的最佳平衡是用户意图的函数,任何静态奖励组合都无法捕捉。其经验后果已有充分记录:经过安全训练的模型经常拒绝那些表面上与对抗性请求相似的良性查询[56 (https://arxiv.org/html/2607.20472#bib.bib38),13 (https://arxiv.org/html/2607.20472#bib.bib3),31 (https://arxiv.org/html/2607.20472#bib.bib35),40 (https://arxiv.org/html/2607.20472#bib.bib4)],并且帮助性与无害性之间的权衡会随着安全训练的深入而加剧,而不是缓解[49 (https://arxiv.org/html/2607.20472#bib.bib5),11 (https://arxiv.org/html/2607.20472#bib.bib34)]。  

多轮交互进一步加剧了单轮框架无法解决的问题。攻击者利用信任建立[17 (https://arxiv.org/html/2607.20472#bib.bib17)]、上下文操控[8 (https://arxiv.org/html/2607.20472#bib.bib76),54 (https://arxiv.org/html/2607.20472#bib.bib72)]和逐步升级[41 (https://arxiv.org/html/2607.20472#bib.bib77)],通过一系列轮次发送消息,每轮都会改变对话上下文,这些变化理应(但通常并未)影响模型后续的行为。将对话建模为上下文赌博机问题[35 (https://arxiv.org/html/2607.20472#bib.bib81),1 (https://arxiv.org/html/2607.20472#bib.bib36)],每轮给予独立奖励,丢弃了这种结构。  

我们认为,原则性的对抗稳健性要求将用户意图视为待推断的潜在变量。在每一轮,智能体应根据完整的对话历史更新其对用户是善意还是敌意的假设,并基于推断出的意图做出响应。我们将此形式化为对抗性马尔可夫决策过程(MDP),并提出一个评判器引导的生成框架,该框架学习在多轮交互中区分这些情况。我们的主要贡献如下:  

1. **对话评判器引导采样**。我们引入一个两阶段生成过程:智能体首先生成一个关于用户意图的估计(作为标记序列),然后基于该估计生成响应。我们将此流程形式化为关于对话轨迹的MDP,并提出了DCGS,这是一个利用学习到的对话评判器对候选话语进行原则性推理时权重调整的程序。DCGS轻量且可黑盒迁移到更大的前沿模型,无需微调即可提高稳健性。  
2. **策略改进保证**。我们证明,DCGS渐近地近似于将基础策略(演员LLM)指数倾斜向更优策略,并保证在任何有限候选池中期望Q值的改进。这一理论结果将我们的方法与群体相对奖励区分开来,并佐证了引导解码领域的工作(见第2节 (https://arxiv.org/html/2607.20472#S2))。  
3. **稳健性目标**。我们将对抗性强化学习文献中的目标适配到我们的双层设定中。在第一阶段,意图评判器通过反事实目标进行训练,该目标同时考虑了敌意和善意用户假设,在不依赖竞争损失项的情况下共同惩罚过度拒绝和有害服从。在第二阶段,标记级别的信用分配使得能够基于推断的意图进行精确响应。  
4. **实证验证**。DCGS在防御成功率上取得了显著提升,优于包括前沿模型在内的强基线,并在最新数据集上保持了对良性查询具有竞争力的目标完成率。  

## 2 相关工作  

**对LLM的对抗攻击**:针对LLM的对抗攻击方法学开发了一些示例和案例研究,其中目标LLM可以通过看似无害的交互被引导产生有害输出。为此,像Harmbench[32 (https://arxiv.org/html/2607.20472#bib.bib68)]这样的数据集提供了明显有害的提示用于对抗研究,而CARES-18k[34 (https://arxiv.org/html/2607.20472#bib.bib2)]和WildJailbreak[28 (https://arxiv.org/html/2607.20472#bib.bib70)]等数据集还包含了伪装成有害的提示。后两者以及其它数据集(例如XSTest[40 (https://arxiv.org/html/2607.20472#bib.bib4)]、RedBench[13 (https://arxiv.org/html/2607.20472#bib.bib3)]、ORBench[10 (https://arxiv.org/html/2607.20472#bib.bib14)])为那些对安全目标过拟合的模型提供了表面上看似有害的提示覆盖。值得注意的是,对抗性数据集仅局限于单轮交互;虽然存在多轮攻击方法[41 (https://arxiv.org/html/2607.20472#bib.bib77),54 (https://arxiv.org/html/2607.20472#bib.bib72),17 (https://arxiv.org/html/2607.20472#bib.bib17),38 (https://arxiv.org/html/2607.20472#bib.bib51),3 (https://arxiv.org/html/2607.20472#bib.bib44)],但由于这些方法针对特定模型和对话上下文,并没有附带的数据集。为此,我们在第5.1节 (https://arxiv.org/html/2607.20472#S5.SS1)中设计了一个仿真框架,将单轮安全数据集扩展到多轮对话。  

**强化学习**:RL研究智能体与环境交互以最大化累积奖励的序贯决策问题。在这里,我们将用户-智能体交互建模为一系列对话状态,智能体通过生成响应来行动。标准RL方法,如近端策略优化(PPO,[42 (https://arxiv.org/html/2607.20472#bib.bib56)]),已被广泛用于优化语言模型,但严格来说并不适合多轮对话的结构,因为序列同时存在于标记和响应级别。层次化RL[24 (https://arxiv.org/html/2607.20472#bib.bib57)]启发我们将决策分解到标记级别和更高层次的对话级别。我们的评判器引导采样进一步植根于策略改进定理[45 (https://arxiv.org/html/2607.20472#bib.bib29)],特别是其熵正则化形式[59 (https://arxiv.org/html/2607.20472#bib.bib32),18 (https://arxiv.org/html/2607.20472#bib.bib33)],该定理保证了用指数化的Q值对候选动作进行权重调整,能够相对于基础策略产生单调改善。RL研究的一个分支直接研究对抗性设定[36 (https://arxiv.org/html/2607.20472#bib.bib19),16 (https://arxiv.org/html/2607.20472#bib.bib20)],并通过简单再训练[16 (https://arxiv.org/html/2607.20472#bib.bib20)]或稳健目标[27 (https://arxiv.org/html/2607.20472#bib.bib21),4 (https://arxiv.org/html/2607.20472#bib.bib43)]提供解决方案。这些方法在结构化的动作空间中运行,尚未应用于语言生成;我们将这些稳健的概念适配到语言领域,并提供跨领域的稳健性改进原则。  

**对话生成中的RL**:近期工作将RL应用于使用人类反馈[9 (https://arxiv.org/html/2607.20472#bib.bib80)]、AI反馈[2 (https://arxiv.org/html/2607.20472#bib.bib45)]或验证奖励[43 (https://arxiv.org/html/2607.20472#bib.bib79),25 (https://arxiv.org/html/2607.20472#bib.bib42)]作为奖励函数来微调LLM(分别为RLHF、RLAIF、RLVR)。这些方法使用策略迭代算法如PPO或DPO[37 (https://arxiv.org/html/2607.20472#bib.bib99)],以优化策略朝着上述奖励的单轮估计方向;多轮估计需要仔细处理响应和单个令牌的奖励分配,这仍然是一个开放的研究问题[58 (https://arxiv.org/html/2607.20472#bib.bib104),3 (https://arxiv.org/html/2607.20472#bib.bib44)]。另一并行研究方向致力于解决获取可靠奖励信号的困难;Bradley-Terry偏好模型[5 (https://arxiv.org/html/2607.20472#bib.bib78),9 (https://arxiv.org/html/2607.20472#bib.bib80)]通过利用相对人类判断而非绝对分数来支撑RLHF,而GRPO[43 (https://arxiv.org/html/2607.20472#bib.bib79)]将其扩展到群体比较以减少训练方差。虽然有效,但动作的信号取决于比较集,而非其独立值。因此,它们无法跨轮次估计期望的未来回报,而这对于多轮信用分配是必要的。在本工作中,我们证明了当用于从候选话语池中采样时,估计未来期望值的评判函数确实优于单轮奖励。这遵循策略改进原理和性能差异引理[20 (https://arxiv.org/html/2607.20472#bib.bib30)]。  

引导解码[22 (https://arxiv.org/html/2607.20472#bib.bib12),33 (https://arxiv.org/html/2607.20472#bib.bib11),30 (https://arxiv.org/html/2607.20472#bib.bib9),48 (https://arxiv.org/html/2607.20472#bib.bib8),14 (https://arxiv.org/html/2607.20472#bib.bib10),29 (https://arxiv.org/html/2607.20472#bib.bib7)]是一个类似的研究领域,经常引用熵正则化RL作为动机[33 (https://arxiv.org/html/2607.20472#bib.bib11)],它使用奖励[14 (https://arxiv.org/html/2607.20472#bib.bib10)]和评判器[22 (https://arxiv.org/html/2607.20472#bib.bib12)]来引导logit到词汇的解码,作为top-p或波束搜索的替代方案。我们在第4.1.4节 (https://arxiv.org/html/2607.20472#S4.SS1.SSS4)中的理论结果实际上直接适用于这些方法,进一步支持了RL与LLM文献的整合。这些方法学习标记级别的奖励并访问演员的logits;而我们则在生成后执行评判器采样。因此,我们的方法可以直接以黑盒方式迁移到前沿API模型。  

**LLM对抗稳健性**:LLM中的对抗稳健性是防止语言输出被故意降级的能力。这与对齐[15 (https://arxiv.org/html/2607.20472#bib.bib92),52 (https://arxiv.org/html/2607.20472#bib.bib105)]或毒性评估[12 (https://arxiv.org/html/2607.20472#bib.bib101),57 (https://arxiv.org/html/2607.20472#bib.bib102),19 (https://arxiv.org/html/2607.20472#bib.bib54)]的概念略有不同,因为智能体正受到故意攻击,且对合作方的真实意图存在不确定性。这种区别表现为过度拒绝,因为天真的稳健策略是拒绝所有请求,这仍然是一个重要话题[55 (https://arxiv.org/html/2607.20472#bib.bib37),56 (https://arxiv.org/html/2607.20472#bib.bib38),13 (https://arxiv.org/html/2607.20472#bib.bib3)]。对抗稳健性是一个活跃的研究领域,方法涵盖输入预处理[39 (https://arxiv.org/html/2607.20472#bib.bib28),21 (https://arxiv.org/html/2607.20472#bib.bib27)]、后处理[26 (https://arxiv.org/html/2607.20472#bib.bib22)]和对抗性微调[51 (https://arxiv.org/html/2607.20472#bib.bib25)]。这些方法降低了模型的有害率,但未在其优化标准中考虑模型的正常表现。有一系列文献明确解决过度拒绝问题,通过微调[56 (https://arxiv.org/html/2607.20472#bib.bib38),6 (https://arxiv.org/html/2607.20472#bib.bib31),31 (https://arxiv.org/html/2607.20472#bib.bib35)]或直接激活操控[11 (https://arxiv.org/html/2607.20472#bib.bib34),7 (https://arxiv.org/html/2607.20472#bib.bib13),47 (https://arxiv.org/html/2607.20472#bib.bib26)]。关键在于,这些方法孤立地处理每个查询,没有机制来建模对抗意图如何在轮次间积累或显现。此外,虽然意图建模已在任务导向对话[50 (https://arxiv.org/html/2607.20472#bib.bib23)]和LLM的心智理论[23 (https://arxiv.org/html/2607.20472#bib.bib24)]中被研究,但尚无先验工作将期望意图量化为开放域对话中对抗稳健性的机制。  

## 3 问题设定:面向LLM的对抗强化学习  

**作为MDP的对抗对话**:我们将智能体LLM与对话伙伴之间的多轮对话建模为马尔可夫决策过程(MDP)M = (S, A, T, R, γ)。在每一轮t,智能体观察完整的对话历史作为其状态st ∈ S,选择一个话语at ∈ A(动作),并转移到新的状态st+1,该状态整合了智能体的响应和对话伙伴的下一轮消息。

相似文章

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。

面向自然语言理解任务的混合对抗防御框架

arXiv cs.CL

来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。