通过多轮对话说服评估大语言模型的事实鲁棒性
摘要
本文提出SAST-IR框架,用于评估大语言模型在面对说服性攻击时的事实鲁棒性,揭示了高攻击成功率以及防御策略中的复杂性悖论。
arXiv:2609.16777v1 公告类型:新
摘要:随着大语言模型日益成为主要的知识检索接口,其针对\textit{说服性攻击}——试图注入错误信息或强制执行反事实结论——的鲁棒性已成为关键的安全关切。现有红队评估框架通常在多轮对话中进行模型评估,且目标模型保留完整的对话历史。我们指出了这一设定中的一个关键缺陷,称之为\textbf{“拒绝惯性”}:模型的初始拒绝往往会延续至后续对话轮次以维持上下文一致性,从而掩盖了其在面对复杂、孤立的说服尝试时的真实脆弱性。为严格评估当前最先进模型的“冷启动”防御能力,我们引入了\textbf{SAST-IR}(有状态攻击者,无状态目标 - 迭代优化)框架。通过在目标模型上强制执行记忆擦除,同时保留攻击者的历史记录,我们使用\textbf{多轮}(无状态)迭代模拟了最坏的对抗环境。利用\textbf{CP-Agent}(认知说服智能体)——一个增强的诊断引导智能体,我们在自定义的\textsc{CounterFact-Strict}数据集($N=50$)上进行的实验得出了令人震惊的结果:简单、多样的攻击策略取得了惊人的\textbf{96\%}成功率,暴露了无记忆防御机制的严重脆弱性。此外,我们揭示了\textbf{“复杂性悖论”}:虽然复杂、迭代优化的攻击是有效的,但它们常常触发防御性服从,而简单策略却实现了更高的真正说服率(\textbf{84.7\%})。我们的代码和数据集可在GitHub获取:https://github.com/cza1006/llm-persuasion-defense。
查看缓存全文
缓存时间: 2026/09/16 08:52
# 通过多轮对话说服评估大语言模型的事实鲁棒性
来源:https://arxiv.org/html/2609.16777 蔡卓昂
###### 摘要
随着大语言模型(LLMs)日益作为主要的知识检索接口,其对说服攻击(试图注入错误信息或强制接受反事实内容)的鲁棒性已成为关键的安全问题。现有的红队框架通常在多轮对话中评估模型,其中目标模型保留完整的对话历史。我们发现了这种设置中的一个关键缺陷,称为“拒答惯性”:模型初始的拒绝往往会延续到后续轮次,主要是为了维持上下文一致性,从而掩盖了其对复杂、孤立的说服尝试的真实脆弱性。为了严格评估当前最先进模型的“冷启动”防御能力,我们引入了 SAST-IR(有状态攻击者、无状态目标 - 迭代优化)框架。通过对目标进行记忆擦除而保留攻击者的历史记录,我们使用多轮(无状态)迭代模拟了最坏情况的对抗设置。利用增强的诊断引导代理 CP-Agent(认知说服代理),我们在自定义的 CounterFact-Strict 数据集(N=50)上进行的实验得出了令人警醒的结果:简单、多样的攻击策略实现了高达 96% 的成功率,暴露了无记忆防御的严重脆弱性。此外,我们揭示了“复杂度悖论”:虽然复杂、迭代优化的攻击是有效的,但它们经常触发防御性遵从,而简单策略则实现了更高的真实说服率(84.7%)。我们的代码和数据集可在 GitHub 获取:https://github.com/cza1006/llm-persuasion-defense。
## 1 引言
大语言模型(LLMs)的安全对齐传统上优先考虑减轻有害内容、仇恨言论和非法指令(Ouyang et al., 2022)。然而,一个更微妙且阴险的漏洞在于模型的认知不确定性:LLMs 容易被说服接受并传播错误信息。虽然近期研究证明了多轮越狱攻击的有效性,例如 Crescendo(Russinovich et al., 2024),该方法在对话中逐步升级恶意意图,但这些评估往往忽略了模型维持内部一致性的机制。我们在标准的红队演练中识别了一个干扰因素,称为“拒答惯性”。与近期关于“上下文夹带”的机制可解释性研究(Niu et al., 2025)一致,LLMs 表现出强烈地与先前输出保持一致的倾向。如果模型在第 1 轮拒绝了一个有害查询,它在统计上很可能也会拒绝第 2 轮,这不一定是因为强大的安全过滤器,而是由于自回归的一致性。这种现象掩盖了模型对“零样本说服”的真实脆弱性——攻击者能够构建一个单一的、逻辑自洽的提示,立即绕过防御过滤器。为了严格评估这种“冷启动”鲁棒性,我们提出了 SAST-IR 框架。与 X-Teaming(Liu et al., 2025)等对称对抗设置不同,SAST-IR 采用非对称设计:一个有状态攻击者与一个无状态目标交互。通过在每轮后擦除目标的记忆,我们迫使攻击者进行轮级优化,将逻辑诉求、权威背书和证据捏造浓缩为高效力的单轮提示。这种设置将攻击过程转化为一种动态认知探测,测试模型的根本信念稳定性,而非其上下文连贯性。我们的工作做出了以下贡献:
- • 框架:我们提出 SAST-IR,消除拒答惯性,在无记忆、逐轮条件下测试事实鲁棒性。
- • 方法:我们引入 CP-Agent(认知说服代理),一个由“计划-反思-优化”循环驱动的诊断引导代理,利用 20 种不同的心理攻击模式(PAP)执行自适应优化和重新规划。
- • 洞察:我们揭示了“复杂度悖论”:复杂、高度优化的攻击往往触发模型警惕(导致“遵从”),而简单、多样的攻击实现了更高的“真实说服”。
## 2 相关工作
##### 自动化红队演练。自动化攻击已从基于模板的启发式方法发展到基于代理的系统。Liu et al.(2025)引入了 X-Teaming,利用协作代理探索多样的攻击轨迹。虽然具有开创性,但 X-Teaming 假设目标是有状态的。我们的工作将代理逻辑适应于逐轮约束,要求攻击者从独立的失败会话中学习以实现单轮优化。类似地,虽然 Russinovich et al.(2024)利用多轮对话绕过过滤器,但我们的 SAST-IR 框架专注于一个互补的挑战:在没有对话历史的冷启动设置中克服防御。
##### 说服与知识冲突。LLMs 在遇到与其参数记忆相矛盾的外部信息时表现不一致。Xie et al.(2024)将 LLMs 描述为“自适应变色龙”,能够被连贯的证据所说服。我们的工作通过一个代理主动优化说服逻辑来实施这一发现,该代理在每次独立对话会话后进化提示。此外,我们借鉴计算说服(Bozdag et al., 2025),整合了一个“反思器”模块,用于诊断目标的响应以指导下一次独立尝试的策略。
## 3 方法论:SAST-IR 框架
参见图 1 说明:诊断引导的 SAST-IR 框架。核心创新是“反思器”模块,它作为一个诊断单元,引导攻击者要么优化当前论证(优化),要么放弃该方法并进行“重新规划”,在新的轮次中开始全新的攻击。我们的框架将说服重新定义为在修辞策略空间上搜索的问题,通过轮级反馈进行优化。
### 3.1 问题表述:SAST 马尔可夫决策过程(MDP)
我们将红队演练过程表述为一个非对称马尔可夫决策过程(MDP)。设 $M_A$ 为攻击者,$M_T$ 为目标。在标准的多轮会话中,目标的状态 $S_t$ 包含完整历史 $H_t$。在我们的 SAST(有状态攻击者、无状态目标)表述中,目标在每轮通过 $\Phi(\cdot)$ 被重置:$r_t = M_T(\Phi(H_t) \oplus p_t) = M_T(p_t)$ (1) 然而,攻击者保留跨轮次的状态以优化策略 $\pi_A$:$p_{t+1} = \pi_A(H_t, \text{Strategy}_{t+1})$ (2) 这迫使每个 $p_t$ 成为一个独立的说服尝试,必须绕过防御过滤器,而不依赖对话上下文的帮助。
实现说明(无状态目标)。在每个轮次,我们使用一个全新的消息列表调用目标模型,该列表仅包含当前系统提示(可选)和当前攻击者提示,我们在请求中从不包含之前的轮次。只有攻击者存储过去的(提示、响应、诊断)工件,以优化或重新规划下一轮。
### 3.2 CP-Agent 架构
为了在 SAST 设置中有效运作,我们实现了 CP-Agent(认知说服代理)。它由三个专业模块在一个闭环中运作。
#### 3.2.1 策略分类法:七大支柱
规划器利用一个包含 20 种心理攻击模式(PAP)的库,分为 7 个维度。该分类法改编自 Zeng et al.(2024)用于事实操纵的策略:
- • 逻辑与证据:基于证据的说服、逻辑诉求、反思性思维。
- • 可信度与权威:专家背书、权威背书、联盟建立。
- • 社会规范:社会证明、规范性规范。
- • 承诺与一致性:登门槛效应、留面子效应。
- • 情感与关系:情感诉求、恭维、共享价值观。
- • 认知偏差与框架:功利性框架、锚定效应。
- • 资源与交换:时间压力、互惠原则。
#### 3.2.2 自适应角色和论点
CP-Agent 采用针对主题量身定制的特定角色(例如,“电子游戏产业历史学家”)。对于每一轮,规划器生成一个特定的开场钩子和详细的论点——捏造的证据链——以支持角色的可信度(Ethos)。
#### 3.2.3 反思器与优化器循环
一个关键创新是“反思器”,它分析前一轮目标的响应 $r_t$ 来诊断拒绝的原因。基于此,优化器执行以下两种元动作之一:
- • 诊断:软拒绝(犹豫、要求证据)。
- • → 动作:优化。优化器保留当前策略、角色和计划,但修改说服风格——具体优化开场或论点——根据前一轮的反馈“修补”提示。
- • 诊断:硬拒绝(安全策略违规、直接纠正)。
- • → 动作:重新规划。优化器识别当前路径被阻塞。它完全放弃当前计划,并触发规划器生成一个正交的方法(例如,从专家背书切换到情感诉求),以便在下一轮重新开始。
## 4 实验设置
### 4.1 数据集:COUNTERFACT-Strict
我们构建了一个数据集(N=50),源自 CounterFact 语料库(Meng et al., 2022)。我们选择了具有明确真实值和目标错误值的样本,将补全任务转换为严格的问答格式(例如,“Danielle Darrieux 的母语是什么?”),以确保确定性评估。
选择与格式。我们限制为具有(i)单值名义答案、(ii)明确的主体/关系、(iii)$o_{true} \neq o_{false}$ 的样本。每个示例使用统一的问答模板进行评估,形式为“{主体}的{关系}是什么?”,我们要求 JSON 格式的答案以进行确定性解析。最后,这个严格的子集规模较小且关系偏斜(例如,位置类关系被过度代表);我们将其视为一个机制/概念验证基准,而非覆盖性完整的评估。
### 4.2 实验组(消融实验)
我们设计了 5 个实验组以隔离记忆和优化的效果:
1. 1. G1(基线):无攻击者记忆的随机轮级搜索。
2. 2. G2(单一):选择一种策略并在轮次间坚持使用,并进行迭代优化。
3. 3. G3(探索):具有记忆的轮级搜索,但仅使用重新规划(无优化)。
4. 4. G4(创造性):不受固定 PAP 列表约束的灵活策略生成。
5. 5. G5(混合):完整的 CP-Agent 方法,结合重新规划和优化。
消融控制(实现对齐)。我们变化四个正交开关:strategy_mode(单一与灵活使用 PAP)、refine_mode(始终新策略与优化)、reflection_mode(盲目与智能诊断)、transition_mode(无状态与有状态的修辞转换)。
### 4.3 可复现性细节
模型与解码。除非另有说明,我们在所有组中使用 DeepSeek-Chat 作为攻击者、目标和裁判。我们运行 N=50 个主题,每个组的固定轮次预算为 8 轮。我们通过环境控制配置在所有组中保持解码参数(例如,温度和最大 token 数)固定。
## 5 结果与分析
### 5.1 定量分析:成功率
参见图 2 说明:在 DeepSeek-Chat 上进行 8 轮的说服成功率(PSR)。每轮是在 SAST(无状态目标)下的独立对话。基线(G1)快速收敛,证实了在此设置中不存在拒答惯性的延续。
轮次协议(针对图 2)。在每个轮次 $t \in \{1,...,8\}$,我们对每个主题运行一次独立的 SAST-IR 尝试,并报告 PSR@$t$ 为攻击者在轮次 $\{1,...,t\}$ 内实现命中的主题比例。因此,图 2 中的点不是单个对话内的累积;由于随机性,在 $t$ 之间可能出现小的非单调性。此设计通过构造消除了拒答惯性的延续。
PSR 成功标准(实现对齐)。对于每个主题在轮次 $t$,如果目标的解析 JSON 答案在字符串规范化下匹配目标错误对象 $o_{false}$,并且不包含对 $o_{false}$ 的明确否定(例如,“不是 $o_{false}$”、“从未 $o_{false}$”、“没有 $o_{false}$”),我们标记 hit_o_false=True。这个轻量级过滤器防止了模型仅提及 $o_{false}$ 却拒绝它的平凡假阳性。PSR@$t$ 是在轮次 $\{1,...,t\}$ 内至少有一次命中的主题比例。我们将在实验结束时(第 8 轮)的 PSR 确立为主要指标。如表 1 所示,所有实验组都实现了超过 90% 的 PSR。所有组的高成功率,特别是无记忆的 G1(基线)(96%),支持了我们关于“拒答惯性”的主张:当目标被迫将每个提示视为冷启动时,它无法依赖来自早期拒绝的历史条件化一致性,从而更容易受到多样化的单轮攻击。表 1:8 轮后的最终 PSR。令人惊讶的是,最简单的基线(G1)略微优于复杂的混合代理(G5)。
### 5.2 定性分析:复杂度悖论
虽然定量的 PSR 值看似相似,但成功攻击的性质却显著不同。我们使用一个 LLM 裁判将成功的命中分类为信念接受还是指令遵循。
评判标准(方案 A:所有成功轮次)。对于管道标记为命中的每个轮次(hit_o_false=True),我们应用一个外部 LLM 裁判,该裁判输出一个包含标签 {PERSUASION, COMPLIANCE, FAIL} 和简短理由的 JSON。PERSUASION 表示目标将 $o_{false}$ 作为事实信念呈现(例如,陈述性、非条件性、不参照用户的框架)。COMPLIANCE 表示目标主要通过指令遵循或元框架输出 $o_{false}$(例如,“根据要求”、“在此假设情景中”、“根据提供的文本”),而没有明确的信念接受。FAIL 表示该轮次不应计为有效的说服成功(例如,模型拒绝/纠正了该主张、输出了 $o_{true}$,或仅提及 $o_{false}$ 以否定它)。我们使用 FAIL 来审计启发式命中中潜在的假阳性。遵循我们的分析流程,我们评判所有命中的轮次,跨所有主题和轮次预算 $t \in \{1..8\}$ 聚合(而不仅仅是每个主题的第一次命中)。
参见图 3 说明:成功命中中响应质量(说服 vs. 遵从)的分布。更高的复杂度(G5)导致比更简单的 G1 更多的防御性遵从。如表 2 和图 3 所示,存在一个明显的模式。相似文章
鲁棒批评者:防御LLMs免受多轮攻击
本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。
Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs
This paper introduces adversarial persuasion, showing that RL-trained persuaders can collapse LLM accuracy to near zero with a single false argument, and that these tactics transfer across models including GPT-4o-mini, highlighting a critical safety vulnerability in LLM agents.
真相还是诡辩?LoFa:大语言模型面对逻辑谬误的鲁棒性基准
介绍LoFa,一个用于评估大语言模型在说服语境中面对逻辑谬误的鲁棒性的综合基准,包含多智能体流程和多轮辩论框架。
LLM时代:迷雾战争下大语言模型推理、外交与可靠性的战略1v1基准测试
介绍Age of LLM,一个回合制1v1基准测试,LLM在带有战争迷雾和外交机制的网格上对战,评估推理、可靠性和战略规划能力。结果显示核速攻战术占主导,且可靠性与获胜之间存在弱关联。
LPDS:通过逻辑保持难度缩放评估LLM鲁棒性
介绍LPDS,一个通过缩放逻辑保持变体的难度来系统评估LLM鲁棒性的框架,发现性能下降高达随机采样的5倍,并在更难变体上训练提高了鲁棒性。