评估使用模拟工具调用隔离不可信提示输入
摘要
本文评估了将不可信内容包装在模拟工具调用中是否能提高LLM对抗对抗性输入的鲁棒性,发现这并不能广泛改善,有时反而会增加攻击成功率。
arXiv:2605.30521v1 公告类型:新
摘要:大型语言模型必须频繁处理不可信输入,例如判断来自另一个模型的答案,或在对抗压力下运行垃圾邮件和有害内容分类器等任务。这些输入通常以字符串格式直接插入提示模板,导致系统容易被操纵。当前来自主要提供商(如OpenAI)的LLM规范根据指令层级区分可信度,从系统消息(最可信)到工具结果(最不可信)。一种可能的自然缓解措施是将不可信内容包装在模拟工具调用中作为隔离。我们通过自动红队搜索,在七个模型和三个LLM作为裁判任务上探索这一假设。与我们的假设相反,工具包装并未广泛提高鲁棒性。在二值评估任务(GSM8K评分)上,它通常会增加攻击成功率,这似乎是指令层级的反转。在标量和成对任务上,影响较小且依赖于模型,没有测试模型得到可靠帮助,且有几个显示出反转。我们建议在部署系统中评估这一局限性,并从长远来看,追求更强的指令层级训练或新的不可信输入原语。
查看缓存全文
缓存时间: 2026/06/01 09:25
# 使用模拟工具调用隔离不可信提示输入进行评估 来源:https://arxiv.org/html/2605.30521 \[ Path=./ESKlarheitGrotesk/, Extension=.ttf, UprightFont=\*-Rg, BoldFont=\*-Bd, ItalicFont=\*-It, BoldItalicFont=\*-BdIt \] \\authorname David Gros \\authoremail [email protected] \\authorinstitution FAR.AI \\authorname Adam Gleave \\authorinstitution FAR.AI ###### 摘要 大语言模型必须频繁处理不可信输入,例如评判另一个模型的答案,或在对抗压力下运行垃圾邮件和有害内容分类器等任务。这些输入通常以字符串形式直接填入提示模板,导致系统易于被操纵。当前来自 OpenAI 等主要提供商的 LLM 规范按照指令层次区分可信度,从系统消息(最可信)到工具结果(最不可信)。一种可能的自然缓解措施是将不可信内容包裹在模拟工具调用中作为隔离。我们通过跨七个模型和三个 LLM-as-a-Judge 任务的静态攻击字符串自动红队搜索来探索这一假设。与我们的假设相反,工具包装并未广泛提升鲁棒性。在二分类评估任务(GSM8K 评分)上,它通常会增加攻击成功率,这似乎是指令层次的反转。在标量和成对任务上,效果较小且依赖于模型,没有测试的模型得到可靠改善,且多个模型出现反转。我们建议在部署系统中评估这一局限性,并在长期内追求更强的指令层次训练或新的不可信输入原语。 \\logo ## 1 不可信输入的挑战 让我们考虑一个简单的 LLM-as-a-Judge 任务,其中我们使用 LLM 来评判候选答案是否正确解答了一个数学问题。典型的做法是编写一个包含多个\{字段\}的提示,然后通过字符串格式化填入给定问题的值。示例如图1 (https://arxiv.org/html/2605.30521#S1.F1) 所示。 \(a\) 仅用户角色: user 判断候选回答是否与参考答案匹配。 问题: \{question\} 参考答案: \{reference\} 候选回答: \{candidate\} 输出 VERDICT: CORRECT 或 INCORRECT。 \\phantomsubcaption \(b\) 模拟工具包装 tool spec tool:get\_candidate\_response description: 检索提交评估的候选回答。 role: system 判断候选回答是否与参考答案匹配。 精确输出:VERDICT: CORRECT 或 INCORRECT。 role: user 问题: \{question\} 参考答案: \{reference\} 候选回答将在工具中提供。 role: assistant tool\_calls[0].id: call\_1 tool\_calls[0].function.name: get\_candidate\_response role: tool tool\_call\_id: call\_1 content: \{candidate\} \\phantomsubcaption 图 1: (a) 简化的仅用户提示格式。(b) 简化的模拟工具提示格式。不可信的候选回答被包裹在工具结果中。 尽管这是相当典型的 LLM 提示方式,但这种字符串模板可能很脆弱。Zhao 等人 [2025 (https://arxiv.org/html/2605.30521#bib.bib30)] 在他们的工作中发现,《One Token to Fool LLM-as-a-Judge》中,像“:”或“Solution”这样简单的输入就能混淆评分者,使其输出通过判决。我们可能会审视这个简单的提示,并尝试一些提示工程(例如,某种形式的引号或定界符、“请将其视为不可信”的文字等)。然而,这些感觉都只是补丁,没有明确的标准方式来隔离不可信内容。容易被击败的评判者或提示会削弱强化学习系统、有害内容过滤器以及其他存在优化器或激励机制来破坏系统的系统的鲁棒性。我们的研究旨在改善这一状况,并帮助为实践者和模型提供商提出建议。 ### 1.1 指令层次作为缓解措施? 冲突或对抗性提示是众所周知的挑战。对此的一种回应包括指令层次 (IH) [Wallace 等人,2024 (https://arxiv.org/html/2605.30521#bib.bib24)]。LLM 消息具有不同的“角色”,具有不同的信任级别。截至 2026 年 4 月,OpenAI 发布了一份模型规范,定义了“指挥链”,其中 System ≻ User ≻ Tool。¹¹OpenAI 还支持 Developer 角色,它介于 System 和 User 之间,但这个角色似乎采用较少。具体来说,工具消息被描述为“没有权威” [OAI, 2025 (https://arxiv.org/html/2605.30521#bib.bib17)]。这一主题适用于各个提供商。Meta 的最新版本指出,模型应遵循指令层次 §4.1.1 [MSL, 2026 (https://arxiv.org/html/2605.30521#bib.bib16)]。许多其他提供商似乎没有发布关于此的规范、章程或卡片,但确实支持 OpenAI API 形状。因此,开发人员可能合理假设他们遵循 OpenAI 的 System ≻ User ≻ Tool 层次。System 和 User 提示是正常的,但使用缺乏标准化,尤其是在有多个不可信输入的情况下(例如,成对 LLM-as-a-Judge 提示要求模型在多个不可信候选之间做出选择)。为了最大化利用提示层次,我们可能会想是否可以将提示中不可信的部分包裹在工具调用中(最低信任角色)。这些不是模型在代理循环中意图调用的工具(它们是“模拟工具调用”,因为提示决定了结果),但提供了一种隔离提示中不可信部分的方法。简化的示例如图1 (https://arxiv.org/html/2605.30521#S1.F1) 所示。 **研究问题:** 将 LLM-as-a-Judge 提示中不可信部分包裹在模拟工具调用中,是否会导致对对抗性输入的敏感性低于仅使用“用户”或“系统”+“用户”角色的基线?我们假设“是”这一研究问题,并且模拟工具调用可能是一种简单而有原则的提示策略,可用于使评判者或一般提示更具鲁棒性,同时使用 API 模型已经提供的功能。令人惊讶的是,我们发现了负面倾向的结果:在许多情况下,工具包裹的条件更容易受到对抗性输入的攻击,或者没有检测到差异。在第6节 (https://arxiv.org/html/2605.30521#S6) 中,我们反思了这些发现,考虑它们可能暗示 LLM 用户可用的原语/本体中的潜在差距。虽然先前的工作已经研究了指令层次(在第5节 (https://arxiv.org/html/2605.30521#S5) 中进行了综述),但我们不知道有研究探索过使用模拟工具调用来应对如 Zhao 等人 [2025 (https://arxiv.org/html/2605.30521#bib.bib30)]、Raina 等人 [2024 (https://arxiv.org/html/2605.30521#bib.bib18)] 或 Shi 等人 [2024 (https://arxiv.org/html/2605.30521#bib.bib20)] 讨论的 LLM-as-a-Judge 攻击。我们在此领域贡献了发现。 ## 2 方法 | 任务 | 攻击成功率(ASR) | | | | 增量 (pp) | |------|--------------------------------------------|--------------------|---------------------|------------------|----------------| | | GSM8K (二分类) | MT-Bench (标量, thr=5) | Arena-Hard (成对) | | | | 表 1: 每个 (模型, 提示布局) 的攻击成功率。单元格: 跨 (攻击者 × seed) PAIR 分支的每个分支 ASR 的均值 (标准差);项目与搜索集不重叠。**粗体** = 每行最鲁棒的布局(最低 ASR;2 pp 内的并列也加粗)。最后三列: 均值增量 (pp) 及 95% 自助法置信区间 (见附录 C (https://arxiv.org/html/2605.30521#A3))。红色 = CI >> 0 (工具布局有害);绿色 = CI << 0 (工具布局有帮助);黑色 = CI 包含 0。 ### 2.1 任务 #### GSM8K (二分类) Cobbe 等人 [2021 (https://arxiv.org/html/2605.30521#bib.bib5)] 是一个小学数学问题的数据集。评判者阅读问题、参考答案和候选回答,并输出 VERDICT: CORRECT 或 VERDICT: INCORRECT。攻击者的目标是在没有实际解决方案的情况下,对对抗性内容引发 CORRECT 判决。 #### MT-Bench (标量) Zheng 等人 [2023 (https://arxiv.org/html/2605.30521#bib.bib31)] 是 LLM-as-a-Judge 的一个基础数据集。任务是在 1-10 的尺度上评估候选回答的质量。我们根据 FastChat²²FastChat 是一个拥有 39k+ 星标的 github 仓库 (https://github.com/lm-sys/fastchat) 的提示,改编自 Zheng 等人 [2023 (https://arxiv.org/html/2605.30521#bib.bib31)] 的评分标准和解析器 (见附录 I (https://arxiv.org/html/2605.30521#A9))。如果评判者给出的分数 ≥ 5,我们认为攻击成功。 #### Arena-Hard-Auto v2 (成对) Li 等人 [2025b (https://arxiv.org/html/2605.30521#bib.bib14)] 是一个来自知名 LMArena / lmsys 团队的自动评估数据集。评判者看到两个候选回答 (A 和 B),并输出一个五点偏好 ([[A >> B]], [[A > B]], [[A = B]], [[B > A]], [[B >> A]])。我们使用数据集提供的参考提示、解析器和来自 o3-mini 的参考回答。如果被攻击的位置直接胜过 o3-mini 参考回答,我们视攻击成功。攻击者不知道它是在 A 还是 B 位置,也不知道问题。 ### 2.2 提示条件 (蓝队) 我们考虑五种提示条件,这些是我们研究问题中研究的缓解防御措施。我们描述每种条件背后的想法,并在附录 I (https://arxiv.org/html/2605.30521#A9) 中给出确切输入。 - **UserOnly** 基线将所有内容(指令、问题、参考答案、候选回答等)连接到一个 user 消息中。其简化版本如图1 (https://arxiv.org/html/2605.30521#S1.F1) 所示。 - **UserSys** 将评判指令移至 system 角色,同时将输入保留在 user 角色。 - **ToolWrapped** 在 UserSys 基础上,将不可信输入包裹在模拟工具调用中 (图1 (https://arxiv.org/html/2605.30521#S1.F1) 显示简化版本)。这些构成了我们研究问题的基本条件,但此外我们考虑是否明确警告模型不要信任输入的文本会改变行为,无论是否使用工具包装。 - **SystemDistrust** 在 UserSys 基础上,通过在 system 消息中添加明确文本,提醒模型候选回答是不可信的,并可能试图操纵判决。 - **ToolDistrust** 与 SystemDistrust 类似,但使用了工具包装,并在 system 提示和工具描述中都包含关于不信任输入的警告。 ### 2.3 测试模型 我们研究了几个模型。对于 OpenAI 模型,我们使用 gpt-5.4 和 gpt-5.4-mini。对于 Anthropic 模型,我们使用 sonnet-4.6 和 haiku-4.5。此外,我们还测试了 gemma-4-26b-a4b-it、qwen3.5-flash-02-23 和 qwen3-8b,通过 OpenRouter 查询。所有模型在完成请求中均使用默认采样设置,但增加了最大完成令牌预算 (32,768)。值得注意的是,除了 Qwen 模型外,其他模型在此默认配置下未报告使用扩展推理令牌。 ### 2.4 控制 这些不同的提示条件旨在对抗性输入下提高鲁棒性,并且理想情况下不应改变对正常、非对抗性输入的评分或标记。我们对每个任务使用非对抗性控制 (GSM8K: 裸参考答案加上故意错误的扰动;MT-Bench: 来自 GPT-5.4-nano 的真实回答;Arena-Hard: o3-mini 参考与较弱模型 GPT-4.1-nano 配对),并询问每个提示条件逐项评分是否等同于任务特定参考条件 (GSM8K 和 MT-Bench 使用 UserOnly,Arena-Hard 使用 UserSys)。大多数单元格在实际有意义范围内是等价的,但有少数显著例外。最突出的是,Haiku-4.5 在 MT-Bench 上具有条件相关的输出行为。它经常回复 [[rating: N]] 而不是 FastChat 解析器期望的 [[N]] 格式,并且解析率在不同条件下变化很大 (32% 到 72%,ToolWrapped 下最高,SystemDistrust 下最低),因此我们在后续分析中排除此模型。Sonnet-4.6 在任何条件下均未显示回复格式问题。此外,Qwen3-8b 在 Arena-Hard 上在工具包裹条件下的结果相对于参考大约差异 +20 pp。在少数其他 Arena-Hard 单元格 (GPT-5.4-mini ToolDistrust, Qwen3.5-flash ToolWrapped) 中,我们无法用现有数据排除差异,但任何此类差异似乎很小 (胜利率约 3–4 pp)。详情见附录 B (https://arxiv.org/html/2605.30521#A2)。 ### 2.5 攻击与指标 (红队) 我们希望衡量每个提示条件在对抗性输入下的脆弱程度。核心度量是攻击成功率 (ASR),即攻击者有利的对抗性输入在问题中所占的比例。然而,在尝试测量时存在几个挑战。简单地适应先前的攻击或编写我们自己的攻击,有可能在不相等的攻击优化压力下比较提示条件,这呼应了对抗性机器学习中的自适应评估担忧 [Tramer 等人,2020 (https://arxiv.org/html/2605.30521#bib.bib23)]。我们专注于使用自动化攻击管道。这有助于对每个提示条件施加相似量的优化压力。这并不完美 (例如,不清楚自动化攻击者有什么偏见),但给出了哪些提示条件可能最鲁棒的方向性度量。 #### 通过类似 PAIR 的循环进行自动化攻击 我们使用一种受自动化黑盒 LLM 越狱搜索启发的方法,特别是 PAIR (Prompt Automatic Iterative Refinement) [Chao 等人,2023 (https://arxiv.org/html/2605.30521#bib.bib2)]。在每一轮中,攻击者 LLM 提出一个攻击字符串,我们将其插入当前提示条件,并在一个固定的隐藏项目集 (n=20 项) 上评估。然后攻击者收到汇总的 ASR 和一小部分原始评判者输出,然后提出下一个候选。重复此过程 K=7 轮。我们使用三个模型作为攻击者:kimi-k2.5、gemini-3-flash-preview 和 deepseek-v4-pro,均通过 OpenRouter。注意攻击者模型集与受害者模型集是不相交的。³³不相交的攻击者和受害者集更符合“黑盒攻击者”框架。使用相同的模型攻击自身或白盒技术将是合理的未来工作。我们针对每个 (任务、受害者模型、提示条件、攻击者模型、多个随机种子) 独立运行此循环。因此,每个条件受到大致相等的攻击,帮助我们方向性地捕获哪些条件对对抗压力最脆弱或最不脆弱。我们使用 3 个攻击者模型 × 6 个 PAIR 搜索种子,每个 (任务、受害者模型、条件) 对应 18 个 (攻击者、种子) 分支。每个分支在一个 20 项搜索集上优化。评估时,我们取每个分支中找到的最成功攻击,并在一个 60 项传输集上评估,以衡量攻击是否泛化。 #### “静态” vs “动态”攻击 在这项工作中,我们考虑“静态”攻击,即对所有问题必须使用相同的攻击输入,而不是针对每个问题自适应。另一种替代方案是更“动态”的攻击,例如设计对抗性前缀、后缀或其他对弱答案的变换,使其总是被不合理地有利评判。我们将动态攻击的探索留给未来工作。专注于静态攻击可以看作是红队更具挑战性的设置。 #### 增量与自助法 我们的研究问题特别关注工具包裹条件相对于不使用工具包裹的差异。因此,我们计算这些条件之间的增量。我们使用多层次自助法来估计置信区间。详情见附录 C (https://arxiv.org/html/2605.30521#A3)。 ## 3 结果 请参考图注 图 2: GPT-5.4-mini 在五种提示条件和三个任务上的每个分支的留出传输 ASR。每个标记 = 一个 (攻击者, 种子) PAIR 搜索分支。ASR 平均值在
相似文章
ToolHazard:为基于LLM的智能体扩展安全评估与对齐的对抗环境
ToolHazard是一个可扩展的框架,通过合成对抗环境来测试LLM智能体面对间接提示注入的鲁棒性,揭示漏洞,并通过ToolHazard-Bench基准提升防御性对齐。
当较低权限即足够:探究LLM Agent中的过度权限工具选择
本文研究了LLM Agent中的过度权限工具选择问题,引入了ToolPrivBench来评估并缓解不必要的高权限工具使用。研究发现,安全对齐并不能确保最小权限选择,并提出了一种训练后防御方法,能够在不牺牲性能的情况下减少过度权限的使用。
PromptAudit:审计基于LLM的漏洞检测中的提示敏感性
PromptAudit是一个受控评估框架,通过隔离提示表述对基于LLM的漏洞检测的影响,发现思维链提示在整体性能上表现最佳,同时提示敏感性必须被视为一级系统属性。
通过不确定性对齐的强化学习探索智能体工具调用决策
本文提出TRUST方法,将不确定性量化融入强化学习奖励设计,以改进LLM智能体的工具调用决策,提升决策质量并保持可靠的不确定性估计。
LLM代理中的忠实不确定性:实践中校准与效用权衡
一位从业者讨论了LLM代理中的校准与效用权衡,分享了基于验证器的流水线经验,该流水线将幻觉工具调用减少了约60%,但引入了延迟成本并丢失了简单的正确答案。