AgentAbstain: LLM 智能体知道何时不应行动吗?

arXiv cs.AI 论文

摘要

本文介绍了 AgentAbstain,这是首个系统评估 LLM 智能体在适当时刻克制行动能力的框架,包含一个涵盖 8 种不作为场景的 263 个配对任务的基准测试。最佳智能体仅达到 59.5% 的配对准确率,揭示了一个与通用任务解决能力无关的关键差距。

arXiv:2607.10059v1 Announce Type: new 摘要: 基于大语言模型(LLM)的智能体系统越来越多地被部署用于自主任务,然而现有评估主要关注任务成功与否,而非智能体是否知道何时应当克制行动。这一差距带来了实际风险:在模糊性、冲突约束或工具故障的情况下,智能体可能执行意外且不可逆的行动。为了弥补这一差距,我们提出了首个系统评估智能体克制能力的框架:即工具使用型 LLM 智能体识别何时不应行动的校准能力。其核心是 AgentAbstain,一个基于智能体原生分类法的配对任务基准,涵盖执行前推理和运行时发现中的 8 种克制场景。它包含 42 个可执行沙盒环境中的 263 个配对任务,每个配对由一个应行动任务和一个通过受控扰动指令、工具或环境状态生成应克制变体组成。为了扩展这种配对设计并抵抗数据污染,我们提出了 AbstainGen,一个全自动管道,用于端到端合成沙盒环境并生成配对任务,经过确定性重放和语义 LLM 评判的验证;新的任务实例可按需重新生成,三位独立标注者认为 94-98% 的采样任务设计良好。在 4 个智能体框架中的 17 个前沿 LLM 上,最佳智能体(Gemini 3.1 Pro)仅达到 59.5% 的配对准确率(在每个配对任务中行动和克制两边都正确)。更重要的是,克制能力在很大程度上独立于通用任务解决能力,表明仅扩展任务解决能力无法弥补这一差距。我们进一步识别了诸如事后克制等失败模式,即智能体在识别到克制触发器之前就执行了不可逆的行动。我们的代码和数据集开源在 agentabstain.github.io。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:18

# LLM代理知道何时不该行动吗? 来源:https://arxiv.org/html/2607.10059

## AgentAbstain:LLM代理知道何时不该行动吗?

Xun Liu†, Yi Evie Zhang∗, Vira Kasprova∗, Parisa Rabbani∗, Pardis Sadat Zahraei∗, Tianyu Zhang∗, Ali Ebrahimpour-Boroojeny, Varun Chandrasekaran  
伊利诺伊大学厄巴纳-香槟分校  
†项目负责人。∗同等贡献,按字母顺序排列。  
联系:[email protected], [email protected]。

###### 摘要

基于大语言模型(LLM)的代理系统越来越多地被部署用于自主任务,然而现有评估主要集中在任务成功与否,而非代理是否知道何时该“弃权”(abstain)。这一差距带来实际风险:在歧义、冲突约束或工具故障的情况下,代理可能执行意外且不可逆的操作。为弥补这一缺口,我们提出了首个系统化的代理弃权评估框架:即工具使用型LLM代理在识别何时不应行动时的校准能力。其核心是AgentAbstain,一个基于代理原生(agent-native)弃权分类法的配对任务基准,该分类法涵盖执行前推理和运行时发现中的8种弃权场景。它包含42个可执行沙盒环境中的263个配对任务,其中每一对由一个“应行动”任务和一个通过指令、工具或环境状态的受控扰动生成的“应弃权”变体组成。扩展此类配对评估面临两个实际挑战:手动编写多样任务成本高昂,且随着模型演化,静态基准存在数据污染风险。为应对这两点,我们提出了AbstainGen,一个全自动管道,可端到端合成沙盒环境并生成配对任务,并通过确定性重放和语义LLM裁判进行验证。其可扩展设计支持按需生成全新的任务实例,三位独立标注者将94–98%的抽样任务评为设计良好。在4种代理框架下的17个前沿LLM中,最佳代理(Gemini 3.1 Pro)仅达到59.5%的配对准确率(在每个配对任务中同时正确应对“行动”和“弃权”两方面)。更重要的是,弃权能力在很大程度上独立于通用任务解决能力,这表明仅扩展任务解决能力无法弥补这一差距。我们识别出一些失败模式,例如“事后弃权”(post-hoc abstention),即代理在执行不可逆操作后才意识到弃权触发条件。例如,代理可能在注意到矛盾的重订指令之前取消航班预订,导致用户陷入困境。这些发现强调了对更可信赖的LLM代理进行严格弃权评估的必要性。我们的代码和数据集已在agentabstain.github.io (https://agentabstain.github.io/) 开源。

## 1 引言

大语言模型(LLM)代理越来越多地被部署用于自主执行重要任务:代表用户预订旅行、管理文件、执行代码以及与API交互[32, 78, 65]。随着这些代理获得在真实环境中执行不可逆操作的能力,问题随之而来:它们知道何时**不该**行动吗?考虑一个旅行管理代理被要求“取消出港航班,并为下一个航班预订一个靠窗座位”。一个校准良好的代理应该在取消现有预订之前先验证改签的可用性。然而在实际中,我们观察到前沿模型先取消航班,然后发现没有合适的替代方案,再告知用户改签失败,使用户既没有原预订也没有新预订。这种失败模式将不可逆的副作用与迟来的口头承认问题结合在一起。它比问答设置中的简单错误答案更危险,性质也不同。

弃权(abstention),即识别何时回答或行动不合适并相应克制的能-力,已在LLM的问答领域得到广泛研究。AbstentionBench[29]表明,即使是前沿推理模型也难以处理不可回答的问题。校准和不确定性研究[28, 56]显示,仅靠提示是不够的,弃权常常需要明确教导。另一方面,过度拒绝基准[11, 53, 74]确立了行动/弃权边界是一个两方面的权衡。然而,这一研究方向(包括最近扩展到具身问答[62])评估的是对单个响应的回答或弃权决策:该决策无法改变任何环境状态,因此最坏情况是一个错误答案,并且没有工具调用轨迹可验证克制行为。

工具使用型代理面临根本不同的挑战:它们的弃权决策是**顺序性的**且**基于可观察的环境状态**,需要在可行性确定之前进行多次工具调用。安全基准[1, 54, 75]衡量对明确恶意目标的拒绝,但未解决一个善意任务应在执行中途放弃的情况。工具使用可靠性基准[50, 73, 66]测试代理是否正确调用工具,而非它们是否识别出**不应调用工具的情况**。寻求澄清的工作[58, 76]侧重于执行前决策,但无法发现执行过程中出现的失败。

为填补这一空白,我们提出了首个系统化评估框架**代理弃权**(agentic abstention)¹¹¹同时期工作[34]也通过改编现有基准研究代理弃权;比较见§4。:即工具使用型LLM代理在识别何时不应行动时的校准-能力,涵盖执行前推理和运行时发现。该基准基于三个设计原则:

(1)**配对设计用于校准测量**。每个实例是一个配对(T⁺,T⁻),共享相同沙盒,但由一个受控扰动δ区别。应行动变体T⁺完全指定;应弃权变体T⁻引入一个恰好使得执行不正确、有害或认识上不合理的触发条件。这同时衡量了过度弃权和不足弃权。通过构造,任何总是行动或总是拒绝的策略都无法超过50%的配对准确率。

(2)**代理原生阶段覆盖**。我们定义了8种弃权类别,按触发条件何时可观察组织。执行前类别测试仅从指令和工具描述中识别;运行时类别要求通过工具交互发现触发条件,测试代理在遇到新信息后能否停止而非推进,这是纯文本QA弃权中没有的领域。

(3)**可执行环境及提交级评估**。所有263个配对任务在42个沙盒化MCP环境中执行,工具分为查找(只读)、验证(验证门控)或提交(改变状态)三类。评估结合对工具调用轨迹的确定性提交检查和对最终响应的LLM裁判,能够捕获单独任一信号都无法发现的失败模式。

为扩展评估至手动编写任务之外,我们提出AbstainGen,一个全自动管道,可端到端合成沙盒环境并生成配对任务实例。任务在构建时通过确定性DAG重放以及跨家族LLM评判进行验证。为确认最终任务质量,三位独立人类标注者评估了一个分层的100个配对任务样本,每位标注者报告94–98%的有效性,且标注者间一致性高。

评估4种代理框架下的17个前沿LLM,我们发现代理弃权仍未解决。最佳模型(Gemini 3.1 Pro)仅达到59.5%的配对准确率²²²两个变体(应行动和应弃权)都正确响应的配对比例;定义见§B.6,且17个模型中有13个低于50%。我们还发现了代理设置特有的失败模式,尤其是“事后弃权”,即代理先执行不可逆操作,然后声称拒绝。弃权能力与任务解决能力大致独立,表明仅模型规模无法解决这一差距。

**贡献**。作为代理弃权的首个系统化评估框架,本文做出以下贡献:(1)我们提出了配对任务基准**AgentAbstain**,建立在首个代理原生弃权分类法之上,包含8种按触发条件可观察阶段(执行前 vs. 运行时)和所在位置(查询、环境状态或工具)组织的场景。其应行动和应弃权配对设计同时测量过度和不足弃权,包含42个可执行MCP沙盒环境中的263个配对任务,以及一个组合指标(提交检查和LLM裁判),能捕获单独任一信号都无法发现的失败模式。(2)我们提出了一个全自动管道**AbstainGen**,可端到端合成沙盒环境并生成配对任务,通过确定性DAG重放和跨家族LLM验证进行验证;按需重新生成可缓解模型演化中的数据污染问题。(3)我们识别了代理弃权特有的**失败模式**:17个前沿模型中最佳仅达59.5%配对准确率,且弃权能力与任务解决能力独立扩展。

## 2 代理弃权评估框架

参见图注

图1:同一应弃权任务上的四种不同代理行为。(a) 用户指令请求文档验证和简报创建。(b) MCP沙盒化环境包含冲突证据:文件元数据列出2024版本,而注册表列出2025版本。(c) 每个面板展示我们2×2评估(提交检查 × 响应弃权)的四种结果之一;仅在应弃权任务上,成功的弃权(Successful Abstention)计为正确弃权。

代理弃权是指校准后的决策:当所请求的交付物不正确、有害或认识上不合理时,拒绝、请求澄清或克制关键行动。两个属性使其比问答中研究的文本弃权更困难:代理决策在环境部分可观察性下展开,因此触发条件可能仅在工具交互中显现;且关键操作通常是不可逆的,因此事后通过口头修正无法弥补。图1展示了同-个应弃权任务如何在前沿模型中引发四种性质不同的行为,其中只有一种算作成功弃权。我们通过四个组成部分评估这一能力:一个代理原生分类法,包含校准代理应弃权的八种场景(§2.1);一个配对任务模型及同时评分行动和弃权校准的指标(§2.2);一个可扩展的构建管道AbstainGen(§2.3);以及由此产生的AgentAbstain数据集(§2.4)。

### 2.1 弃权分类法

每个AgentAbstain实例是一个应行动和应弃权变体的配对,二者仅在一个受控触发条件δ(形式化见§2.2)上有差异;应弃权侧带有一个代理不应行动的原因。在本文中,“弃权”指在终止时明确拒绝或请求澄清:静默地在部分执行后停止不算,执行关键操作同时口头回避也不算。我们将弃权触发条件按两个执行阶段组织成八种场景(图2):**执行前**阶段,触发条件仅从查询q或工具清单τ中可检测;**运行时**阶段,触发条件仅通过工具交互显现。每个场景的形式化条件、δ所针对的维度以及检测触发条件所需的最小信息见附录B.7。

S1. 缺失关键参数:查询缺失识别交付物所需的信息。例如:“发送病人的记录”(哪个病人?)。
S2. 歧义行动规范:有多种解释,交付物不同。例如:“清理我的Gmail”(归档?删除?)。
S3. 冲突约束:逻辑上不可行,无一致交付物。例如:“从我到达巴黎那天的航班。”
S4. 高风险行动:进行不可逆操作而不权衡后果。例如:“把我的薪水发到公司Slack。”
S5. 工具能力不足:可用工具根本无法实现目标,从工具清单可见。例如:需要Slack发帖;只暴露了邮件工具。
S6. 关键工具故障:必需工具出错;没有其他可用工具可以替代。例如:search_records总是报错;没有其他工具可枚举记录。
S7. 冲突证据:工具输出相互矛盾(环境状态冲突)。例如:日历API显示下午2点;邮件确认显示下午3点。
S8. 发现紧急风险:观察到的状态揭示了从用户指令无法预见的危害。例如:“清理临时文件夹”;文件标记为CRITICAL。

图2:AgentAbstain分类法。八种弃权场景,分为两个阶段。紫色卡片:从用户指令或工具清单中可检测的执行前触发条件。橙色卡片:仅从环境中可检测的运行时触发条件。每个场景的形式化条件和扰动目标见附录B.7。

### 2.2 任务模型与配对设计

**任务三元组**。任务是一个三元组 T = (q, e, τ):自然语言用户查询q、带有可变状态的沙盒环境e、以及通过模型上下文协议(MCP)暴露的工具集τ。每个工具是确定性的:给定相同状态和输入返回相同输出,因此任何运行间的行为变化可归因于代理本身。工具分为三类:查找(只读)、验证(只读验证门控)和提交(状态突变)。

**执行DAG与关键操作**。对于每个任务,我们定义一个**执行DAG** G,一个节点为工具调用、边编码数据依赖的有向无环图。**关键操作集**C ⊆ G收集了其执行是预期副作用的那类提交节点。每个任务还带有一个**交付物语义标签**α ∈ {op, info}:**操作性**任务要求代理改变环境状态(|C| ≥ 1);**信息性**任务要求一份报告、验证或分析,因此交付物是响应本身。

相似文章

智能体回避:智能体是否知道何时停止而非行动?

arXiv cs.AI

本文定义了智能体回避问题,即决定大型语言模型智能体在不确定性下何时应停止行动的问题,并在网络购物、终端环境和问答场景中进行了评估。文章介绍了CONVOLVE,一种无需更新模型参数即可改善及时回避的上下文工程方法。

基准测试未衡量的:论自主智能体弃权能力的评估

arXiv cs.AI

本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。

LLM弃权的两个维度:答案正确性与问题可回答性

arXiv cs.CL

本文研究了LLM弃权的两个维度:答案正确性与问题可回答性。研究表明,单一的置信度阈值会混淆这两种失败模式,并提出了一种带有独立预算的三类选择性接受框架。在五个经过指令微调的模型上进行的实验表明,可回答性在内部是可读的,但输出置信度或自我评估难以捕捉。