智能体回避:智能体是否知道何时停止而非行动?
摘要
本文定义了智能体回避问题,即决定大型语言模型智能体在不确定性下何时应停止行动的问题,并在网络购物、终端环境和问答场景中进行了评估。文章介绍了CONVOLVE,一种无需更新模型参数即可改善及时回避的上下文工程方法。
查看缓存全文
缓存时间: 2026/06/30 05:32
# 智能体回避:智能体知道何时该停止而非行动吗? 来源:https://arxiv.org/html/2606.28733 韩罗¹,²,³†,温冰冰¹,³†,陆露·王³,⁴ ¹利兹大学 ²西南交通大学 ³华盛顿大学 ⁴艾伦人工智能研究所 \{hanluo,bingbw,lucylw\}@uw\.edu https://lhannnn.github.io/agentic-abstention ###### 摘要 LLM智能体被期望在多轮交互中行动,使用搜索、浏览界面和终端工具来完成用户目标。然而,并非每个目标都在可用环境中得到良好定义或可实现。在这种情况下,一个可靠的智能体应该认识到进一步的交互不太可能有所帮助,并避免额外的工具调用。我们定义了**智能体回避**,即决定智能体在不确定情况下何时应该停止行动的问题。与标准的LLM回避(通常作为单轮回答或回避决策进行评估)不同,智能体回避是一个序列决策问题:智能体在每一轮中可以选择回答、回避或收集更多信息,而回避的需求可能只有在与环境交互后才变得清晰。我们在网络购物、终端环境和问答中研究了这个问题,评估了13个LLM即智能体系统和2个智能体框架在超过28,000个任务上的表现。我们的结果表明,主要挑战不仅在于智能体是否能够回避,还在于它们何时回避。一些智能体在应该回避时从不回避,而另一些则只有在许多不必要的交互之后才回避。这种差距在那些指令看似可行但环境揭示并非如此的任务上尤其大(例如,没有有效结果匹配指令)。我们进一步发现,模型规模、推理能力和智能体框架以不同方式影响回避行为,更大或更有能力的模型有时在及时回避方面表现更差。最后,我们引入了**convolve**,一种用于改进智能体回避的上下文工程方法,它将完整的交互轨迹提炼为可复用的停止规则。在WebShop上,**convolve** 在不更新模型参数的情况下大幅提高了及时回避能力,将Llama-3.3-70B的及时召回率从26.7%提升到57.4%。我们的数据集和代码可在 https://lhannnn.github.io/agentic-abstention 获取。††脚注:∗同等贡献。
## 1 引言
智能体旨在遵循用户指令并在环境中行动,以完成任务,例如浏览网页[deng2023mind2web],在线购物[yao2022webshop; guo2026susbench],或在终端中操作[merrill2026terminal]。智能体通过迭代选择行动、调用工具并结合来自环境的观察来实现这些任务,以朝着用户目标前进。先前的工作主要集中在衡量和改进成功的任务完成,例如通过更好的记忆和上下文管理[packer2024memgptllmsoperatingsystems]、更强的规划和决策能力[yao2022react],以及更有效的智能体架构或框架[wang2023voyager]。最近的工作开始研究不确定性[oh2026uncertainty; kirchhof2025position]、低效或不安全的工具使用[qian2025smart; xie2026oversearchingsearchaugmentedlargelanguage; bonagiri2025check]以及澄清[zhang2025clarify; zhang2024clamber; kobalczyk2025active; cao2026clarify]在智能体设置中的问题,但这些工作没有将回避作为智能体在不同场景下做出的决策来研究。因此,现有的评估方法未能解决当请求的任务不可行时智能体应如何行为的问题,无论是由于用户指令的歧义,还是因为任务在给定环境和动作空间中无法完成。
在这项工作中,我们通过研究使用工具的智能体何时应该停止行动而不是继续与环境交互,来填补这一空白。我们将智能体识别任务不确定或根本上不可实现,并相应停止行动的能力称为**智能体回避**。这个设置不同于**LLM回避** [wen2025know; feng2024don; kirichenko2025abstentionbench; brahman2024art],后者通常研究单轮问答,其中模型的动作空间仅限于回答或回避。相比之下,在智能体回避中,智能体拥有更丰富的动作空间:它可以搜索、点击、与环境交互,并继续探索,而不是立即回答或回避。其上下文也会随着交互过程而演变。因此,一些任务起初看起来可解决,只有在进一步交互后回避的需求才变得明显(见图1 (https://arxiv.org/html/2606.28733#S1.F1))。
我们在网络购物、终端交互和问答场景中研究智能体回避。我们通过从AbstentionBench [kirichenko2025abstentionbench] 中筛选过滤的示例,并从WebShop [yao2022webshop] 和Terminal-Bench 2.0 [merrill2026terminal] 中的任务构建回避实例,创建了一个包含这些场景下28,000条指令的综合基准。对于WebShop和Terminal-Bench 2.0,我们构建了两种新型回避指令:**基于请求的回避**,其中我们修改指令使其模糊;以及**基于环境的回避**,其中我们修改环境,使得原始指令不再能被满足,但这只有在智能体与环境交互后才能发现(例如,如果请求是购买一件红衬衫,我们修改环境移除所有红衬衫)。
参考图注 图1:这是一个网络购物场景中的基于环境回避示例,智能体只有在与环境交互后才发现任务不可行。我们展示了三条轨迹:(i) 及时成功:智能体在拥有足够信息的最早可能步骤中回避,(ii) 延迟成功:智能体在经过几个不必要的工具调用后最终正确回避,(iii) 回避失败:智能体在剩余轮次中发出不必要的工具调用,且在10轮预算内未回避。
使用我们综合的智能体回避基准,我们评估了13个LLM即智能体系统(例如GPT-5.4、Llama-3.3-70B)和2个智能体框架(Terminus 2和Codex CLI)在网络购物、终端交互和问答设置中的组合。我们发现智能体回避在这些场景中都很困难。在网络环境中,许多模型最终能识别出指令无法完成,但往往是在许多不必要交互步骤之后,例如,最强基线仅达到26.7%的及时回避召回率(AbsRec@1)和83.2%的总体回避召回率(最大轮次为10时的AbsRec)。类似地,在终端设置中,最佳配置在回避任务上仅达到21.6%的及时召回率。对于问答任务,所有模型在特定类型的回避上表现尤其糟糕,例如带有错误前提或未明确意图的问题,所有模型的及时和总体回避召回率都很低(低于或等于50%)。我们还发现,更强的基模型并不总是回避得更好;推理能力可以提高及时回避,但也降低了总体回避召回率;增加模型规模并不会改善及时回避。在终端环境中,智能体框架本身具有显著影响,表明回避不仅受基模型影响,还受智能体与环境交互方式的影响。
为了改进智能体回避,我们引入了 **convolve**,这是一种从完整交互轨迹中学习的上下文工程方法。**convolve** 推导并维护一个动态剧本,其中包含了关于何时继续交互不太可能帮助的可复用经验,并将其附加到智能体上下文中以提高回避表现。在网络购物中,**convolve** 在保持任务完成的同时大幅提高了及时回避能力。对于Llama-3.3-70B,它将及时回避召回率从26.7%提高到57.4%,总体回避召回率从83.2%提高到100.0%。我们进一步发现,大型模型学到的经验通常最有效,尽管小型模型学到的经验同样可以迁移到大型模型。
总之,我们的主要贡献如下:
- • 我们引入了**智能体回避**,即决定使用工具的智能体何时应该停止行动而非继续与环境交互的问题。我们将智能体回避形式化为一个序列决策问题,其中智能体可以回答、回避或采取进一步行动。
- • 我们通过从WebShop、Terminal-Bench和AbstentionBench中适配或构建超过28,000条指令,建立了一个智能体回避基准,涵盖基于网络的决策、基于终端的任务执行和问答。我们在基准上评估了13个LLM即智能体系统和两个智能体框架,表明智能体回避非常困难,大多数系统的平均回避召回率低于50%。及时回避(在智能体拥有足够信息的第一个轮次中回避)是一个持续的挑战,我们测试的所有模型平均及时召回率低于40%。我们还研究了模型规模、推理能力和智能体框架的贡献。
- • 我们提出了 **convolve**,一种上下文工程方法,将完整的交互轨迹提炼为可复用的经验剧本。使用 **convolve** 增强的智能体在无需更新任何模型参数的情况下大幅提高了及时回避能力。
## 2 智能体回避
我们将智能体回避定义为智能体识别任务不可行并选择回避的能力,而不是直接回答(并错误地回答)或采取不必要的行动。智能体回避可以形式化为一个部分可观测马尔可夫决策过程(POMDP),记为 \(\mathcal{M}=(\mathcal{S},\mathcal{A},\mathcal{O},T,\Omega,R)\)。这里,\(\mathcal{S}\) 表示潜在任务状态,包括智能体无法直接观测的属性,例如在可用上下文和工具下任务是否可解决。动作空间为 \(\mathcal{A}=\{\texttt{ANSWER},\texttt{ABSTAIN},\texttt{ACT}\}\),其中 \(\texttt{ANSWER}\) 表示任何终止性任务完成动作,例如在问答中给出最终答案、在WebShop中购买商品或在Terminal-Bench中提交解决方案;\(\texttt{ABSTAIN}\) 表示在当前信息状态下不继续的终止性决策;\(\texttt{ACT}\) 表示非终止性外部动作,例如发出搜索查询或与环境交互以获取更多信息。在第 \(t\) 轮,智能体接收一个观察 \(o_t \in \mathcal{O}\),包括当前交互上下文、原始指令、先前的交互历史以及环境返回的任何信息。环境根据转移函数 \(T(s_{t+1} \mid s_t, a_t)\) 演化,并根据观察函数 \(\Omega(o_{t+1} \mid s_{t+1}, a_t)\) 生成观察。由于底层任务状态仅部分可观测,智能体基于交互历史 \(h_t = (x, o_1, a_1, \dots, o_t)\) 做决策,其中 \(x\) 是初始用户指令。智能体随后根据依赖于历史的策略 \(\pi(a_t \mid h_t)\) 选择动作。如果智能体选择 \(\texttt{ACT}\),环境返回新的观察,交互继续。如果选择 \(\texttt{ANSWER}\) 或 \(\texttt{ABSTAIN}\),回合结束。当达到预定义的步数预算时,交互也会终止。
为了评估,每个实例都标注了一个二元标签 \(y \in \{0, 1\}\),其中 \(y=1\) 表示一个**应当回避**的实例,\(y=0\) 表示一个**可解决**的实例。我们将一个实例定义为应当回避,如果它在给定的交互设置下,即使在适当使用允许的动作后,也无法可靠地解决。我们使用POMDP形式来捕捉部分可观测性和序列决策;尽管奖励函数 \(R\) 是标准形式的一部分,但在我们的设置中,我们不将奖励优化作为目标。
在某些交互设置中,当可用信息不足以可靠地解决任务时,智能体可能向用户请求澄清。我们将此类请求视为 \(\texttt{ABSTAIN}\) 的实例,而不是一个单独的主要动作。从这个意义上说,\(\texttt{ABSTAIN}\) 包括任何在当前信息状态下停止给出最终答案或继续的决策,无论是通过说明任务无法解决,还是向用户请求缺失信息。在我们的评估中,澄清请求被视为回避,并且一旦发出,回合结束。
## 3 数据集
智能体应用涵盖了广泛的环境,从网络界面 [deng2023mind2web; yao2022webshop] 到基于终端的系统 [merrill2026terminal](相关工作见附录C (https://arxiv.org/html/2606.28733#A3)),这使得在评估中覆盖所有可能的场景变得困难。因此,我们采用以任务为中心的视角,为三个代表性场景构建智能体回避任务:(i) 基于网络的决策,智能体与模拟购物网站交互;(ii) 基于终端的任务执行,智能体在真实命令行环境中操作;(iii) 交互式问答,智能体可能使用搜索来解决信息不确定性。在各个设置中,我们既保留了现有数据集中的可解决任务,也构建了新的应当回避任务。对于网络和终端设置,我们构建了仅从请求本身来看就不可行的任务(基于请求的回避),以及只有在智能体与环境交互后才变得不可行的任务(基于环境的回避)。
**基于网络的决策任务。** 对于基于网络的任务,我们适配了WebShop [yao2022webshop],这是一个模拟的在线购物环境,智能体在其中根据自然语言指令和可点击按钮进行搜索、浏览和选择产品。我们使用WebShop测试集中的前500条指令,遵循先前的工作 [liu2023agentbench]。原始的WebShop任务设计为可解决,因此我们保留这500条指令作为可解决实例,并构建500个新的应当回避实例。对于**基于请求的回避**,我们重写用户指令,使得仅凭请求本身任务就不可行。我们生成三种重写指令:**主观偏好**,成功取决于未观察到的个人品味;**未明确意图**,指令引用缺失的用户特定上下文或先前的交互历史;以及**错误前提或矛盾**,指令包含不兼容或不可能的约束。我们使用LLM生成候选重写,并手动审查所有生成的指令,修订或过滤那些不自然或不能清楚证明应当回避的案例。此过程产生了249个基于请求的回避任务。对于**基于环境的回避**,我们保持原始指令不变,但通过从产品目录中移除真实目标物品并重建 Lucene 搜索索引来修改环境,使得移除的物品无法被检索。这些任务最初看起来可解决,只有通过交互发现没有目标物品可用时,回避才成为正确的行动。这产生了251个基于环境的回避任务,我们称之为**缺失目标**任务。我们最终的WebShop评估集包含1,000个实例,可解决和不可解决任务之间保持平衡的1:1比例。数据集构建细节相似文章
AgentAbstain: LLM 智能体知道何时不应行动吗?
本文介绍了 AgentAbstain,这是首个系统评估 LLM 智能体在适当时刻克制行动能力的框架,包含一个涵盖 8 种不作为场景的 263 个配对任务的基准测试。最佳智能体仅达到 59.5% 的配对准确率,揭示了一个与通用任务解决能力无关的关键差距。
基准测试未衡量的:论自主智能体弃权能力的评估
本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。
最佳智能体模型是懂得何时停止的那一个
文章认为,高效的AI智能体需要克制和明确的“停止条件”,而非无限的自主性,并指出Ling-2.6-1T是一个适合保守规划角色的模型。
LLM弃权的两个维度:答案正确性与问题可回答性
本文研究了LLM弃权的两个维度:答案正确性与问题可回答性。研究表明,单一的置信度阈值会混淆这两种失败模式,并提出了一种带有独立预算的三类选择性接受框架。在五个经过指令微调的模型上进行的实验表明,可回答性在内部是可读的,但输出置信度或自我评估难以捕捉。
面向LLM Agent澄清请求的不确定性分解
本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。