受控智能体的集合切换行为测试
摘要
本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。
arXiv:2607.13396v1 公告类型:新
摘要:当可靠工具在持续会话中悄然发生变化时,LLM智能体的工具选择会如何?我们借鉴认知心理学中的集合切换概念,研究智能体如何适应隐藏的可靠性变化。我们的基准测试构建了具有冗余的工具技能库,其中多个工具可以解决同一任务,但隐藏可靠性不同。在我们的评估框架中,一个分支调度在隐藏边界处切换可靠工具组,并为每次切换配备一个无切换对照。我们发现,默认情况下,智能体在每个边界附近的几轮交互内安定于一个小的重复性常规,每次可靠性切换后,调用份额集中在几个离散值上。我们为每个智能体轨迹评分集合切换准确率:在每次切换后窗口中路由到目标工具组的联合概率。我们在一个开源的智能体测试框架中测试开放权重LLM,发现同一组常规中存在定性不同的失败模式。我们还发现,集合框架(即工具集将备选方案呈现为竞争或互补的方式)会改变路由动态。
查看缓存全文
缓存时间: 2026/07/16 04:24
# 套索代理的集转换行为测试
来源:https://arxiv.org/html/2607.13396
###### 摘要
当可靠工具在持续会话中静默发生变化时,LLM 代理的工具选择会如何变化?我们从认知心理学借用了“集转换”概念,研究代理适应隐藏可靠性变化的程度。我们的基准测试装载了带有冗余的工具技能库,其中多个工具可解决相同任务,但可靠性存在隐藏差异。在我们的评估框架中,分支调度在隐藏边界处切换可靠工具组,并将每个切换与一个无切换对照配对。我们发现,默认情况下,代理在每个边界后的几轮内会固定在一个小型的重复例程上,调用份额在每次可靠性切换后集中在少数离散值上。我们为每个代理轨迹计算集转换准确率:在每个切换后窗口内,路由到目标工具组的联合概率。我们在开源代理框架中测试开放权重的 LLM,并发现在相同例程集合中出现了性质上不同的故障模式。我们还发现,集框架(工具集将备选方案呈现为竞争性或互补性)会改变路由动态。
## 1 引言
反复解决相似问题的人类会形成简化未来决策的习惯,但这些习惯可能在超出其用途后仍然存在。Einstellung效应和威斯康星卡片分类测试(WCST)测量了这种僵化性,称为*执着*:前者表明人们在更简单的规则足够用时仍固守已学规则(Luchins, 1942 (https://arxiv.org/html/2607.13396#bib.bib20)),而后者则在任务中期静默改变分类规则(Grant & Berg, 1948 (https://arxiv.org/html/2607.13396#bib.bib9); Heaton et al., 1993 (https://arxiv.org/html/2607.13396#bib.bib11))。反转学习范式将相同类型的隐藏变化应用于基于价值的选择(Izquierdo et al., 2017 (https://arxiv.org/html/2607.13396#bib.bib13))。最近的工作将这些认知测试移植到 LLM,采用文本或视觉分类任务(Li et al., 2024 (https://arxiv.org/html/2607.13396#bib.bib17); Hao et al., 2025 (https://arxiv.org/html/2607.13396#bib.bib10); Li et al., 2025 (https://arxiv.org/html/2607.13396#bib.bib16))。
现代 LLM 代理位于代理框架中,每次调用都会附带先前的工具调用和结果、技能和工具模式以及系统提示,因此代理永远不会从空白状态开始。在这种丰富环境中,装载的技能和工具库可能包含多个名义上等价的能力,这些能力调用不同的 API 和后端服务,重复使用工具会让代理收敛于一个优先子集。这种偏好可能比未宣布的后端变更存活更久,使代理调用不再可靠的工具。此时,集转换测试会询问:当看似等价工具组背后的可靠后端静默发生变化时,代理能否更新其行动路线?
我们做出以下贡献:(i) 一个基于*冗余工具技能集*的代理基准测试,该库包含许多功能等价的工具,其中工作子集在轨迹中间静默切换,每次切换都配有一个无切换对照。¹¹¹https://github.com/zwycl/wcst-tool-bench (ii) 一个描述性框架,将切换后行为表征为一小组离散例程的重复。 (iii) 两个开放权重 LLM 的案例研究,测试两种干预渠道:*策略提示*(指令性)和*集框架*(结构性)。
group Agroup Bgroup Cskills123aux(a)技能-工具结构。每个 SKILL.md(左侧)描述一个工具组,每个组包含功能冗余的变体。边界静默地改变哪个组是可靠的。context + requestR∗R\_\{\*\}context + requestR2R\_\{2\}context + requestR1R\_\{1\}(b)一次 A→BA\\to B 切换后的连续三轮。每轮收到一个新的上下文+请求并发出一个工具调用路由。实心图标 = 已调用,淡出 = 未使用。展示的路由类别为 R∗R\_\{\*\}(无目标)、R2R\_\{2\}(目标加另一组)和 R1R\_\{1\}(仅目标)。R3R\_\{3\}(目标加另外两组)被省略。
## 2 基准测试
### 2.1 工具-技能集与分类
*工具*是框架暴露给代理的可调用函数,由唯一名称、自然语言描述和类型化参数模式定义。每次调用返回结构化的成功负载或失败指示符。*工具组*是一组功能等价的工具,具有相同的模式和后端操作,但名称和描述不同。*技能*是一个 markdown 过程,与一个工具组配对,并列举该组的工具。技能告诉代理何时以及如何调用工具,其工具列表是代理观察组成员身份的方式。每个领域有一个有限的工具组族 C={C(1),...,C(M)}\\mathcal\{C\}=\\\{C^\{\(1\)\},\\ldots,C^\{\(M\)\}\\\}。在用户轮次 tt 的*行动路由*是该轮次中发出的有序工具调用序列。*冗余工具-技能集*装载这些技能和工具,使得同一任务族的条目在描述和隐藏可靠性上不同。
技能、工具和任务的文本描述始终保持中立。所有用户提示使用单一的中立模板族,仅在不同轮次之间改变人物、时间窗口和持续时间。提示不提供任何朝向某一工具组的词汇线索,因此代理必须纯粹从二元工具反馈中发现活动工具组。相同提示的不同释义让我们看到代理的工具组选择并不仅仅追踪模板措辞。
### 2.2 领域与数据集构建
我们在三个领域中实例化模拟:调度与协调(3 组×\\times5 个工具)、DevOps 事件分类(4 组×\\times5 个工具)和多云存储(5 组×\\times2 个工具)。这三个领域还在组间关系上有所不同,我们称之为*集框架*维度,编码在每个领域的工具和技能描述中。调度将组呈现为竞争性的槽位提供商,任何一个组都能满足用户请求,其他组是替代方案。DevOps 将组呈现为互补的可观测性栈,共同描述一个服务。多云将组呈现为路径接口背后的竞争性存储提供商。每个组共享共同的措辞,并且在领域内所有主要工具共享一个函数模式和一个成功负载结构,因此暴露给代理的唯一差异是工具名称和一个简短描述。DevOps 和多云领域还提供同一工具集的匹配互补性和竞争性框架变体,用于第 4.4 节 (https://arxiv.org/html/2607.13396#S4.SS4)。所有工具都是模拟的,具有副作用的行为以可逆模拟实现,每个装载的集合实例化表4 (https://arxiv.org/html/2607.13396#A2.T4) 中的所有关系。
每个领域为每个工具组装载一个技能,技能同时加载。组内名称从单一主题词汇中抽取,组间命名平行,因此没有组具有词汇优势。工具实例化三种冗余关系:*描述变体*(相同模式和执行,不同措辞)、*质量梯度*(相同可见意图,不同阶段隐藏可靠性不同)和*副作用冲突*(可变操作)。每个领域还包括一个支持工具组和产生副作用的工具,后者在用户仅请求草稿或诊断时禁止使用。
我们通过 LLM 注释草拟数据集并手动审计。为了支持切换调度,我们在每个领域为每个阶段指定一个可靠工具组,所有工具组具有匹配的描述和相同的模式,因此代理看到的界面在边界间不变。完整的构建协议,包括审计和验证器,见附录 B (https://arxiv.org/html/2607.13396#A2)。
## 3 研究设计与评估
### 3.1 框架与环境
我们使用 Hermes Agent (Nous Research, 2026 (https://arxiv.org/html/2607.13396#bib.bib22)),一个具有持久会话上下文和装载技能库的开源框架,配合两个当代开放权重模型(通过 OpenRouter 服务):mimo-v2.5 (LLM-Core Xiaomi, 2026 (https://arxiv.org/html/2607.13396#bib.bib19)) 和 deepseek-v4-pro (DeepSeek-AI, 2026 (https://arxiv.org/html/2607.13396#bib.bib5))。代理在 Hermes 默认系统提示下运行,没有策略覆盖,因此常规助手条件反映框架自带的助手身份。我们通过 OpenRouter 请求温度 0.70.7、top-pp 0.950.95 和中等推理努力。所有其他设置均为 Hermes Agent 默认值。
模拟环境在各阶段之间是分段稳定的,仅在预定的切换边界处变化。一个确定性验证器将每个发出的工具调用映射到结构化的成功负载或一个没有任何诊断信息的裸失败指示符,匹配 WCST 和反转学习范式中使用的二元反馈(Grant & Berg, 1948 (https://arxiv.org/html/2607.13396#bib.bib9); Heaton et al., 1993 (https://arxiv.org/html/2607.13396#bib.bib11); Luchins, 1942 (https://arxiv.org/html/2607.13396#bib.bib20); Izquierdo et al., 2017 (https://arxiv.org/html/2607.13396#bib.bib13))。每一轮使用单一的中立提示模板,代理每轮的路由是一个观察结果,无论包含多少工具调用。
### 3.2 研究设计
BCphase 1: tool group B reliablephase 2: tool group C reliableshift at boundarykk11020304050turnpre-shift plateaupost-shift windowCell:clean commitmixedoff target(a)单个边界上的行为。顶部栏:各阶段可靠工具组。下方条:每轮选择的路由类别。AB\_prefixABCABAABBno-shift controlABCAABCBABCCABACABABABAAB→\\toCB→\\toAB→\\toBC→\\toAC→\\toBC→\\toCA→\\toCA→\\toBA→\\toAtier 0tier 1tier 2(b)分支调度树。共享前缀分为三个一级分支(两个切换加一个无切换对照),每个切换分支再分为三个二级端点。节点颜色显示端点的目标工具组。虚线边框表示无切换对照。边标签显示该边界处的工具组转换。
图2:集转换范式。(a)单个边界上的每轮行为。(b)分支调度树,在每个端点实例化(a)。#### 调度与树。
每次切换时,先前可靠的工具组变得不可靠,而所有工具组的名称、描述和模式保持不变,框架内没有任何东西宣布变化。对于MM个工具组和KK个分支层,调度是一个树(图2 (https://arxiv.org/html/2607.13396#S3.F2)b)。*轨迹*以一个共享的*前缀*开始:由一个种子标识的共同根,该种子固定工具显示顺序和每个组内的排列。为了随机化跨副本的位置效应,我们在nn个前缀之间循环旋转工具组显示顺序,并通过前缀种子排列每个工具组内的工具顺序。在从一个给定前缀恢复的所有分支中,这两种顺序保持固定。在每个内部节点处,调度分成三个兄弟:一个返回到先前使用的工具组(反转),一个转移到先前未使用的工具组(新转移),以及一个无切换对照(父工具组保持可靠)。我们通过阶段序列标记每个端点。对于每个前缀,我们保存根源的 Hermes 会话状态,并递归地将其恢复到每个子节点。兄弟集合提供由父状态配对的对比,跨分支对比以最近的共同祖先作为配对因子。
#### 研究问题。
在本研究中,我们提出以下问题:
1. 当可靠工具组切换时,代理是否以相同方式承诺新工具组,无论其先前使用角色如何,还是每个先前使用角色产生不同的模式?
2. 端点深度或到达端点的路径是否比最近一次切换更重要?
3. 策略提示能否改变路由类别分布?
4. 集框架是否会改变代理固定的例程?
RQ3 和 RQ4 测试两种平行的干预:指令性(策略提示)和结构性(集框架)。我们使用M=3M=3个工具组和K=2K=2个分支层,在 90 轮内给出三个边界:b1b\_\{1\}在第 15 轮(前缀内部,A→BA\\to B),b2b\_\{2\}在第 40 轮(进入一级子节点),b3b\_\{3\}在第 65 轮(进入二级子节点)。每个工具组在不同的点首次变得可靠:AA从第 1 轮开始,BB从第 16 轮开始,CC仅在一级边界(第 41 轮)在新转移端点上变得可靠,在无切换分支上从不。树共有九个端点。
调度为每个目标分配一个不同的*先前使用角色*:CAC^\{A\}作为*反转目标*(前缀早期可靠,然后关闭),CBC^\{B\}作为*强化目标*(前缀结束时一直可靠),CCC^\{C\}作为*新目标*(前缀中从未可靠)。在报告结果中,CAC^\{A\}、CBC^\{B\}和CCC^\{C\}之间的差异反映了这些先前使用角色。在三个领域中,§4.1 (https://arxiv.org/html/2607.13396#S4.SS1)–4.3 (https://arxiv.org/html/2607.13396#S4.SS3) 的主要分支实验使用调度领域,每个单元n=16n=16个前缀,§4.4 (https://arxiv.org/html/2607.13396#S4.SS4) 报告了在 DevOps 和多云领域的额外线性路径运行。
### 3.3 评估指标
为了回答 §3.2 (https://arxiv.org/html/2607.13396#S3.SS2.SSS0.Px2) 的四个研究问题,我们定义了一小组基于轨迹观察的指标。*集转换准确率*Φ\\Phi 的范围是 [0,1][0,1],等于从根到端点的路径上每个切换后窗口中的路由都位于正确工具组的概率。与 Φ\\Phi 一起,我们报告每个轮次的路由类别率,揭示每次切换的故障模式,以及任务完成率 FF(验证器判断为完成任务的轮次比例)。当代理从可靠组调用至少一个工具,使用所有必需的支持工具组,并且不调用禁止的副作用工具时,该轮次计入 FF。同时调用可靠组和不可靠组的轮次仍算作完成任务,因为可靠组完成了工作。
#### 集转换准确率。
直观地说,集转换准确率问的是:如果我们从每个切换后窗口中均匀抽取一次工具调用,那么每次抽到的调用都在其目标工具组中的概率是多少?跨窗口的独立抽样使得该联合概率等于每个切换后窗口中目标份额的乘积。形式上,对于通过边界 b1,...,bKb\_\{1\},\\ldots,b\_\{K\} 从根到达的端点,边界 bkb\_\{k\} 后的可靠工具组是 Ck∈CC\_\{k\}\\in\\mathcal\{C\},代理的切换后窗口 Pk\\mathcal\{P\}\_\{k\} 包含其后跟随的路由调用。令 sks\_\{k\} 为 Pk\\mathcal\{P\}\_\{k\} 中路由调用命中 CkC\_\{k\} 的份额,同时调用 CkC\_\{k\} 和另一组的轮次按其调用命中 CkC\_\{k\} 的比例贡献给 sks\_\{k\}。那么
Φ = ∏_{k=1}^{K} s_k. (1)
我们计算每个轨迹的集转换准确率 Φ\\Phi,作为其每窗口目标份额的路径乘积,并在副本之间求平均。Φ\\Phi 假设每个切换后窗口内的独立抽样。跨边界的相关性,例如我们在 §4.2 (https://arxiv.org/html/2607.13396#S4.SS2) 中报告的前缀级*锁定*,会膨相似文章
当工具失灵:LLM智能体动态重新规划与异常恢复的基准测试
ToolMaze基准测试评估了LLM智能体处理真实世界工具故障的能力,揭示了隐式语义故障导致的性能下降最为显著,而动态重新规划仍是模型扩展或提示工程无法解决的关键瓶颈。
LLM代理的一致性如何?在多步骤工具调用流程中测量行为可重现性
本文系统性地测量了LLM代理在多步骤工具调用流程中的行为可重现性,涉及1140条轨迹,发现了'结构一致性,参数变异性'的模式:代理可靠地按相同顺序选择工具,但参数有所不同,并且结构一致性能够预测任务的成功。
LLM代理已经知道何时调用工具——甚至无需推理
本文介绍了When2Tool,一个研究LLM代理实际何时需要调用工具的基准,并揭示模型已从隐藏状态知道工具的必要性但未能采取行动。提出的Probe&Prefill方法将不必要的工具调用减少了48%,且精度损失极小。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。