一次成功不等于可靠:Thinkingbox,面向状态化业务工作流的代理沙盒与基准测试

arXiv cs.CL 论文

摘要

Thinkingbox 引入了一个沙盒和基准测试,用于评估状态化业务工作流中的AI代理,揭示了当前模型在偶尔成功与可靠完成任务之间的显著差距。

arXiv:2608.19741v1 Announce Type: new 摘要:最近的代理基准测试越来越多地将评估置于可执行环境中,从代码修复到网页导航、应用API和函数调用。然而,完成代码之外的重要工作不仅仅需要产生一个合理的响应或有效的工具调用:代理必须在多个回合中收集缺失信息、遵循领域策略、协调依赖工具,并在没有副作用的情况下实现正确的持久状态转换。在本文中,我们介绍了Thinkingbox,一个用于工具-代理-用户交互的沙盒,提供隔离的MCP兼容工具会话、完整的执行跟踪,以及对终端后端状态的结果评估。基于此沙盒,Thinkingbox-bench包含507个策略条件化的工作流,涵盖多个场景,包括零售、酒店、汽车保险、新银行内部IT,以及咨询IT/HR支持。每次尝试通过特定任务的可执行检查进行评估,接受有效轨迹而拒绝错误、缺失或多余的效果;指定任务还检查最终响应的必需属性。在专有和开源权重模型中,最强模型实现了65.36%的pass@1,但只有25.25%的pass^20。此外,许多失败试验显示干净的终止和有效的状态改变动作,表明响应或工具调用层面的信号不是端到端任务完成的清晰代理。Thinkingbox-bench揭示了偶尔找到成功轨迹与可靠完成状态化业务任务之间的巨大差距。我们发布了Thinkingbox和Thinkingbox-Bench:https://github.com/microsoft/thinkingbox
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:09

# Thinkingbox:面向有状态业务流程中智能体的沙箱与评测基准
来源:https://arxiv.org/html/2608.19741

## 一次成功不等于可靠:面向有状态业务流程中智能体的沙箱与评测基准 Thinkingbox
杨民·高、阿里·克拉马蒂、尼古拉·费里、苏珊娜·帕尔马斯·洛佩斯·佩莱茨、梁春·蔡、卡尔文·王、米尔科·米莱塔里、图欣·昆杜、瓦迪姆·斯莫利亚科夫、比约恩·奥拉夫松、汤米·盖伊\[1.0ex\] 匹兹堡大学 西北大学 加州大学欧文分校 微软

###### 摘要
近期智能体评测基准日益将评估置于可执行环境中,涵盖代码修复、网页导航、应用API及函数调用。然而,完成代码之外的重要工作,不仅仅需要生成看似合理的响应或有效的工具调用:智能体必须在多轮交互中收集缺失信息、遵循领域策略、协调依赖工具,并在不产生副作用的情况下实现正确的持久状态转换。本文引入**Thinkingbox**,一个用于工具-智能体-用户交互的沙箱,它提供隔离的、兼容MCP的工具会话、完整的执行轨迹以及基于终端后端状态的结果评估。基于此沙箱构建的**Thinkingbox-bench**包含跨多个场景的507个策略条件工作流,场景包括零售、酒店、汽车保险、新银行内部IT以及咨询IT/HR支持。每次尝试由任务特定的可执行检查进行评估,这些检查接受有效轨迹,同时拒绝错误、缺失或多余的效应;指定任务还会额外检查最终响应所需的属性。在闭源和开源模型中,最强模型的通过率@1为65.36%,但通过率^20仅为25.25%。此外,许多失败的尝试都显示出正常的终止和有效的状态变更动作,这表明响应或工具调用层面的信号并不能作为端到端任务完成的明确代理指标。**Thinkingbox-bench**揭示了偶然找到成功轨迹与可靠完成有状态业务任务之间存在巨大差距。我们开源了Thinkingbox和Thinkingbox-Bench:https://github.com/microsoft/thinkingbox
††脚注文本:† 均等贡献;工作完成于微软实习期间。

## 1 引言
大语言模型智能体的评估越来越多地基于可执行工件来判定成功:补丁可以针对代码库进行测试(9 (https://arxiv.org/html/2608.19741#bib.bib1)),函数调用可以被解析或执行(23 (https://arxiv.org/html/2608.19741#bib.bib8); 25 (https://arxiv.org/html/2608.19741#bib.bib9)),并且智能体可以在交互环境中获得评分(15 (https://arxiv.org/html/2608.19741#bib.bib2); 40 (https://arxiv.org/html/2608.19741#bib.bib6))。这一进展至关重要,但基准设计自然倾向于那些结果易于规定和执行的任务。实际上,智能体还必须完成既非代码也非仅仅是工具调用轨迹的工作:修改预订、处理退款、更新保险理赔或路由内部服务请求。此类任务是多轮、有状态且具有后果的,要求智能体协调用户交互、工具使用、策略约束和后端副作用。评估此类工作既需要基准测试,也需要一个交互基础平台,该平台能够实例化一个世界、暴露领域工具、模拟用户后续操作、提取副作用并运行结果检查。
现有基准涵盖了策略引导的用户交互和最终数据库状态(40 (https://arxiv.org/html/2608.19741#bib.bib6))、有状态对话工具(16 (https://arxiv.org/html/2608.19741#bib.bib32))、具有副作用检查的应用世界(30 (https://arxiv.org/html/2608.19741#bib.bib5))以及真实/有状态的MCP环境(2 (https://arxiv.org/html/2608.19741#bib.bib7); 33 (https://arxiv.org/html/2608.19741#bib.bib35))。**Thinkingbox**提供了一种互补的抽象:一个可复用的沙箱,用于在有状态任务世界中进行工具-智能体-用户交互,其中相同的循环支持推理、排行榜评估和故障分析。
图注:**ThinkingBox**概览与可发现性–可靠性差距。(A) **ThinkingBox**运行模拟用户、大语言模型智能体和隔离的MCP兼容工具之间的多轮交互,然后使用可执行判断器评估终端状态、副作用和对话。更详细的流程见图2(https://arxiv.org/html/2608.19741#S3.F2)。(B) 在507个任务中,每个任务进行20次尝试,通过率@20远高于通过率@1,而全部20次成功的比率则低得多,这表明成功的轨迹通常是可发现的,但无法可靠重复。完整结果见表4(https://arxiv.org/html/2608.19741#S5.T4)。
我们引入了**Thinkingbox**,一个用于此类交互的沙箱。**Thinkingbox**在模拟用户与智能体的对话中运行智能体,通过隔离的后端会话暴露领域工具,检索副作用,并运行任务特定的结果检查。我们进一步引入**Thinkingbox-bench**,一个基于该沙箱构建的基准,包含一个由507个有状态业务流程任务组成的测试集。每个任务都根据其所需的终端后端状态进行检查。此外,有30个任务对最终响应应用一个或多个二元评分标准,涵盖所需的披露、保密性以及与执行结果的一致性。这些基于结果的检查允许不同的有效轨迹,同时拒绝错误、缺失或多余的持久效应。这使得非代码工作的验证无需将其简化为单一最终答案成为可能。
**Thinkingbox-bench**涵盖五个领域:零售/电子商务、旅行与酒店、汽车保险、新银行内部IT支持以及咨询IT/HR支持。这些领域强调了重复出现的企业辅助模式:多步骤交易、策略条件更新、用户澄清、记录查询以及不可逆或高影响的副作用。遵循近期以可靠性为导向的智能体评估(40 (https://arxiv.org/html/2608.19741#bib.bib6)),我们报告通过率@1,并使用互补的通过率@k和通过率^k分析来区分可靠的重复与通过重试偶然发现的成功。排行榜结果(图1 (https://arxiv.org/html/2608.19741#S1.F1) 和表4 (https://arxiv.org/html/2608.19741#S5.T4))显示还有很大提升空间:最强的模型达到65.36%的通过率@1,并在91.12%的任务中至少成功一次,但在所有20次尝试中都成功的比例仅为25.25%。
我们的贡献如下:
- • 我们提出了**Thinkingbox**,一个可复用的沙箱和编排器,用于在有状态工具环境中进行工具-智能体-用户交互。
- • 我们基于该沙箱构建了**Thinkingbox-bench**,它包含一个跨五个业务领域的507个任务基准。每个任务由针对最终状态、副作用和对话的多项可执行检查进行评分,而非单一最终答案。
- • 我们评估了12个闭源和开源大语言模型,每个任务进行20次重复试验,揭示了巨大的可发现性–可靠性差距(通过率@20 vs. 通过率^20),并分析了将流畅的工具使用与可靠的工作完成区分开来的失败模式和评估器消融实验。

## 2 相关工作
**Thinkingbox**位于可复用智能体环境与可执行基准的交叉点,适用于对话式工具使用和专业工作。
#### 沙箱与对话式工具使用
TextWorld、ALFWorld和WebShop为训练和评估语言智能体提供了交互世界(5 (https://arxiv.org/html/2608.19741#bib.bib10); 29 (https://arxiv.org/html/2608.19741#bib.bib11); 39 (https://arxiv.org/html/2608.19741#bib.bib12));AgentGym统一了异构环境中的交互(35 (https://arxiv.org/html/2608.19741#bib.bib38));Agent World Model为智能体训练生成了可执行的、基于数据库的MCP环境(31 (https://arxiv.org/html/2608.19741#bib.bib39))。互补的工作研究模块化工具使用和推理-动作接口(10 (https://arxiv.org/html/2608.19741#bib.bib14); 41 (https://arxiv.org/html/2608.19741#bib.bib15); 28 (https://arxiv.org/html/2608.19741#bib.bib16)),而API-Bank、Gorilla、ToolBench和BFCL则强调工具选择、参数和调用执行(14 (https://arxiv.org/html/2608.19741#bib.bib17); 24 (https://arxiv.org/html/2608.19741#bib.bib18); 25 (https://arxiv.org/html/2608.19741#bib.bib9); 23 (https://arxiv.org/html/2608.19741#bib.bib8))。与我们场景更接近的是,ToolSandbox结合了有状态工具和在线策略用户模拟器(16 (https://arxiv.org/html/2608.19741#bib.bib32));τ-bench通过终端数据库状态和重复可靠性评估策略引导的对话(40 (https://arxiv.org/html/2608.19741#bib.bib6));τ²-bench允许用户和智能体在一个共享世界中行动(3 (https://arxiv.org/html/2608.19741#bib.bib19))。**Thinkingbox**在这些基础上,为跨五个业务领域的人工审核工作流提供了通用运行时,使用任务特定的评估器检查持久效应,并通过重复试验测量可靠性。
#### 可执行与专业工作基准
可执行评估涵盖代码修复(9 (https://arxiv.org/html/2608.19741#bib.bib1))、广泛的交互设置(15 (https://arxiv.org/html/2608.19741#bib.bib2))、网页和桌面控制(43 (https://arxiv.org/html/2608.19741#bib.bib3); 12 (https://arxiv.org/html/2608.19741#bib.bib13); 36 (https://arxiv.org/html/2608.19741#bib.bib4))以及应用API。AppWorld基于状态的测试值得称道,它在检测副作用的同时允许替代解决方案(30 (https://arxiv.org/html/2608.19741#bib.bib5))。WorkArena++针对企业软件工作流(4 (https://arxiv.org/html/2608.19741#bib.bib33));CRMArena和CRMArena-Pro评估CRM任务,包括多轮专业交互(7 (https://arxiv.org/html/2608.19741#bib.bib34); 8 (https://arxiv.org/html/2608.19741#bib.bib40));AgentDojo在不受信任的工具输出下评估任务效用和安全性(6 (https://arxiv.org/html/2608.19741#bib.bib37))。MCP-Bench研究实时服务器工具发现与协调(32 (https://arxiv.org/html/2608.19741#bib.bib36));MCPMark将CRUD任务与初始状态和程序化验证配对(33 (https://arxiv.org/html/2608.19741#bib.bib35));MCP-Atlas在真实服务器上提供大规模诊断(2 (https://arxiv.org/html/2608.19741#bib.bib7))。基于状态和MCP评估,**Thinkingbox**将策略条件用户交互、可重置的业务工具世界、结果和副作用检查以及重复试验可靠性结合在一个沙箱和基准中。

## 3 Thinkingbox:用于工具-智能体-用户交互的沙箱
**Thinkingbox**的动机源于许多面向函数调用的工具使用评估的局限性,这些评估主要评估API选择、参数生成或可执行调用的正确性(14 (https://arxiv.org/html/2608.19741#bib.bib17); 24 (https://arxiv.org/html/2608.19741#bib.bib18); 25 (https://arxiv.org/html/2608.19741#bib.bib9); 23 (https://arxiv.org/html/2608.19741#bib.bib8))。它们可以检查模型是否产生了语法有效或可执行的调用,但无法检查智能体是否完成了该调用旨在完成的工作。在有状态业务任务中,可观察的答案只是成功的一部分。智能体可能用错误的实体调用了正确的API,在收集所需确认之前更新了记录,生成了可接受的用户消息但后端保持不变,或者执行了违反策略的多余副作用。**Thinkingbox**正是为此场景设计的交互基础平台。它在一个可复用的循环中运行智能体、模拟用户、领域工具、副作用提取器和判断器,将实际工作转化为可执行的智能体任务。
图注:**Thinkingbox**概览。该沙箱编排了模拟用户、大语言模型智能体、隔离的领域工具、副作用提取和可执行判断器之间的交互。相同的轨迹级判断支持基准评估、故障分析和智能体训练。
#### 任务世界与诱导的POMDP
我们将每个任务指定为 \(x=(b_0,g,\mathcal{T},\mathcal{U},\mathcal{C})\),(1) 其中 \(b_0\) 是初始后端状态,\(g\) 是用户目标,\(\mathcal{T}\) 是可用领域工具集,\(\mathcal{U}\) 是模拟用户策略,\(\mathcal{C}=\{c_i\}_{i=1}^m\) 包含一组隐藏的可执行检查。在第 \(t\) 轮,编排器向智能体提供对话历史和工具观察结果。智能体发出面向用户的消息或工具动作 \((\tau_t, p_t)\),其中 \(\tau_t \in \mathcal{T}\) 是工具,\(p_t\) 是其参数。工具动作针对任务后端的隔离会话执行。图2 (https://arxiv.org/html/2608.19741#S3.F2) 进一步说明了ThinkingBox的流程。每个此类规范自然诱导出一个有限视界的部分可观测马尔可夫决策过程(POMDP)\(\mathcal{M}_x = (\mathcal{S}_x, \mathcal{A}_x, \mathcal{O}_x, P_x, Z_x, R_x, \mu_x, H)\)。(2) 这里 \(\mathcal{S}_x, \mathcal{A}_x\) 和 \(\mathcal{O}_x\) 分别是状态、动作和观察空间;\(P_x\) 和 \(Z_x\) 是转移和观察核;\(R_x\) 是奖励函数;\(\mu_x\) 是初始状态分布;\(H\) 是最大情节视界。潜状态 \(s_t = (b_t, z_t, \ell_t, q_t) \in \mathcal{S}_x\) 包含后端状态、模拟用户的私有状态、评估相关事件日志和情节状态。在当前基准中,重置是确定性的,因此 \(\mu_x = \delta_{s_0}\) 是一个点质量,其中 \(s_0 = (b_0, z_0, \emptyset, \text{Active})\),\(z_0\) 在 \(\mathcal{U}\) 下根据 \(g\) 初始化。智能体不直接观察此状态。\(o_t \in \mathcal{O}_x\) 包含初始请求和可见的策略上下文、用户话语,或结构化的工具结果或错误。一个动作 \(a_t \in \mathcal{A}_x\) 是面向用户的消息、工具调用 \((\tau_t, p_t)\) 或终止。代码支持的工具定义后端转移,而 \(\mathcal{U}\) 定义可能随机的用户状态转移和回复;\(P_x\) 和 \(Z_x\) 捕获这些动态及其暴露的观察。因此,策略作用于可观测的历史 \(h_t = (o_0, a_0, \ldots, o_t)\) 而非潜状态。奖励 \(R_x\) 是稀疏的且只在终端定义,由公式4 (https://arxiv.org/html/2608.19741#S3.E4) 中的可执行裁决定义。这种分解遵循了连接持久状态、工具、观察和验证器的可执行智能体环境(40 (https://arxiv.org/html/2608.19741#bib.bib6); 16 (https://arxiv.org/html/2608.19741#bib.bib32); 3 (https://arxiv.org/html/2608.19741#bib.bib19); 31 (https://arxiv.org/html/2608.19741#bib.bib39))。因为在ThinkingBox中只有智能体直接调用状态变更工具,模拟用户是环境动态的一部分;附录C.4 (https://arxiv.org/html/2608.19741#A3.SS4) 完整指定了模拟用户策略、其提示词及其轮次协议。
#### 编排与隔离
对于每次尝试,它会将任务重置到 \(b_0\),初始化完整状态 \(s_0\),创建一个隔离的工具会话,转发消息,执行工具调用,并记录轨迹 \(\rho\)。同一任务的两次尝试必须不共享

相似文章

AI系统常以测试中不显现的方式失败?

Reddit r/AI_Agents

讨论AI工作流中干净的基准测试环境与混乱的真实世界使用之间的常见差距,导致生产环境失败,并提及评估平台如Confident AI、Braintrust和Langfuse。