WorkSurface-Bench:评估企业智能体在多表面知识路由中的能力
摘要
WorkSurface-Bench 通过 1,151 个任务,并分别评估路由分数和答案分数,来衡量企业智能体为给定查询选择正确知识表面(文档、表格或图表)的能力。实验表明,即使在工具受限的情况下,智能体在答案准确性方面仍存在困难,而表面提示能提升性能。
arXiv:2607.25765v1 公告类型:新论文
摘要:企业智能体通常需要整合多种异构知识源:文档用于叙述性事实、表格用于计算、依赖图用于文件关系。现有基准通常只评估检索或工具使用,而不区分智能体是否首先选择了合适的知识源。我们提出了 WorkSurface-Bench,一个专门评估表面路由(surface routing)能力的基准。该基准包含 1,151 个原子任务,源自基于角色的 Workspace-Bench-Lite 工作空间,涵盖文档、表格、图和跨表面问题。其参考答案是可审计的:表格答案通过执行 DuckDB 查询重现,文档答案基于已验证的文本片段,图答案可追溯至源依赖注释。我们在六种受控智能体设置下评估了四个模型骨干,生成了 27,624 条无协议错误的轨迹。在受限工具访问条件下,智能体的路由 F1 达到 98.7-99.8%,而答案仅达 56.1-75.3%,表明正确选择表面是完成任务所必需的但非充分条件。干预配对实验进一步显示,表面提示能提升四个模型中三个模型的答案准确率,而移除无关工具主要改善路由和效率。在独立的三位标注者审核中,所有 200 个抽样任务均以多数投票通过了全部六项质量标准,其中 192 项任务在所有标准上获得一致判定。我们已在 https://github.com/haolpku/WorkSurface-Bench 发布数据集、构建流程、评分代码和智能体框架。
查看缓存全文
缓存时间: 2026/07/29 09:55
# WorkSurface-Bench: 多知识面路由企业智能体的基准测试 来源: https://arxiv.org/html/2607.25765 1] 北京大学 2] 中关村实验室 3] 中国科学院大学 ###### 摘要 企业级智能体通常需要同时获取多种知识:文档用于叙述性事实,表格用于计算,依赖图用于文件关系。现有基准测试通常测试检索或工具使用,但并未将"选择正确的知识形式"与"正确使用它"区分开来。我们提出**WorkSurface-Bench**,该基准测试将这种选择评估为**知识面路由**。该基准将五个角色范围的工作空间(Workspace-Bench-Lite)投影到文档、表格和图三个知识面上,包含1,151个原子任务。其参考答案是可审计的:表格答案来自已执行的DuckDB查询,文档答案与逐字文本跨度进行核对,图答案源自源标注。我们在六种智能体设置下评估了四个骨干模型,生成了27,624条无协议错误的保留轨迹。金标准约束下的智能体路由F1得分达到98.7–99.8,但答案正确率仅为56.1–75.3%。一项匹配干预实验显示,知识面提示提高了三个模型(共四个)的答案正确率,而移除无关工具主要改善了路由和效率。在一项独立的三人审计中,所有200个抽样任务均满足全部六项标准(多数投票)。我们在 https://github.com/haolpku/WorkSurface-Bench 上发布构建流程、评分代码和智能体框架。 参见图注图1:WorkSurface-Bench 将一个共享的企业级基准语料库投影到三个标准知识面(RAG、表格、图)上,并将"路由"(知识面选择)和"答案"(最终正确性)作为独立的指标进行评分。## 1 引言 考虑一位运营分析师提出的问题:"哪些源文件提供了负方差库存报告,按运输方式计算的总物流成本是多少?"智能体必须阅读报告以获取上下文,查询表格以获取总成本,并跟踪依赖图以识别源文件。这些操作不可互换。文档检索无法执行SQL聚合,表格查询也无法揭示文件依赖关系。在回答之前,智能体必须首先确定问题需要哪类知识。 我们将每类知识称为一个**知识面**。在本文中,**知识面路由**意味着选择问题所需的文档、表格或图知识面。这种能力通常被隐藏在端到端的得分中。RAG基准测试主要关注最终答案是否正确。如果模型选择了错误的来源或检索了错误的证据,这两种失败都只会导致错误答案。工具使用基准测试评估API选择,但并未测试智能体是否能识别到某个问题需要不同的知识表示形式(例如,SQL而非散文式搜索)。对于部署而言,这种区别很重要:选择正确的知识面以及在选择之后正确地推理是两种不同的能力。 我们引入**WorkSurface-Bench**(图1 (https://arxiv.org/html/2607.25765#S0.F1))来衡量这两种能力。我们将五个角色范围的工作空间投影到三个可路由的知识面上:文档知识库、DuckDB表注册表和文件依赖图。程序性SOP作为任务元数据保留,而不是第四个可路由的知识面。每个任务获得四个分数——路由、证据、答案和效率——因此评估可以显示智能体是否选择了正确的知识面、找到了正确的证据、正确回答了问题以及使用了合理数量的计算资源。参考答案从来不直接来自模型的自由文本:我们执行表查询、验证文档跨度并从源标注中派生图答案。 这种分离使得失败更容易解释。低路由分数意味着智能体选择了错误的知识面;低证据分数意味着它选择了正确的知识面但没有访问所有必需的工件。高路由和证据分数加上低答案分数一致于下游计算或综合错误,尽管工件级别的证据指标并不能证明语义上的正确使用。仅凭端到端的准确性无法揭示这些阶段。 我们在1,151个任务上,基于六种智能体设置评估了四个骨干模型(GPT-4o-mini、DeepSeek-V4-Pro、Gemini-3.1-Pro和GPT-5.5)。主要结果很简单:**更好的路由并不能保证更好的答案**。金标准约束下的智能体路由F1得分达到98.7–99.8,而答案正确率仅为56.1–75.3%。匹配的金标准提示条件进一步将"了解所需的知识面"与"移除不相关的工具"分离开来。即使智能体知道在哪里查找,它仍然可能检索到不完整的证据、错误地组合来源或出现计算错误。 我们的贡献如下: 1. 1.**一个多知识面路由基准测试**(§3 (https://arxiv.org/html/2607.25765#S3)):1,151个任务,来自五个角色范围的工作空间,投影到文档、表格和图知识面上。据我们所知,这是第一个将知识面路由与答案指标分开评分的工作空间基准测试。 2. 2.**一个可验证的构建流程**(§3.3 (https://arxiv.org/html/2607.25765#S3.SS3)):确定性规则和经过验证的LLM辅助建议通过已执行的查询、经过检查的跨度或来源图标注(而非模型生成的值)来生成金标准答案。 3. 3.**一个诊断性评分协议**(§4 (https://arxiv.org/html/2607.25765#S4)):路由、证据、答案和效率分别评分,使得定位单个端到端分数会隐藏的失败成为可能。 4. 4.**路由与回答不同的证据**(§5 (https://arxiv.org/html/2607.25765#S5)):在四次完整的骨干模型扫描(无保留协议错误)中,金标准知识面指导对路由F1的提升远大于对答案的提升。 ## 2 相关工作 表1:与先前基准测试的定位比较。WorkSurface-Bench 将一个共享的企业语料库投影到三个可路由的知识面上,附加SOP元数据,并将知识面路由与答案正确性分开评分。条目基于引用的基准测试描述。WorkSurface-Bench 处于四个活跃基准测试线程的交汇点:多源检索增强QA、企业级智能体评估、工具和API路由,以及半结构化知识检索。表1 (https://arxiv.org/html/2607.25765#S2.T1) 沿我们关心的两个维度——存在多少分类上不同的**知识面**,以及知识面选择本身是否是一个评分指标——放置了代表性基准测试,并表明在所调查的基准测试中,这种组合尚未被代表。 ### 2.1 多源检索增强QA 最早尝试超越单一知识面RAG的方法是将**两个**来源融合到一个综合问题中。HybridQA 将维基百科表格与链接的段落配对;OTT-QA 将其扩展到40万开放域表格和500万段落;T2-RAGBench 增加了金融文本和表格检索;MMQA 结合了文本、表格和图像。在这些基准测试中,模型不会因为决定需要哪种表示形式而获得评分。mmRAG 最接近,覆盖了文本、表格和知识图谱并评估了查询路由,但将所有内容都转换为可检索的文档;我们保留了知识面原生工具并评分其实际使用。Enterprise Deep Search 评估跨异构企业工件的多跳检索,而我们分离了知识面选择、工件访问以及在原生文档、SQL和谱系图接口上的回答。 ### 2.2 半结构化知识检索 STaRK 评估对半结构化知识库的检索,其中概念级知识图谱(实体、类型化关系)与文本描述混合在一起。我们的图知识面反而编码了工作空间原生的文件谱系(文件依赖文件、文件支持输出、任务需要文件),支持诸如"哪些电子表格为仪表板提供数据"之类的问题。因此,它测试了与概念级KG检索不同的结构。 ### 2.3 工具和API路由 MetaTool、T-Eval、API-Bank 和 ToolLLM 评估工具或API选择;AgentBoard 跟踪多轮进度。它们在操作端点或动作序列之间进行路由。我们反而在信息类型之间进行路由:工具执行一个路由,而知识面决定了智能体必须咨询的表示形式。这个决策是对检索器路由的补充:智能体可能首先选择一种表示形式,然后在其内部选择检索器、查询程序或API。这种分层澄清了失败是在选择知识面原生接口之前还是之后发生的,这在比较模块化智能体系统和多阶段流程时很重要。 ### 2.4 企业工作空间智能体 Workspace-Bench、TheAgentCompany、WorkArena、AppWorld 和 τ-bench 专注于端到端的工作空间、网络或API成功。我们继承了Workspace-Bench的源和溯源流程,但隔离了知识路由并将文件依赖关系暴露为一个谱系查询面。 ## 3 基准测试构建 WorkSurface-Bench 由一个确定性流程构建(不添加合成事实),随后是一个可验证的LLM辅助扩展。图2 (https://arxiv.org/html/2607.25765#S3.F2) 给出了概览;我们在下面详细说明每个阶段,并在表3 (https://arxiv.org/html/2607.25765#S3.T3) 和表3 (https://arxiv.org/html/2607.25765#S3.T3) 中报告结果统计数据。 参见图注图2:构建流程。金标准答案可追溯到已执行的DuckDB结果、经过验证的文档跨度或来源依赖标注;通过这些证明工件来验证模型生成的建议。详情见 §3.3 (https://arxiv.org/html/2607.25765#S3.SS3)。表2:经过验证和筛选后的数据集组成。 表3:知识面工件和可执行验证覆盖率。 ### 3.1 源数据和溯源 我们派生自 Workspace-Bench-Lite 的英文子集。其数据流程是混合的:任务场景和依赖图由人工编写,并经过专家验证(针对Lark/字节跳动工作流),而工作空间文件结合了公共网络资源和有根据的LLM生成工件。结果是一个企业工作流基准测试,具有人工编写的任务、评分标准和图监督。为确保可重现性,第一个流程阶段记录了源提交和每个输入文件的SHA-256到一个锁定文件中。我们单独评估闭卷可回答性(§5.6 (https://arxiv.org/html/2607.25765#S5.SS6))。 ### 3.2 知识面投影 每个角色工作空间被投影到三个可路由的知识面上。**RAG**:文档、报告、PDF和幻灯片文本被转换为标准的UTF-8 Markdown格式,以便将路由与OCR/解析分开评估。**表格**:标准化的CSV/XLSX工作表被注册为每个工作簿的DuckDB视图,带有溯源列;覆盖率门控将非平凡的工作表(至少30行、四列且至少三行具有至少四个非空值,或一列中至少有5个不同的非空值)保留为表格,其余映射到RAG。**图**:Workspace-Bench文件依赖图,通过程序化边(提及、schema_overlap、version_of、shared_artifact)进行丰富。重复的评分标准模式产生 applicable_skills 元数据,作为辅助任务上下文而非可路由知识面。每个知识面都通过了附录7 (https://arxiv.org/html/2607.25765#S7) 中报告的可执行资格和泄露检查。 ### 3.3 任务派生 原子任务分两轮派生。**确定性**轮直接从源工件派生金标准:数值评分标准中的值($1,710,971.47、16.89%、"1000条记录")成为金标准答案;每个源任务对应一个 graph_only 任务,询问哪些文件是必需的输入;当对一个命名列执行DuckDB聚合能重现评分标准值时,则 emit 跨知识面任务。在**可验证的LLM辅助**轮中,模型提出问题和证明工件。表和跨知识面提案包括一个DuckDB查询,其执行结果成为金标准;RAG提案包括一个在源文档中经过逐字验证的答案。存在查询错误或缺失跨度的提案被丢弃。仅图金标准直接来自源依赖标注。最终的质量控制轮去重任务并重新验证模式。 ### 3.4 自动验证和模型辅助筛选 我们生成一个2,000个候选池,首先应用确定性检查:模式、唯一性、语言、泄露、查询执行、跨度和图路径。每个包含表格的项目必须通过只读查询重现其金标准,每个包含RAG的项目必须指向一个经过验证的跨度,每个包含图的项目必须匹配一个源依赖路径。ID和标准化问题也必须是唯一的。 然后我们应用语义筛选:可回答性、金标准正确性、自然性、原子性和无歧义性、声明知识面的必要性以及无泄露线索。GPT-5.5在严格评分标准下保留了1,465个候选。独立的DeepSeek和Gemini审计最终产生了1,151个项目的集合,要求至少两位审计员中的两位给出严格通过;429个项目通过了所有三个审计。严格通过要求在每一个维度上都给出肯定判断,失败或"不确定"的判断视为未通过。 ### 3.5 独立人工审计 三位标注员独立审计相同的分层抽样200个项目样本,使用发布的证据包和评分标准。样本涵盖了任务类型、角色和答案类型,包括所有15个三知识面项目。所有200个项目在所有六项标准上均获得多数通过判断。每个项目的知识面必要性和原子性均获得一致正面评价,192个项目在所有六项标准上获得一致判断。我们保留了项目级别的投票,并基于原始抽样项目计算这些比率。 ### 3.6 数据集分布和覆盖率 最终分布反映了满足验证和知识面必要性标准的候选者。它包含488个跨知识面任务:314个RAG+图,100个图+表格,59个RAG+表格,以及15个需要所有三个知识面的任务。三知识面任务较少,因为每种证据形式必须独立必要,且组合后的金标准必须保持可执行或可追溯。 角色频率遵循源工作空间,并集中在运营角色上(表3 (https://arxiv.org/html/2607.25765#S3.T3))。 表4:跨四个模型、六种设置和1,151个任务的主要结果(%)。路由-F1、证据、答案和效率按 §4 (https://arxiv.org/html/2607.25765#S4) 中的定义组成聚合。无工具路由不可用,得分为零。阴影标记两个金标准知识面条件;粗体标记模型内最佳。所有27,624条保留轨迹均无协议错误。 ### 3.7 数据集统计数据 该基准测试包含1,151个原子任务,跨越五个角色(表3 (https://arxiv.org/html/2607.25765#S3.T3)):488个跨知识面、213个仅RAG、171个仅图、279个仅表格。每个任务都带有一个自然语言问题、金标准答案、所需知识面、预期工具类型、证据标注和Workspace-Bench溯源。包含答案的金标准是可审计的:所有453个包含表格的查询都重现了其参考答案,所有601个包含RAG的项目都匹配经过验证的文档跨度,所有600个包含图的项目都通过了可执行的...
相似文章
搜索之后才是难题:评估网络代理在知识合成、组织和展示上的表现
论文介绍了KNOWS基准,用于评估网络代理在涉及将知识合成为和组织成制品的复杂长期任务时的表现,揭示了当前代理在视觉步骤和长期推理方面存在困难。
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。
SaaS-Bench:计算机使用代理能否利用真实世界的SaaS解决专业工作流程?
SaaS-Bench是一个新的基准测试,基于23个可部署的SaaS系统,覆盖六个专业领域,包含106个长周期任务,用于评估计算机使用代理。实验表明,即使是最强的模型,端到端完成任务的比例也不足4%,凸显了当前代理能力的显著限制。
KC-Bench: 一个用于评估LLM智能体中知识冲突的动态交互式基准
KC-Bench 是一个动态交互式基准,用于评估LLM智能体如何检测和解决用户指令、参数知识与环境观察之间的知识冲突,评估显示没有模型能可靠地处理所有冲突类型。
WeaveBench:混合界面计算机使用代理的长时域真实世界基准测试
WeaveBench是一个用于在长时域真实世界任务中跨多种界面(GUI、CLI、代码)评估计算机使用代理的新基准测试。它揭示了当前模型仅达到41.2%的通过率,且仅基于结果的评分高估了性能,凸显了评估中的重大差距。