AGORA: 基于档案的智能体工作场所文档推理基准
摘要
AGORA 是一个新的基准,用于评估大型语言模型在工作场所文档上进行基于档案的推理任务,包含 362 个问题,涉及 9,664 份真实文档。最强模型仅达到 59.4% 的准确率,凸显出巨大的改进空间。
arXiv:2606.24526v1 公告类型: 新
摘要:大型语言模型越来越多地被部署为智能体,它们对文档进行推理,而不是从参数化知识中回答。我们研究基于档案的推理:在大量杂乱的工作场所文件集合中定位稀疏证据,协调不一致的术语、单位及时期惯例,并计算出答案。现有基准仅针对此设置的部分方面,没有哪个基准同时强调基于档案性、智能体探索和跨领域覆盖。我们引入了 Agora,这是一个基准,将 362 个问题与八个领域的 9,664 份真实文档和 3.72 亿个词元配对,远超任何模型的上下文窗口,因此智能体必须有目的地探索,而非穷举扫描。Agora 由一条智能体流水线构建,结合了跨文档任务合成、防泄漏混淆和难度过滤。评估八个模型后,我们发现该任务远未解决:即使最强的模型也仅达到 59.4% 的准确率,且各领域之间存在显著差异。
查看缓存全文
缓存时间: 2026/06/24 07:47
# 面向智能体工作场所文档推理的档案驱动基准 来源:https://arxiv.org/html/2606.24526 Honglin Guo1,*,Qi Zhang1,*,Yu Zhang2,Weijie Li1,Rui Zheng3, Zhikai Lei3,Qiyuan Peng1,Zhiheng Xi1,Tao Gui1,Qi Zhang1 1复旦大学,2浙江大学,3上海奇绩智峰有限公司。 [email protected], {tgui,qz}@fudan.edu.cn ###### 摘要 大型语言模型越来越多地被部署为智能体,它们基于文档进行推理,而不是依靠参数化知识。我们研究*档案驱动推理*:在大量杂乱的工作文件中定位稀疏的线索,协调不一致的术语、单位、时间惯例,并计算出答案。现有基准仅涵盖此场景的部分方面,没有一个能同时强调档案驱动性、智能体探索和跨领域覆盖。我们提出Agora111Agora 是 Archive-Grounded Office Reasoning Assessment(档案驱动办公推理评估)的缩写。,一个包含362个问题的基准,覆盖八个领域集合,共9,664份真实文档和3.72亿个token,远超任何模型的上下文窗口,因此智能体必须有策略地探索,而不是穷尽扫描。Agora 通过一个智能体流水线构建,结合了跨文档任务合成、防止泄露的混淆和难度过滤。评估八种模型,我们发现任务远未解决:即使最强的模型也只有59.4%的准确率,且不同领域之间存在显著差异。 Agora: 面向智能体工作场所文档推理的档案驱动基准 Honglin Guo1,*††感谢:相等贡献,Qi Zhang1,*,Yu Zhang2,Weijie Li1,Rui Zheng3,Zhikai Lei3,Qiyuan Peng1,Zhiheng Xi1,Tao Gui1,Qi Zhang1 1复旦大学,2浙江大学,3上海奇绩智峰有限公司。 [email protected], {tgui,qz}@fudan.edu.cn ## 1 引言 参见图注 图1:Agora 概览。该基准包含9,664份文档、3.72亿个token和362个问题,涵盖八个专业领域。即使最强的模型也只有59.4%的整体准确率,还有很大的改进空间。 表1:与代表性的多跳QA、文档QA、RAG和智能体基准的对比。多文件:回答一个问题是否可能需要来自多个文件的证据。档案驱动:推理是否限定在固定语料库内,而非实时网页搜索或开放环境。智能体:是否需要主动文件导航和代码执行。标记:✓ = 是,△ = 部分,✗ = 否,– = 不适用。 大型语言模型越来越多地被用作智能体,而非独立的聊天机器人(Yang 等,2024 (https://arxiv.org/html/2606.24526#bib.bib20);Luo 等,2025 (https://arxiv.org/html/2606.24526#bib.bib7);DeepSeek-AI,2026 (https://arxiv.org/html/2606.24526#bib.bib36))。在企业环境中,它们的价值不仅在于生成流畅的回复,更在于帮助用户在内部档案中完成真正的知识工作任务(Han 等,2025 (https://arxiv.org/html/2606.24526#bib.bib5);Zhang 等,2026 (https://arxiv.org/html/2606.24526#bib.bib4))。例如,金融分析师需要核对报告和电子表格中的数字,法律研究人员需要追踪相关条款和判例,政策团队需要综合来自分散文档的证据。这些任务之所以困难,是因为内部档案通常规模庞大、组织不一致,并充满相互矛盾的术语、单位、日期和假设(Islam 等,2023 (https://arxiv.org/html/2606.24526#bib.bib12);Zhao 等,2022 (https://arxiv.org/html/2606.24526#bib.bib3))。一个有能力智能体必须定位稀疏的证据、协调不一致之处、执行必要的计算,并给出准确、可验证且对决策直接有用的答案(Jin 等,2025b (https://arxiv.org/html/2606.24526#bib.bib2);Zheng 等,2025 (https://arxiv.org/html/2606.24526#bib.bib1))。因此,评估语言智能体需要评估的不仅是它们在聊天中的流畅性,而是它们进行档案驱动文档推理的能力,这是它们能否成为可靠工作助手的关键能力。 如表1 (https://arxiv.org/html/2606.24526#S1.T1) 所示,现有基准仅涵盖上述要求的部分。多跳QA基准(Yang 等,2018 (https://arxiv.org/html/2606.24526#bib.bib8);Trivedi 等,2022 (https://arxiv.org/html/2606.24526#bib.bib9);Krishna 等,2025 (https://arxiv.org/html/2606.24526#bib.bib10))通常依赖像维基百科这样的同质语料库,因此无法捕捉工作档案的文件格式多样性和不规则组织。文档QA和表格QA基准(Zhu 等,2021 (https://arxiv.org/html/2606.24526#bib.bib11);Islam 等,2023 (https://arxiv.org/html/2606.24526#bib.bib12))通常被构建为阅读理解任务,因此不需要智能体浏览文件系统或在异构文档上执行多步计算。智能体和网页浏览基准(Mialon 等,2024 (https://arxiv.org/html/2606.24526#bib.bib13);Zhou 等,2024 (https://arxiv.org/html/2606.24526#bib.bib14);Wei 等,2025 (https://arxiv.org/html/2606.24526#bib.bib15))大多在开放网页或模拟环境中运行,而不是在受限的内部档案上。最接近的先前工作是OfficeQA Pro(Opsahl-Ong 等,2026 (https://arxiv.org/html/2606.24526#bib.bib16)),它将检索与计算结合在大型企业风格语料库上;然而,它建立在单一外部来源之上,限制了其领域和文件格式覆盖。这一差距促使需要一个基准来评估LLM智能体是否能在真实的内部档案上进行推理,而不是在扁平、同质或网络规模的语料库上。 参见图注 图2:Agora 任务设置概览。给定一个自然语言查询,并配对八个专业领域集合之一,智能体通过bash工具调用探索文件并运行计算。经过多轮探索和分析后,它提交一个单一的数字答案,该答案与黄金答案进行确定性验证。 为了弥补这一差距,我们引入Agora,一个旨在测试LLM智能体能否在真实工作场所环境中进行档案驱动推理的基准。真正的档案驱动推理不是在扁平语料库上的简单阅读理解任务;它是在稀缺条件下的搜索和验证过程。Agora 包含362个自然语言查询,分布在八个特定领域集合中,涵盖9,664份真实世界文档和3.72亿个token。对于每个查询,智能体只能访问其配对的集合,必须导航文件结构、定位稀疏证据,并执行导出答案所需的计算。由于每个集合远大于当前模型的上下文窗口,智能体无法依赖穷尽扫描或浅层关键词匹配;它必须规划其探索,并对从档案中选出的证据进行推理。每个查询都有一个唯一、可验证的数字答案,实现了确定性、可重复的评估,无需人工或模型判断。 Agora 通过一个智能体流水线构建,该流水线使用深度搜索跨多个领域收集文档,合成跨文档的多跳问题,并通过防止泄露的混淆、难度过滤和人工验证来确保质量。如图1 (https://arxiv.org/html/2606.24526#S1.F1) 所示,生成的基准仍然具有高度挑战性:在八个评估模型中,即使最强的也只有59.4%的准确率。我们在Agora上评估了八种专有和开源模型的混合,所有模型均在mini-swe-agent中运行,这是一个仅暴露bash工具的最小化框架。这使得智能体界面保持固定和简单,有助于将比较集中在模型级别的推理、证据选择和工具使用上,而不是复杂的智能体框架上。档案驱动文档推理远未解决:即使最强的模型也只达到59.4%的准确率,略低于60%的门槛。更重要的是,不同领域的表现差异很大。结果表明,难度往往不是基准本身的属性,而是特定模型与特定领域交互的结果。事实上,每个领域的排行榜通常与整体排名不同,揭示了在单一来源或单一领域基准中会被隐藏的弱点。 我们的贡献有三方面。首先,我们引入Agora,一个用于档案驱动智能体文档推理的跨领域基准,包含362个问题,具有可验证的数字答案,覆盖八个工作场所文档集合,包括9,664份真实文档和3.72亿个token。其次,我们开发了一个智能体构建流水线,结合了跨文档任务合成、防止泄露的混淆、难度过滤和人工验证。第三,我们在Agora上评估了八种前沿的专有和开源模型,显示档案驱动文档推理远未解决:即使最强的模型也只达到59.4%的准确率,并表现出系统性的领域特定弱点。 ## 2 相关工作 从独立聊天机器人到自主智能体的转变由方法论进步推动(Yao 等,2023 (https://arxiv.org/html/2606.24526#bib.bib17);Schick 等,2023 (https://arxiv.org/html/2606.24526#bib.bib18)),这建立了将推理与工具调用交错进行的范式(Yang 等,2024 (https://arxiv.org/html/2606.24526#bib.bib20);Wang 等,2025 (https://arxiv.org/html/2606.24526#bib.bib21))。在这些基础上,智能体现在被广泛部署于实际生产力场景,涵盖代码修复、端到端办公工作流以及文档集合的深度研究(Li 等,2025a (https://arxiv.org/html/2606.24526#bib.bib24);Jin 等,2025a (https://arxiv.org/html/2606.24526#bib.bib23))。随着这些智能体的激增,严格且符合场景的基准对于衡量其真实世界能力变得至关重要。 第一类基准在越来越真实的环境中评估智能体。GAIA(Mialon 等,2024 (https://arxiv.org/html/2606.24526#bib.bib13))和BrowseComp(Wei 等,2025 (https://arxiv.org/html/2606.24526#bib.bib15))探索开放网页推理,使用浏览和搜索工具,而WebArena(Zhou 等,2024 (https://arxiv.org/html/2606.24526#bib.bib14))和OSWorld(Xie 等,2024 (https://arxiv.org/html/2606.24526#bib.bib26))针对模拟的浏览器和桌面操作系统环境。更接近办公工作流,SpreadsheetBench(Ma 等,2024 (https://arxiv.org/html/2606.24526#bib.bib27))评估单元格级操作和公式推理,MEBench(Lin 等,2025 (https://arxiv.org/html/2606.24526#bib.bib28))衡量对办公工件的多步工具使用,OfficeBench(Wang 等,2024 (https://arxiv.org/html/2606.24526#bib.bib29))将设置扩展到跨多种办公软件的任务完成。在这一类中,评估基于交互环境或具体办公工件,文档通常作为操作的目标,而不是作为需要推理的证据体。 更接近我们的设置,多文档问答(在工作区文档档案上)引起了广泛关注。HotpotQA(Yang 等,2018 (https://arxiv.org/html/2606.24526#bib.bib8))、2WikiMultihopQA(Ho 等,2020 (https://arxiv.org/html/2606.24526#bib.bib30))、MuSiQue(Trivedi 等,2022 (https://arxiv.org/html/2606.24526#bib.bib9))和FRAMES(Krishna 等,2025 (https://arxiv.org/html/2606.24526#bib.bib10))需要组合多个维基百科段落中的事实,通常有明确的支持事实监督;MultiHop-RAG(Tang and Yang,2024 (https://arxiv.org/html/2606.24526#bib.bib31))将设置扩展到新闻语料库,M3SCIQA(Li 等,2024 (https://arxiv.org/html/2606.24526#bib.bib32))将多跳推理推向科学文献。更接近专业设置,TAT-QA(Zhu 等,2021 (https://arxiv.org/html/2606.24526#bib.bib11))和FinanceBench(Islam 等,2023 (https://arxiv.org/html/2606.24526#bib.bib12))评估金融材料上的混合文本-表格推理,GDPVal(Patwardhan 等,2025 (https://arxiv.org/html/2606.24526#bib.bib33))衡量跨职业的经济价值产出,OfficeQA Pro(Opsahl-Ong 等,2026 (https://arxiv.org/html/2606.24526#bib.bib16))将检索与计算结合在特定语料库来源上。然而,这些基准中没有一个同时强调在大型内部集上的主动检索和跨文件协调单位、时间惯例和术语后再进行计算——这些条件定义了真实的生产力工作流,并推动了Agora的创建。 ## 3 Agora 基准 构建一个同时要求档案驱动性、智能体探索和跨领域覆盖的基准面临三个挑战:指定确实需要对固定集合进行推理(而非参数化知识或单文件查询)的任务;收集足够大、真实且杂乱的文档以便强制进行有策略的探索;以及合成可验证的多跳问题,同时防止证据泄漏。我们依次解决这些问题:形式化任务和基准,以及构建它的流水线。 ### 3.1 数据集期望 我们将Agora的设计提炼为四个期望,这些期望源自文档驱动推理在真实工作场所中产生的方式,以及我们构建一个严格可测量基准的目标。 #### 档案驱动性。 每个任务必须只能使用固定的源集合C\\mathcal{C}来回答,不能访问开放网页,因此得分取决于集合而非模型的先验知识。冻结的集合也使基准可重复:可用证据不会随时间漂移。 #### 跨领域覆盖。 基准必须覆盖广泛的专业领域。真实语料库在文件格式、表格结构、术语和报告惯例方面跨领域差异显著,单一来源的基准可能奖励那些过度拟合某一来源特殊性的智能体。从多个领域提取集合则衡量文档推理能力是否可泛化。 #### 智能体探索与证据整合。 任务必须端到端测试智能体:规划其探索、跨文件收集长距离证据链,并将这些证据综合成答案。证据稀疏地分布在大大量无关材料中,因此智能体必须有策略地导航,而非穷尽扫描,这在有限的上下文窗口下尤其具有挑战性。此外,检索到的证据通常无法直接对齐,在措辞、定义或单位及时间惯例上存在差异,这些不一致必须在最终计算前解决。 #### 可验证评估。 每个任务必须允许自动化和确定性的验证。为此,每个查询有一个单一的数字答案和指定的输出格式,因此可以通过标准化表面格式差异将响应与真值进行核对,无需人工或模型评判,从而避免其噪声和成本。 这些期望共同有意地界定了Agora:通过将真实、杂乱的文档环境与单一数字答案和自动验证配对,它针对的是智能体探索和推理,可以精确测量,而不是其他基准评估的开放式交付物质量。 参见图注 图3:Agora 构建流水线概览。第一阶段(数据收集与预处理)收集并解析文档。
相似文章
Legora Agentic Reasoning 基准评测(4分钟阅读)
Legora 推出了 Legora BAR 基准,用于评估法律工作流中 AI 的 agentic reasoning,利用真实案例和 Legora harness 来衡量系统级性能。
GraphARC:基于图结构的抽象推理综合基准
GraphARC是一个针对图结构数据抽象推理的新基准,将ARC范式扩展到图领域。对最新语言模型的评估揭示了理解与执行之间的差距,且在大规模实例上性能下降,凸显了扩展挑战。
扮演真正的研究者:一套评估前沿大语言模型及代理系统在研究生命周期中的基准测试集
本文介绍了AARR(扮演真正的研究者)基准系列,旨在评估前沿大语言模型和代理系统在细粒度研究场景中的表现。首个基准AARRI-Bench显示,即使表现最佳的代理成功率也仅为68.3%,凸显了其在领域敏感性和细微推理能力方面的不足。
ENTLORE:面向企业问答中潜在组织推理的基于图的基准
ENTLORE是一个基于图的基准框架,用于企业问答中的潜在组织推理评估,它表明即使拥有黄金文档来源,许多隐式关系问题仍然无法回答。
AI能否像城市规划师一样推理?基于专业判断对大型语言模型进行基准测试
本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。