@omarsar0:Harness 的选择是一件大事。通过 agent harness 在各个层面都有很大的提升和改进空间。太棒了……

X AI KOLs Timeline 论文

摘要

这条推文重点介绍了针对数据代理的新 DataSpace 基准,表明 harness 的选择在多模态模型和 agent harness 中显著影响准确率,最佳准确率达到 66.34%,且该基准尚未饱和。

Harness 的选择至关重要。 通过 agent harness,在各方面都有很大的提升和改进空间。 这篇论文很好地强调了这一点。 新研究发布了 DataSpace,这是一个数据代理从异构工作区生成可验证表格结果的基准。包含 410 个跨语言任务,涉及 7,439 个工件,总计 15.01 GB,涵盖 CSV、JSON、SQLite、Markdown、PDF 和视频。 在六个近期前沿多模态模型和五个广泛使用的 agent harness 中,最佳准确率达到 66.34%。在固定主干模型的情况下,更换 harness 会使准确率变化 15.36 个百分点。 多模态证据整合和连接操作在所有六个主干模型上都会降低准确率。该基准远未饱和。 论文:https://arxiv.org/abs/2608.03451 在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/08/09 13:18

对异构工作空间上可验证分析的数据代理进行基准测试

来源:https://arxiv.org/html/2608.03451 ,Zhuowen Liang香港科技大学(广州)中国广州,Yupeng Xie香港科技大学(广州)中国广州,Xiaotian Lin香港科技大学(广州)中国广州,Tianqi Luo香港科技大学(广州)中国广州,Xinyu Liu香港科技大学(广州)中国广州,Yizhang Zhu香港科技大学(广州)中国广州,Zhangyang Peng香港科技大学(广州)中国广州,Yuan Li清华大学中国北京,Zhengxuan Zhang香港科技大学(广州)中国广州,Jiayi Zhang香港科技大学(广州)中国广州,Nan Tang香港科技大学(广州)中国广州,Guoliang Li清华大学中国北京and Yuyu Luo香港科技大学(广州)中国广州

摘要。数据代理使得在组织工作空间上进行自然语言分析成为可能,其中相关证据可能分散在数据库、结构化文件、长文档和多媒体中。现有基准大多将结构化查询、检索或开放式分析割裂开来,未能充分统一异构证据发现、完整表格输出和确定性评估。我们引入了DataSpace,这是一个基准,要求数据代理从任务局部的异构工作空间中生成可验证的表格结果。它包含410个跨语言任务和7,439个工件,总计15.01 GB,涵盖CSV、JSON、SQLite、Markdown、PDF和视频。DataSpace还作为KDD Cup 2026复杂数据分析数据代理竞赛的官方评估基准。每个代理仅接收一个问题和工作空间,并返回所请求的完整表格结果。我们使用DataSpace-Builder构建DataSpace,这是一个以执行为基础的框架,包括跨语言转换、约束感知的关系采样、模态路由与工件渲染,以及11位领域专家进行的人工审查和任务修复。一个确定性评估器执行不依赖于表头的列对齐、类型与精度感知的规范化,以及顺序感知的行比较。在六个最新发布的前沿多模态模型和五个广泛使用的代理框架中,最佳准确率达到66.34%,而在固定主干模型的情况下,更换框架会造成15.36个百分点的差异。多模态证据整合和连接操作在所有六个主干模型上一致地降低了准确率。这些结果表明DataSpace尚未饱和,并指出了提高数据代理可靠性的关键挑战。††copyright:none

1.引言

参考图1说明。DataSpace任务界面,以一个基金风险任务为例。代理结合来自视频的预警规则、从长PDF中提取的类别基准,以及从SQLite查询的每日净值,然后对齐实体,计算所请求的指标,并返回完整的表格结果。

数据代理正在成为组织数据的自然语言接口(Wang and Li,2025 (https://arxiv.org/html/2608.03451#bib.bib53); Sun et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib54); Zhang et al.,2025b (https://arxiv.org/html/2608.03451#bib.bib51),a (https://arxiv.org/html/2608.03451#bib.bib52); Teable,2026 (https://arxiv.org/html/2608.03451#bib.bib50); Li et al.,2026b (https://arxiv.org/html/2608.03451#bib.bib55); Zhu et al.,2025b (https://arxiv.org/html/2608.03451#bib.bib5); Shuai et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib6); Luo et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib1); Xie et al.,2024 (https://arxiv.org/html/2608.03451#bib.bib57); Tang et al.,2026b (https://arxiv.org/html/2608.03451#bib.bib61))。然而,在现实的分析场景中,回答用户问题所需的信息很少位于单个干净的表格或预选的数据库中(Wang et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib34); Qi et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib33); Egg et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib30))。

表1.代表性基准在工件覆盖范围、工作空间要求和答案/评估语义方面的比较。

类型基准#任务输入工件工作空间要求输出与评估
结构化WikiTableQuestions (Pasupat and Liang,2015 (https://arxiv.org/html/2608.03451#bib.bib17))22,033–✓––––––––✓–
Spider (Yu et al.,2018 (https://arxiv.org/html/2608.03451#bib.bib16))10,181✓––––––––✓✓–
BIRD (Li et al.,2023 (https://arxiv.org/html/2608.03451#bib.bib18))12,751✓––––––––✓✓–
Spider 2.0 (Lei et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib22))632✓–✓–✓✓–––✓✓–
非结构化HotpotQA (Yang et al.,2018 (https://arxiv.org/html/2608.03451#bib.bib23))113K––✓–✓✓––––✓–
CRAG (Yang et al.,2024 (https://arxiv.org/html/2608.03451#bib.bib24))4,409––✓–✓✓––––––
MMLongBench-Doc (Ma et al.,2024b (https://arxiv.org/html/2608.03451#bib.bib28))1,062––✓–––✓–––✓–
数据代理DABStep (Egg et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib30))450+–✓✓–✓✓––––✓–
KramaBench (Lai et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib31))104–✓✓–✓✓––––––
LongDA (Li et al.,2026c (https://arxiv.org/html/2608.03451#bib.bib32))505–✓✓–✓✓✓–––✓–
DataCross (Qi et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib33))200✓✓✓–✓✓–✓––––
FDABench (Wang et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib34))2,007✓✓✓✓✓✓––––––
本工作DataSpace410✓✓✓✓✓✓✓✓✓✓✓✓

注释。输入/工作空间的勾选表示明确覆盖;输出/评估的勾选表示基准范围内的要求。文件:独立的结构化/半结构化工件;文档:文本/视觉文档;媒体:音频/视频。跨工件:多工件/系统集成;发现:来源未预选;长文档:明确的较长文档处理;文档→记录:文档字段/记录输入下游分析;跨语言:问题-工作空间联合输入。完整表格:正确性要求完整的结果表,直接提交或通过查询执行获得;无模型:无LLM评判器;模式不变:尽管表头措辞或顺序不同,列仍能对齐。

问题及其证据可能跨越语言和表示形式,涵盖关系数据库、结构化与半结构化文件、商业文档和多媒体工件,同时夹杂有效但不相关的文件。因此,一个有效的数据代理充当工作空间求解器:它检查可用数据,选择来源和工具,跨表示形式对齐信息,执行多步骤计算,并返回用户可以直接使用的结果。现有基准捕捉了这一场景的互补部分。结构化数据基准,从Spider(Yu et al.,2018 (https://arxiv.org/html/2608.03451#bib.bib16))到Spider 2.0(Lei et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib22)),提供了具有确定性评估的关系推理强测试,但通常提前识别相关表或数据库。非结构化数据基准,如MMLongBench-Doc(Ma et al.,2024b (https://arxiv.org/html/2608.03451#bib.bib28)),引入了长且视觉丰富的输入,但主要关注证据检索、基础事实(grounding)和答案综合。数据代理基准更接近开放式分析工作空间:KramaBench(Lai et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib31))研究数据湖上的数据到洞察流水线,而FDABench(Wang et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib34))将分析扩展到结构化数据、文档和媒体。如表1 (https://arxiv.org/html/2608.03451#S1.T1)所总结,这些进展尚未统一现实数据分析中三个核心属性:(L1) 工作空间范围:一个任务局部的工作空间,涵盖结构化文件、数据库、长文档和多媒体工件,且问题和数据均存在语言差异;(L2) 输出契约:一个一致的目标,要求完整的分析结果,而非事实型答案、流水线或开放式报告;(L3) 评估语义:确定性评估,接受等价表示,同时拒绝不完整或错误的答案。因此,我们引入了DataSpace1 (https://arxiv.org/html/2608.03451#S1.FN1)(脚注:1),这是一个针对自包含异构工作空间上可验证数据分析的基准(图1 (https://arxiv.org/html/2608.03451#S1.F1))。代理仅接收一个自然语言问题和一个任务局部工作空间,自主发现并组合可用数据,并返回所请求的完整表格结果。DataSpace包含410个跨语言任务和7,439个工件,总计约15 GB。中文和英文可能同时出现在用户问题及其工作空间工件中。工作空间涵盖CSV、JSON、SQLite、Markdown、PDF和视频,每个任务都配有一个完整的表格参考答案。DataSpace还作为KDD Cup 2026复杂数据分析数据代理竞赛的官方评估基准(KDD Cup 2026,2026 (https://arxiv.org/html/2608.03451#bib.bib21))。为了可靠地构建这种跨语言、异构工作空间,我们提出了DataSpace-Builder,一个以执行为基础的框架,将来自EHRSQL(Lee et al.,2023 (https://arxiv.org/html/2608.03451#bib.bib19))和BULL(Zhang et al.,2024 (https://arxiv.org/html/2608.03451#bib.bib20))的实例进行转换,这两个基准是覆盖临床和金融分析的英文Text-to-SQL基准。它们的关系数据库提供领域数据,而可执行的SQL提供可解析的分析逻辑和基于执行的验证。DataSpace-Builder包含四个阶段:跨语言转换约束感知的关系采样模态路由与工件渲染,以及人工审查与任务修复。这些阶段共同将源问题、数据库和查询逻辑转换为跨语言的异构工作空间任务,并通过执行推导出其参考答案。最终的问题、工作空间、参考答案和评估语义由11位领域专家组成的小组交叉审查,有争议的案例在发布前进行讨论和修复。我们还设计了一个确定性评估器,无论表头措辞或位置如何都能对齐列,标准化等价的值格式,并根据任务中行的顺序是否重要来进行行比较。贡献。我们的贡献是:

  • •一个异构工作空间基准。我们引入了DataSpace,包含410个跨语言任务和六种模态,并具有统一的、可精确验证的表格输出目标。
  • •一个以执行为基础的构建框架。我们开发了DataSpace-Builder,它将可执行的Text-to-SQL资源转换为任务局部的异构工作空间,并经过专家审查和修复。
  • •一个语义感知的评估器。我们提供对完整表格结果的确定性评估,容忍等价表示,同时拒绝不完整或错误的输出。
  • •一项对数据代理的实证研究。我们在六个前沿多模态模型和五个代理框架上建立了基线;最佳达到66.34%的准确率,框架选择产生15.36个百分点的差异,多模态证据和连接操作一致地降低性能。

2.相关工作

结构化数据基准。对结构化数据的自然语言分析通过表格问答和Text-to-SQL进行研究(Li et al.,2024 (https://arxiv.org/html/2608.03451#bib.bib9),2025b (https://arxiv.org/html/2608.03451#bib.bib10),2025a (https://arxiv.org/html/2608.03451#bib.bib11),2026a (https://arxiv.org/html/2608.03451#bib.bib12); Pei et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib13); Zhu et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib14); Ma et al.,2024a (https://arxiv.org/html/2608.03451#bib.bib15); Liu et al.,2025a (https://arxiv.org/html/2608.03451#bib.bib3),b (https://arxiv.org/html/2608.03451#bib.bib4); Zhu et al.,2025a (https://arxiv.org/html/2608.03451#bib.bib2))。表格QA基准如WikiTableQuestions(Pasupat and Liang,2015 (https://arxiv.org/html/2608.03451#bib.bib17))预测半结构化表格上的指称(denotations)。Spider(Yu et al.,2018 (https://arxiv.org/html/2608.03451#bib.bib16))和BIRD(Li et al.,2023 (https://arxiv.org/html/2608.03451#bib.bib18))覆盖跨领域和大规模数据库,而EHRSQL(Lee et al.,2023 (https://arxiv.org/html/2608.03451#bib.bib19))和BULL(Zhang et al.,2024 (https://arxiv.org/html/2608.03451#bib.bib20))捕捉临床和金融分析。Spider 2.0(Lei et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib22))进一步在SQL工作流中引入企业工件。可执行查询支持确定性的结果级评估,但这些设置对跨独立文件、文档和媒体的证据发现与协调的覆盖有限。

非结构化数据基准。HotpotQA(Yang et al.,2018 (https://arxiv.org/html/2608.03451#bib.bib23))和CRAG(Yang et al.,2024 (https://arxiv.org/html/2608.03451#bib.bib24))测试多跳或检索增强语料库上的检索和综合,而FinanceBench(Islam et al.,2023 (https://arxiv.org/html/2608.03451#bib.bib25))和MMLongBench-Doc(Ma et al.,2024b (https://arxiv.org/html/2608.03451#bib.bib28); Liang et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib7))针对财务报告和长且视觉丰富的文档。HybridQA(Chen et al.,2020 (https://arxiv.org/html/2608.03451#bib.bib26))、MultiModalQA(Talmore et al.,2021 (https://arxiv.org/html/2608.03451#bib.bib27))和Video-MME(Fu et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib29))增加了链接表、段落、图像或视频。这些设置提供了对证据定位、跨页推理和感知的强测试,但通常针对事实型答案、短列表、选择题或自由形式的回答。它们很少要求从长文档中恢复类型化的记录集合,并将其与其他工作空间数据结合,以生成完整的表格结果。

数据代理基准。DABStep(Egg et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib30))、KramaBench(Lai et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib31))和LongDA(Li et al.,2026c (https://arxiv.org/html/2608.03451#bib.bib32); Bian et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib62))覆盖多步骤处理、数据湖发现和长文档导航。数据代理基准(Ma et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib35))和AgenticDataBench(Sun et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib36))强调多系统查询或反复出现的数据科学技能,而DataCross(Qi et al.,2026 (https://arxiv.org/html/2608.03451#bib.bib33))和FDABench(Wang et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib34); Chen et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib60); Zhang et al.,2025c (https://arxiv.org/html/2608.03451#bib.bib8))融入了视觉表格和媒体。这一系列与我们的设置最为接近,但其目标从事实型答案、可执行流水线到选择题和报告不等,并伴随基于执行、评分标准或模型的评估(Xie et al.,2025 (https://arxiv.org/html/2608.03451#bib.bib58); Tang et al.,2026a (https://arxiv.org/html/2608.03451#bib.bib59))。而DataSpace则将任务

相似文章

最好的智能代理工具会这样做……

Reddit r/AI_Agents

作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。