DataSpace:异构工作空间上可验证分析的数据代理基准
摘要
介绍了DataSpace,一个用于在异构工作空间上评估数据代理可验证表格分析能力的基准测试,包含410个跨语言任务和7,439个工件。当前前沿模型仅达到66.34%的准确率,表明仍有提升空间。
查看缓存全文
缓存时间: 2026/08/07 13:57
论文页面 - DataSpace:面向异构工作空间可验证分析的数据智能体基准测试
来源:https://huggingface.co/papers/2608.03451 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
数据智能体能够在组织工作空间上执行自然语言分析,而相关证据可能分散在数据库、结构化文件、长文档和多媒体中。现有基准大多将结构化查询、检索或开放式分析相互分离,导致异构证据发现、完整表格输出和确定性评估未能充分统一。我们引入了 DataSpace,这是一个基准测试,要求数据智能体从任务本地的异构工作空间中生成可验证的表格结果。它包含 410 个跨语言任务和 7,439 个工件,总计 15.01GB,涵盖 CSV、JSON、SQLite、Markdown、PDF 和视频。DataSpace 还作为 KDD Cup 2026 复杂数据分析数据智能体竞赛的官方评估基准。每个智能体仅接收一个问题和工作空间,并返回完整的所需表格结果。我们使用 DataSpace-Builder 构建了 DataSpace,这是一个基于执行的框架,包含跨语言转换、约束感知的关系采样、模态路由与工件渲染,以及由 11 位领域专家进行的人工审查和任务修复。一个确定性评估器执行头部不变的列对齐、类型和精度感知的规范化,以及顺序感知的行比较。在六种近期发布的先进多模态模型和五种广泛使用的智能体框架中,最佳准确率达到 66.34%,而在固定主干模型的情况下,框架选择造成了 15.36 个百分点的差距。多模态证据整合和连接操作在所有六种主干模型上都持续降低了准确率。这些结果表明 DataSpace 尚未饱和,并指出了提高数据智能体可靠性的关键挑战。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03451)查看 PDF (https://arxiv.org/pdf/2608.03451)项目页面 (https://dataspace-bench.github.io/)GitHub (https://github.com/HKUSTDial/DataSpace)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03451)
在你的智能体中获取这篇论文:
hf papers read 2608\.03451
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2608.03451 即可从此页面链接到它。
引用该论文的数据集 1
HKUSTDial/DataSpace 查看器 (https://huggingface.co/datasets/HKUSTDial/DataSpace)• 更新于 2 天前 • 410 • 142 • 3
引用该论文的 Space 0
没有 Space 链接到这篇论文
在 Space README.md 中引用 arxiv.org/abs/2608.03451 即可从此页面链接到它。
包含该论文的收藏 0
没有收藏包含这篇论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
TerraBench:智能体能否推理异构地球系统数据?
TerraBench 是一个新基准,用于评估人工智能智能体在异构地球系统数据(包括网格数据、卫星图像和模拟器输出)上进行推理的能力。它揭示了当前前沿模型的显著局限性,表现最佳的模型平均工具使用得分仅为 59.2%。
OR-Space:面向工业优化代理的全生命周期工作台基准
OR-Space是一个基准测试,用于评估大语言模型代理在工业运筹工作流中的表现,重点关注多阶段任务生命周期和超越简单文本生成的持久工作空间。