Argo-Bench:在企业级工作流中评估数据智能体

Hugging Face Daily Papers 论文

摘要

Argo-Bench 提出了一个包含 210 项企业级数据科学任务的评测框架,构建于一个模拟外卖平台之上,该平台拥有一个包含 235 张表、75 亿行数据的 ERP 数据仓库。该框架测试的智能体需要在数据中进行导航并采取行动,而非仅仅生成 SQL。在 14 个前沿模型和开源权重模型中,表现最强的模型平均得分也仅为 59.5 分,凸显了数据智能体在真实场景下能力上的显著差距。

现实世界中的企业数据科学与分析工作流需要跨数十张表进行推理、执行统计分析,并根据结果采取行动。现有的文本转 SQL 基准仅评估查询生成能力,且已有审计发现其答案集常常存在错误。由于真实的企业数据仓库过于敏感而无法公开,这些基准通常基于公开数据集构建,其中业务事件只需一张表即可容纳。 我们提出 Argo-Bench,一个包含 210 项数据科学与分析任务的评测框架。基于公开数据、经同行评审的行业文献以及监管文件,我们以真实规模模拟了纽约市的一个外卖配送平台:2024 年 8100 万笔订单、具有真实依据的经济模型、欺诈模式和平台激励机制。我们将这个世界导出为一个由 235 张表、75 亿行数据构成的 ERP 数据仓库,其架构参照 Oracle E-Business Suite 设计。模拟器的真实状态对智能体所见的仓库是隐藏的,因此任务要求智能体先通过在仓库中导航来重建事实,然后再据此采取行动。 Argo-Bench 超越了文本转 SQL 的范畴:智能体会提交具体操作,例如封禁欺诈账户、分配骑手激励预算或补发欠薪,评分器则根据这些操作在模拟器中产生的后果进行打分。每个任务都附带一个可执行的参考解法,证明仅凭仓库数据即可解题。在 14 个前沿模型和开源权重模型中,表现最强的模型也仅在 34.8% 的任务上得分达到 95 分以上,平均分为 59.5 分。我们希望 Argo-Bench 能够推动智能体在真实数据环境中理解数据、导航数据并采取行动的能力不断进步。
查看原文
查看缓存全文

缓存时间: 2026/10/02 08:28

论文页面 - Argo-Bench:面向企业级工作流的数据智能体评测

来源:https://huggingface.co/papers/2610.02122

摘要

现实中的企业数据科学与分析工作流需要跨几十张表进行推理,执行统计分析,并据此采取行动。现有的 text-to-SQL 基准仅评测查询生成能力,且有审计发现其答案集经常存在错误。由于真实的企业数据仓库过于敏感而无法公开,这些基准都是基于公共数据集构建的——在这些数据集中,一个业务事件仅包含在单张表内。我们提出 Argo-Bench,一个包含 210 项数据科学与分析任务的评测框架。我们借助公开数据、经过同行评审的行业文献和监管申报文件,以真实规模模拟了一个纽约市的外卖配送平台:2024 年订单量达 8100 万单,其中的经济机制、欺诈模式和平台激励都经过合理建模。我们将这个世界导出为一个 ERP 数据仓库,包含 235 张表、75 亿行数据,其模式参照 Oracle E-Business Suite 设计。模拟器的真实状态对智能体所见的仓库是不可见的,因此任务要求智能体先在仓库中导航、重建事实,然后基于这些事实采取行动。Argo-Bench 超越了 text-to-SQL 范畴:智能体会执行诸如封禁欺诈账户、分配骑手激励预算、追发欠薪等操作,而评分器会根据这些操作在模拟器中产生的后果为智能体打分。每个任务都附带一个可执行的参考解决方案,证明仅凭仓库数据即可完成求解。在 14 个前沿模型和开放权重模型中,最强的模型仅在 34.8% 的任务上得分达到 95 分或以上,平均得分为 59.5 分。我们希望 Argo-Bench 能推动智能体技术的发展,使其能够理解、导航并在真实数据环境中采取行动。

查看 arXiv 页面 (https://arxiv.org/abs/2610.02122) 查看 PDF (https://arxiv.org/pdf/2610.02122) 项目主页 (https://argo-bench.com/) GitHub2 (https://github.com/TextQLLabs/Argo-Bench) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2610.02122)

引用本文的模型 0

暂无链接本文的模型。

在模型的 README.md 中引用 arxiv.org/abs/2610.02122,即可从本页链接至该模型。

引用本文的数据集 2

textql/Argo-Bench • 约 6 小时前更新 • 3.91B • 318 • 2 (https://huggingface.co/datasets/textql/Argo-Bench)

textql/Decision-Bench • 约 4 小时前更新 • 6.77B (https://huggingface.co/datasets/textql/Decision-Bench)

引用本文的 Space 0

暂无链接本文的 Space。

在 Space 的 README.md 中引用 arxiv.org/abs/2610.02122,即可从本页链接至该 Space。

包含本文的合集 0

暂无包含本文的合集。

将本文加入合集 (https://huggingface.co/new-collection),即可从本页链接至该合集。

相似文章

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。