Argo-Bench:在企业级工作流中评估数据智能体
摘要
Argo-Bench 提出了一个包含 210 项企业级数据科学任务的评测框架,构建于一个模拟外卖平台之上,该平台拥有一个包含 235 张表、75 亿行数据的 ERP 数据仓库。该框架测试的智能体需要在数据中进行导航并采取行动,而非仅仅生成 SQL。在 14 个前沿模型和开源权重模型中,表现最强的模型平均得分也仅为 59.5 分,凸显了数据智能体在真实场景下能力上的显著差距。
查看缓存全文
缓存时间: 2026/10/02 08:28
论文页面 - Argo-Bench:面向企业级工作流的数据智能体评测
来源:https://huggingface.co/papers/2610.02122
摘要
现实中的企业数据科学与分析工作流需要跨几十张表进行推理,执行统计分析,并据此采取行动。现有的 text-to-SQL 基准仅评测查询生成能力,且有审计发现其答案集经常存在错误。由于真实的企业数据仓库过于敏感而无法公开,这些基准都是基于公共数据集构建的——在这些数据集中,一个业务事件仅包含在单张表内。我们提出 Argo-Bench,一个包含 210 项数据科学与分析任务的评测框架。我们借助公开数据、经过同行评审的行业文献和监管申报文件,以真实规模模拟了一个纽约市的外卖配送平台:2024 年订单量达 8100 万单,其中的经济机制、欺诈模式和平台激励都经过合理建模。我们将这个世界导出为一个 ERP 数据仓库,包含 235 张表、75 亿行数据,其模式参照 Oracle E-Business Suite 设计。模拟器的真实状态对智能体所见的仓库是不可见的,因此任务要求智能体先在仓库中导航、重建事实,然后基于这些事实采取行动。Argo-Bench 超越了 text-to-SQL 范畴:智能体会执行诸如封禁欺诈账户、分配骑手激励预算、追发欠薪等操作,而评分器会根据这些操作在模拟器中产生的后果为智能体打分。每个任务都附带一个可执行的参考解决方案,证明仅凭仓库数据即可完成求解。在 14 个前沿模型和开放权重模型中,最强的模型仅在 34.8% 的任务上得分达到 95 分或以上,平均得分为 59.5 分。我们希望 Argo-Bench 能推动智能体技术的发展,使其能够理解、导航并在真实数据环境中采取行动。
查看 arXiv 页面 (https://arxiv.org/abs/2610.02122) 查看 PDF (https://arxiv.org/pdf/2610.02122) 项目主页 (https://argo-bench.com/) GitHub2 (https://github.com/TextQLLabs/Argo-Bench) 加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2610.02122)
引用本文的模型 0
暂无链接本文的模型。
在模型的 README.md 中引用 arxiv.org/abs/2610.02122,即可从本页链接至该模型。
引用本文的数据集 2
textql/Argo-Bench • 约 6 小时前更新 • 3.91B • 318 • 2 (https://huggingface.co/datasets/textql/Argo-Bench)
textql/Decision-Bench • 约 4 小时前更新 • 6.77B (https://huggingface.co/datasets/textql/Decision-Bench)
引用本文的 Space 0
暂无链接本文的 Space。
在 Space 的 README.md 中引用 arxiv.org/abs/2610.02122,即可从本页链接至该 Space。
包含本文的合集 0
暂无包含本文的合集。
将本文加入合集 (https://huggingface.co/new-collection),即可从本页链接至该合集。
相似文章
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。
EnterpriseClawBench:基于真实工作会话的智能体基准测试
EnterpriseClawBench 提出了一个基于真实工作场景的企业智能体基准,包含 852 个可复现任务以及超越单一性能分数的综合评估指标。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
DataSpace:异构工作空间上可验证分析的数据代理基准
介绍了DataSpace,一个用于在异构工作空间上评估数据代理可验证表格分析能力的基准测试,包含410个跨语言任务和7,439个工件。当前前沿模型仅达到66.34%的准确率,表明仍有提升空间。
StartupBench: 基准测试:针对市场验证的端到端工作流程的通用代理
StartupBench 引入了一个基准,用于评估通用AI代理在真实世界创业工作流程中的表现,揭示顶级模型仅能完成约30%的任务,原因在于复杂指令遵循和领域特定专业知识方面的不足。