DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
摘要
本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。
查看缓存全文
缓存时间: 2026/08/12 08:20
论文页面 - DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
Source: https://huggingface.co/papers/2608.10366
摘要
DSAgentBench 在真实计算环境中评估自主智能体在完整、多工具数据科学工作流上的表现,并揭示了重大的性能差距。
现实世界的数据科学涉及长周期工作流,涵盖数据整理、探索、建模、可视化和验证,并需要在真实操作系统环境中协调使用笔记本、IDE、终端、浏览器和数据库等工具。然而,现有基准缺乏真实计算机交互,无法评估智能体能否在现实计算环境中执行完整的端到端数据科学工作流(https://huggingface.co/papers?q=data-science%20workflows),因此未能捕捉数据科学实践中多阶段、多工具的特性。我们提出了 DSAgentBench(https://huggingface.co/papers?q=DSAgentBench),这是首个评估智能体能否在真实计算机环境内自动化完整数据科学工作流的基准。DSAgentBench(https://huggingface.co/papers?q=DSAgentBench)包含275个多样化任务,覆盖数据科学的整个生命周期,反映了实际工作中所需的复杂性和工具协调能力。每个任务都要求以中间输出和协调工具使用为基础做出决策,并包含一个确定性评估器(https://huggingface.co/papers?q=deterministic%20evaluator),用于验证分析正确性、可视化输出和模型性能,而不仅仅是代码执行。我们使用15个闭源和开源模型进行了大量实验,结果表明,即使是最强的智能体 Claude-4.6-Sonnet,任务成功率也仅为56.70%,而所有开源智能体的成功率均低于1%,它们经常在工具编排、操作系统环境感知和多步推理上失败。这些结果揭示了当前智能体系统(https://huggingface.co/papers?q=agentic%20systems)与真实数据科学工作流(https://huggingface.co/papers?q=data-science%20workflows)之间的巨大能力差距,使 DSAgentBench(https://huggingface.co/papers?q=DSAgentBench)成为开发基于真实环境、可验证、自主的数据科学智能体的基础。我们在 https://github.com/vis-nlp/DSAgentBench(https://huggingface.co/papers?q=DSAgentBench)发布了 DSAgentBench。
查看 arXiv 页面 (https://arxiv.org/abs/2608.10366) 查看 PDF (https://arxiv.org/pdf/2608.10366) GitHub2 (https://github.com/vis-nlp/DSAgentBench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.10366)
在您的智能体中获取此论文:
hf papers read 2608\.10366
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2608.10366 即可从本页面链接该模型。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.10366 即可从本页面链接该数据集。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.10366 即可从本页面链接该 Space。
收录此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接它。
相似文章
SaaS-Bench:计算机使用代理能否利用真实世界的SaaS解决专业工作流程?
SaaS-Bench是一个新的基准测试,基于23个可部署的SaaS系统,覆盖六个专业领域,包含106个长周期任务,用于评估计算机使用代理。实验表明,即使是最强的模型,端到端完成任务的比例也不足4%,凸显了当前代理能力的显著限制。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
DataSpace:异构工作空间上可验证分析的数据代理基准
介绍了DataSpace,一个用于在异构工作空间上评估数据代理可验证表格分析能力的基准测试,包含410个跨语言任务和7,439个工件。当前前沿模型仅达到66.34%的准确率,表明仍有提升空间。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。