DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

Hugging Face Daily Papers 论文

摘要

本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。

现实世界的数据科学涉及跨数据整理、探索、建模、可视化和验证的长周期工作流,并需要在真实操作系统环境中协调使用笔记本、IDE、终端、浏览器和数据库等工具。然而,现有基准缺乏真实计算机交互,无法评估智能体能否在现实计算环境中执行完整的端到端数据科学工作流,未能捕捉数据科学实践的多阶段、多工具特性。我们提出了DSAgentBench,这是首个评估智能体能否在真实计算机环境中自动化完整数据科学工作流的基准。DSAgentBench包含275个涵盖数据科学生命周期全过程的多样化任务,反映了实际工作中的复杂性和工具协调需求。每个任务都要求基于中间输出进行决策并协调使用工具,并包含一个确定性评估器,用于验证分析正确性、可视化输出和模型性能,而非仅验证代码执行。我们使用15个闭源和开源模型进行的广泛实验表明,即使最强的智能体Claude-4.6-Sonnet的任务成功率也仅为56.70%,而所有开源智能体均低于1%,经常在工具编排、操作系统定位和多步推理上失败。这些结果揭示了当前智能体系统与现实数据科学工作流之间的巨大能力差距,使DSAgentBench成为开发有根据、可验证、自主数据科学智能体的基础。我们在https://github.com/vis-nlp/DSAgentBench发布了DSAgentBench。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:20

论文页面 - DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

Source: https://huggingface.co/papers/2608.10366

摘要

DSAgentBench 在真实计算环境中评估自主智能体在完整、多工具数据科学工作流上的表现,并揭示了重大的性能差距。

现实世界的数据科学涉及长周期工作流,涵盖数据整理、探索、建模、可视化和验证,并需要在真实操作系统环境中协调使用笔记本、IDE、终端、浏览器和数据库等工具。然而,现有基准缺乏真实计算机交互,无法评估智能体能否在现实计算环境中执行完整的端到端数据科学工作流(https://huggingface.co/papers?q=data-science%20workflows),因此未能捕捉数据科学实践中多阶段、多工具的特性。我们提出了 DSAgentBench(https://huggingface.co/papers?q=DSAgentBench),这是首个评估智能体能否在真实计算机环境内自动化完整数据科学工作流的基准。DSAgentBench(https://huggingface.co/papers?q=DSAgentBench)包含275个多样化任务,覆盖数据科学的整个生命周期,反映了实际工作中所需的复杂性和工具协调能力。每个任务都要求以中间输出和协调工具使用为基础做出决策,并包含一个确定性评估器(https://huggingface.co/papers?q=deterministic%20evaluator),用于验证分析正确性、可视化输出和模型性能,而不仅仅是代码执行。我们使用15个闭源和开源模型进行了大量实验,结果表明,即使是最强的智能体 Claude-4.6-Sonnet,任务成功率也仅为56.70%,而所有开源智能体的成功率均低于1%,它们经常在工具编排、操作系统环境感知和多步推理上失败。这些结果揭示了当前智能体系统(https://huggingface.co/papers?q=agentic%20systems)与真实数据科学工作流(https://huggingface.co/papers?q=data-science%20workflows)之间的巨大能力差距,使 DSAgentBench(https://huggingface.co/papers?q=DSAgentBench)成为开发基于真实环境、可验证、自主的数据科学智能体的基础。我们在 https://github.com/vis-nlp/DSAgentBench(https://huggingface.co/papers?q=DSAgentBench)发布了 DSAgentBench。

查看 arXiv 页面 (https://arxiv.org/abs/2608.10366) 查看 PDF (https://arxiv.org/pdf/2608.10366) GitHub2 (https://github.com/vis-nlp/DSAgentBench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.10366)

在您的智能体中获取此论文:

hf papers read 2608\.10366

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2608.10366 即可从本页面链接该模型。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.10366 即可从本页面链接该数据集。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.10366 即可从本页面链接该 Space。

收录此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接它。

相似文章

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。