CODA-BENCH: 代码智能体能处理数据密集型任务吗?

Hugging Face Daily Papers 论文

摘要

CODA-BENCH 是一个新的基准测试,用于评估代码智能体在数据密集型任务上的表现,弥合了以代码为中心和以数据为中心的评估之间的差距。它包含来自31个社区的超过1000个任务,具有真实的数据规模和噪声,结果显示即使是最顶尖的智能体也仅能达到61.1%的成功率。

先进的智能体正日益展现出作为自主工程师的潜力,这导致了对能够捕捉真实世界开发复杂性的评估基准的需求不断增长。这类环境通常同时涉及复杂代码和大规模数据(即文件系统)。然而,现有基准通常孤立地评估以代码为中心或以数据为中心的能力,与真实开发场景之间存在明显差距。在本文中,我们通过引入 CODA-BENCH 来弥合这一差距,这是首个在数据密集型环境中联合评估代码与数据智能的基准。我们基于 Kaggle 生态系统(包含数百个数据集)构建了一个数据密集型的 Linux 沙箱,智能体必须主动探索复杂的文件层次结构以识别相关资源,并为数据驱动的分析任务生成代码。CODA-BENCH 包含来自31个社区的1009个任务,每个任务环境平均包含980个文件,模拟了真实的数据规模和噪声。对先进智能体的评估显示,即使是最优系统也难以有效整合数据发现与代码执行,成功率仅为61.1%。这些结果凸显了当前智能体在数据密集型任务上的能力存在显著差距,并指出了未来研究的有希望的方向。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:34

论文页面 - CODA-BENCH:代码智能体能否处理数据密集型任务?

来源:https://huggingface.co/papers/2606.15300

摘要

高级智能体难以在数据密集型环境中有效整合数据发现与代码执行,暴露出当前智能体能力存在显著差距。

高级智能体正日益展现出作为自主工程师的潜力,由此催生了对能够捕捉真实开发复杂性的评估基准的需求。此类环境通常同时涉及复杂代码和大规模数据(即文件系统)。然而,现有基准通常孤立评估代码中心或数据中心的(https://huggingface.co/papers?q=data-centric%20capabilities)能力,与真实开发场景之间存在明显差距。本文通过引入CODA-BENCH来弥合这一差距——这是首个在数据密集型环境(https://huggingface.co/papers?q=data-intensive%20environment)中联合评估代码与数据智能的基准。我们基于Kaggle生态系统(包含数百个数据集)构建了一个数据密集型Linux沙盒,其中智能体必须主动探索复杂的文件层级以识别相关资源,并为数据驱动的分析任务生成代码。CODA-BENCH包含覆盖31个社区的1,009项任务,每个任务环境平均包含980个文件,模拟了真实的数据规模与噪声。对高级智能体的评估表明,即使是表现最佳的系统也难以有效整合数据发现(https://huggingface.co/papers?q=data%20discovery)与代码执行(https://huggingface.co/papers?q=code%20execution),成功率仅为61.1%。这些结果凸显了当前智能体在数据密集型任务中的能力差距,并为未来研究指明了有前景的方向。

查看 arXiv 页面 (https://arxiv.org/abs/2606.15300)查看 PDF (https://arxiv.org/pdf/2606.15300)项目页面 (https://coda-bench.github.io/)GitHub3 (https://github.com/ruc-datalab/CoDA-Bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.15300)

在您的智能体中获取此论文:

hf papers read 2606\.15300

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.15300 即可从此页面链接。

引用此论文的数据集1

RUC-DataLab/CoDA-Bench 查看器• 更新于约8小时前 • 1.13k • 123 • 1 (https://huggingface.co/datasets/RUC-DataLab/CoDA-Bench)

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.15300 即可从此页面链接。

包含此论文的收藏2

相似文章

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。

CODS 2025 AssetOpsBench 挑战赛结果及回顾性分析

arXiv cs.AI

本文对 CODS 2025 AssetOpsBench 挑战赛进行了回顾性分析,评估了多智能体 AI 系统在工业任务中的表现。文章揭示了公开排行榜与隐藏排行榜之间的差异,并为未来的智能体基准测试提供了诊断建议。

AI编程代理可复现社会科学发现

arXiv cs.CL

本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。