CODA-BENCH: 代码智能体能处理数据密集型任务吗?
摘要
CODA-BENCH 是一个新的基准测试,用于评估代码智能体在数据密集型任务上的表现,弥合了以代码为中心和以数据为中心的评估之间的差距。它包含来自31个社区的超过1000个任务,具有真实的数据规模和噪声,结果显示即使是最顶尖的智能体也仅能达到61.1%的成功率。
查看缓存全文
缓存时间: 2026/06/16 11:34
论文页面 - CODA-BENCH:代码智能体能否处理数据密集型任务?
来源:https://huggingface.co/papers/2606.15300
摘要
高级智能体难以在数据密集型环境中有效整合数据发现与代码执行,暴露出当前智能体能力存在显著差距。
高级智能体正日益展现出作为自主工程师的潜力,由此催生了对能够捕捉真实开发复杂性的评估基准的需求。此类环境通常同时涉及复杂代码和大规模数据(即文件系统)。然而,现有基准通常孤立评估代码中心或数据中心的(https://huggingface.co/papers?q=data-centric%20capabilities)能力,与真实开发场景之间存在明显差距。本文通过引入CODA-BENCH来弥合这一差距——这是首个在数据密集型环境(https://huggingface.co/papers?q=data-intensive%20environment)中联合评估代码与数据智能的基准。我们基于Kaggle生态系统(包含数百个数据集)构建了一个数据密集型Linux沙盒,其中智能体必须主动探索复杂的文件层级以识别相关资源,并为数据驱动的分析任务生成代码。CODA-BENCH包含覆盖31个社区的1,009项任务,每个任务环境平均包含980个文件,模拟了真实的数据规模与噪声。对高级智能体的评估表明,即使是表现最佳的系统也难以有效整合数据发现(https://huggingface.co/papers?q=data%20discovery)与代码执行(https://huggingface.co/papers?q=code%20execution),成功率仅为61.1%。这些结果凸显了当前智能体在数据密集型任务中的能力差距,并为未来研究指明了有前景的方向。
查看 arXiv 页面 (https://arxiv.org/abs/2606.15300)查看 PDF (https://arxiv.org/pdf/2606.15300)项目页面 (https://coda-bench.github.io/)GitHub3 (https://github.com/ruc-datalab/CoDA-Bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.15300)
在您的智能体中获取此论文:
hf papers read 2606\.15300
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.15300 即可从此页面链接。
引用此论文的数据集1
RUC-DataLab/CoDA-Bench 查看器• 更新于约8小时前 • 1.13k • 123 • 1 (https://huggingface.co/datasets/RUC-DataLab/CoDA-Bench)
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.15300 即可从此页面链接。
包含此论文的收藏2
相似文章
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
Tencent WorkBuddy Bench: 一个跨领域编码智能体基准测试,具有抗污染任务构建
本文介绍了腾讯WorkBuddy Bench,一个面向编码智能体的多领域评估套件,通过从真实提交和业务场景逆向工程任务来抵抗数据污染,涵盖代码、Web、办公和安全领域。
EvoCode-Bench:在多轮迭代交互中评估编码代理
介绍了EvoCode-Bench,这是一个包含26个有状态编码任务、共227轮评估的基准,用于评估多轮迭代交互中的编码代理,结果表明单轮性能高估了多轮能力22-40分。
CODS 2025 AssetOpsBench 挑战赛结果及回顾性分析
本文对 CODS 2025 AssetOpsBench 挑战赛进行了回顾性分析,评估了多智能体 AI 系统在工业任务中的表现。文章揭示了公开排行榜与隐藏排行榜之间的差异,并为未来的智能体基准测试提供了诊断建议。
AI编程代理可复现社会科学发现
本文介绍了SocSci-Repro-Bench,这是一个包含221个任务的基准测试,用于评估AI编程代理从原始数据和代码中复现社会科学发现的能力。研究发现,像Claude Code和Codex这样的前沿代理可以复现大部分结果,其中Claude明显优于Codex,并且结果并非主要由记忆驱动。