Tencent WorkBuddy Bench: 一个跨领域编码智能体基准测试,具有抗污染任务构建
摘要
本文介绍了腾讯WorkBuddy Bench,一个面向编码智能体的多领域评估套件,通过从真实提交和业务场景逆向工程任务来抵抗数据污染,涵盖代码、Web、办公和安全领域。
查看缓存全文
缓存时间: 2026/07/24 05:06
论文页面 - 腾讯WorkBuddy Bench:一个多领域编码代理基准测试,采用抗污染任务构建
来源:https://huggingface.co/papers/2607.20911 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们推出了腾讯WorkBuddy Bench,这是一个面向编码代理的多领域评估套件;本报告记录了其构建方法、评分协议以及跨模型排行榜。其核心是一个统一的评估框架,用于构建和运行分布感知的编码代理任务,涵盖四个工作领域——代码、Web、办公和安全。该套件不采用公开的问题文本,而是通过逆向工程从真实的提交、拉取请求或业务场景中提取每一项任务,并将其重写为简短的、口语化的、角色扮演式的请求,使得任务的提示无法通过搜索底层问题、拉取请求或评论线索的网页来复原。由于数据集是公开发布的——包括任务目录、环境镜像、评估工具、测试和参考解——其抗污染能力依赖于这种构建方式以及数据集版本管理,而非保密性。四个子集——仓库级工程、前端开发、办公与业务工作流,以及红/蓝队安全——分别对应实际工作的不同侧面,各有其独特的验证风格。所有子集都打包成统一的任务目录格式,并按照统一且可复现的协议,在两个代理框架(CodeBuddy Code和Claude Code)上运行;完整的公开发布使该基准测试端到端可复现且可直接审计,因为任何第三方都可以重新运行每个任务并检查其内容。由于每个子集使用不同的评分工具,各子集之间的分数不可比较,因此该套件不报告全套件平均分。我们报告了跨多个模型家族的跨模型排行榜。
查看arXiv页面(https://arxiv.org/abs/2607.20911)查看PDF(https://arxiv.org/pdf/2607.20911)项目页面(https://workbuddybench.com/index.html)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.20911)
在你的代理中获取这篇论文:
hf papers read 2607.20911
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型与本论文关联
在模型README.md中引用arxiv.org/abs/2607.20911,以便将其链接到此页面。
引用此论文的数据集0
无数据集与本论文关联
在数据集README.md中引用arxiv.org/abs/2607.20911,以便将其链接到此页面。
引用此论文的Space0
无Space与本论文关联
在Space README.md中引用arxiv.org/abs/2607.20911,以便将其链接到此页面。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,以便将其链接到此页面。
相似文章
CODA-BENCH: 代码智能体能处理数据密集型任务吗?
CODA-BENCH 是一个新的基准测试,用于评估代码智能体在数据密集型任务上的表现,弥合了以代码为中心和以数据为中心的评估之间的差距。它包含来自31个社区的超过1000个任务,具有真实的数据规模和噪声,结果显示即使是最顶尖的智能体也仅能达到61.1%的成功率。
SWE-Bench Pro V2(阅读时间9分钟)
SWE-Bench Pro V2是一个更新的基准测试,用于在软件工程中评估AI代理,包含来自11个代码库的642个任务,具有改进的评估协议和污染控制。
SWE-bench Science:编码代理能否解决科学工程任务?
SWE-bench Science 引入了一个仓库级基准,用于评估编码代理在科学软件修复任务中的表现,揭示了失败机制和科学指导的混合效应。
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
ProgramBench(5分钟阅读)
ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。