Tencent WorkBuddy Bench: 一个跨领域编码智能体基准测试,具有抗污染任务构建

Hugging Face Daily Papers 论文

摘要

本文介绍了腾讯WorkBuddy Bench,一个面向编码智能体的多领域评估套件,通过从真实提交和业务场景逆向工程任务来抵抗数据污染,涵盖代码、Web、办公和安全领域。

我们介绍了腾讯WorkBuddy Bench,一个面向编码智能体的多领域评估套件;本报告记录了其构建方法、评分协议和跨模型排行榜。其核心是一个统一的评估框架,用于在四个工作领域(代码、Web、办公和安全)构建和运行基于分布信息的编码智能体任务。每个任务并非改编自公开的问题文本,而是从真实的提交、拉取请求或业务场景中逆向工程而来,并改写为简短的、口语化的角色扮演请求,使得任务的提示无法通过搜索底层问题、拉取请求或提交线程来恢复。由于数据集公开发布——包括任务目录、环境镜像、评估框架、测试和参考解决方案——抗污染依赖于这种构建方式以及数据集版本管理,而非保密性。四个子集——仓库级工程、前端开发、办公和业务流程、红蓝团队安全——从不同角度探索真实工作的互补方面,每个子集都有其独特的验证风格。所有子集都以统一的任务目录格式打包,并在统一且可重现的协议下,在两个智能体框架(CodeBuddy Code和Claude Code)上运行;完整开源发布使得基准测试完全可重现且可直接审计,因为任何第三方都可以重新运行每个任务并检查其内容。由于每个子集使用不同的评分工具,子集之间的分数不可比较,该套件不报告套件级平均分。我们报告了多个模型系列的跨模型排行榜。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - 腾讯WorkBuddy Bench:一个多领域编码代理基准测试,采用抗污染任务构建

来源:https://huggingface.co/papers/2607.20911 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

我们推出了腾讯WorkBuddy Bench,这是一个面向编码代理的多领域评估套件;本报告记录了其构建方法、评分协议以及跨模型排行榜。其核心是一个统一的评估框架,用于构建和运行分布感知的编码代理任务,涵盖四个工作领域——代码、Web、办公和安全。该套件不采用公开的问题文本,而是通过逆向工程从真实的提交、拉取请求或业务场景中提取每一项任务,并将其重写为简短的、口语化的、角色扮演式的请求,使得任务的提示无法通过搜索底层问题、拉取请求或评论线索的网页来复原。由于数据集是公开发布的——包括任务目录、环境镜像、评估工具、测试和参考解——其抗污染能力依赖于这种构建方式以及数据集版本管理,而非保密性。四个子集——仓库级工程、前端开发、办公与业务工作流,以及红/蓝队安全——分别对应实际工作的不同侧面,各有其独特的验证风格。所有子集都打包成统一的任务目录格式,并按照统一且可复现的协议,在两个代理框架(CodeBuddy Code和Claude Code)上运行;完整的公开发布使该基准测试端到端可复现且可直接审计,因为任何第三方都可以重新运行每个任务并检查其内容。由于每个子集使用不同的评分工具,各子集之间的分数不可比较,因此该套件不报告全套件平均分。我们报告了跨多个模型家族的跨模型排行榜。

查看arXiv页面(https://arxiv.org/abs/2607.20911)查看PDF(https://arxiv.org/pdf/2607.20911)项目页面(https://workbuddybench.com/index.html)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.20911)

在你的代理中获取这篇论文:

hf papers read 2607.20911

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型与本论文关联

在模型README.md中引用arxiv.org/abs/2607.20911,以便将其链接到此页面。

引用此论文的数据集0

无数据集与本论文关联

在数据集README.md中引用arxiv.org/abs/2607.20911,以便将其链接到此页面。

引用此论文的Space0

无Space与本论文关联

在Space README.md中引用arxiv.org/abs/2607.20911,以便将其链接到此页面。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,以便将其链接到此页面。

相似文章

CODA-BENCH: 代码智能体能处理数据密集型任务吗?

Hugging Face Daily Papers

CODA-BENCH 是一个新的基准测试,用于评估代码智能体在数据密集型任务上的表现,弥合了以代码为中心和以数据为中心的评估之间的差距。它包含来自31个社区的超过1000个任务,具有真实的数据规模和噪声,结果显示即使是最顶尖的智能体也仅能达到61.1%的成功率。

SWE-Bench Pro V2(阅读时间9分钟)

TLDR AI

SWE-Bench Pro V2是一个更新的基准测试,用于在软件工程中评估AI代理,包含来自11个代码库的642个任务,具有改进的评估协议和污染控制。

ProgramBench(5分钟阅读)

TLDR AI

ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。