WideSWE: 编码代理能否协调跨仓库的更改?
摘要
论文介绍了WideSWE,这是一个用于评估编码代理在跨仓库任务上的基准,基于120个真实世界任务,表明代理的成功率各异,联合执行可以提升性能。
查看缓存全文
缓存时间: 2026/09/29 08:13
论文页面 - WideSWE:编程代理能否协调跨仓库的变更?
来源:https://huggingface.co/papers/2609.33382
摘要
编程代理的评估已从解决单个问题发展到执行长周期开发任务,但任务完成度评估仍主要局限于单一代码库。在软件生态系统中,许多功能和错误修复需要跨多个仓库进行协调变更。我们提出了WideSWE来评估编程代理在跨仓库任务中的表现。通过挖掘和审查103个软件生态系统的变更,我们获得了120个真实世界任务,其中60个错误修复和60个功能实现各占一半。我们从相关议题和拉取请求中提取提示。我们系统地审查和调整了隐藏测试,以支持多样化的正确实现,同时保留所需的行为和回归检查。在七种代理配置中,完整任务的成功率从10.83%到42.50%不等,其中将CodexCLI与GPT-5.6-sol配对的配置取得了最高成功率。执行轨迹显示,代理未能识别必要变更、识别变更但未完成、或修改了所需仓库但未完全满足请求。为检验一次处理一个仓库是否能缓解这些困难,我们在相同提示下将其与联合执行进行了比较。独立执行主要恢复了遗漏的工作,对于纠正之前尝试但未成功的实现效果较差。联合执行可以利用相关仓库的信息来指导实现和验证。代码可在https://github.com/ZJU-ACES-ISE/WideSWE获取。
查看arXiv页面 (https://arxiv.org/abs/2609.33382) 查看PDF (https://arxiv.org/pdf/2609.33382) 项目页面 (https://zju-aces-ise.github.io/WideSWE/) GitHub8 (https://github.com/ZJU-ACES-ISE/WideSWE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.33382)
在你的代理中获取这篇论文:
hf papers read 2609.33382
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接到这篇论文
在模型的README.md中引用arxiv.org/abs/2609.33382,以从本页面链接它。
引用本文的数据集1
wangbaoyi/WideSWE 约2小时前更新 • 2 (https://huggingface.co/datasets/wangbaoyi/WideSWE)
引用本文的空间0
没有空间链接到这篇论文
在空间的README.md中引用arxiv.org/abs/2609.33382,以从本页面链接它。
包含本文的收藏0
没有收藏包含这篇论文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
SWE-Explore:编码代理仓库探索能力基准测试
SWE-Explore 引入了一个基准测试,用于评估编码代理的仓库探索能力,要求在行预算内返回相关代码区域的排序列表。实验表明,基于代理的探索优于传统检索,而行级覆盖仍然是关键区分因素。
SWE Refactor Bench: 编码代理能否完成长周期、全代码库的技术栈迁移?
本文介绍了SWE Refactor Bench,这是一个用于评估编码代理进行全代码库软件迁移的基准,揭示了当前模型很少能正确完成此类迁移。
SWE-bench Science:编码代理能否解决科学工程任务?
SWE-bench Science 引入了一个仓库级基准,用于评估编码代理在科学软件修复任务中的表现,揭示了失败机制和科学指导的混合效应。
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
SWE-Touch:当用户修改代码时对编码智能体的基准测试
介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。