SWE-bench Science:编码代理能否解决科学工程任务?
摘要
SWE-bench Science 引入了一个仓库级基准,用于评估编码代理在科学软件修复任务中的表现,揭示了失败机制和科学指导的混合效应。
查看缓存全文
缓存时间: 2026/08/21 08:08
论文页面 - SWE-bench Science:编程智能体能否解决科学领域的工程任务?
来源:https://huggingface.co/papers/2608.19799
摘要
SWE-bench Science 基准测试了编程智能体在科学软件修复方面的表现,揭示了其失败机制及科学指导带来的混合影响。
软件正日益成为科学仪器本身的组成部分,这使得科学代码中的缺陷不仅可能影响程序行为,还可能破坏支撑科学结论的证据基础。然而,现有对编程智能体的评估(https://huggingface.co/papers?q=coding%20agents)大多侧重于整体任务成功率,对于智能体在修复科学软件时为何失败提供了有限的洞见。我们推出了 SWE-bench Science(https://huggingface.co/papers?q=SWE-bench%20Science),这是一个面向科学软件工程(https://huggingface.co/papers?q=scientific%20software%20engineering)的代码仓库级基准,包含来自 20 个科学领域、98 个 GitHub 仓库的 119 个任务。每个任务被组织成以下三种范式之一:Issue 驱动型、专家探索型和工程集成型。即使是表现最佳的智能体 Claude Code(使用 Opus-5 模型,最大设置),其 pass@1(https://huggingface.co/papers?q=pass%401)率也低于 50%,凸显了科学软件工程(https://huggingface.co/papers?q=scientific%20software%20engineering)所带来的重大挑战。我们的分析识别出了四种反复出现的失败机制(https://huggingface.co/papers?q=failure%20mechanisms):科学知识(https://huggingface.co/papers?q=scientific%20knowledge)或抽象能力的欠缺、误导性的探索或表面性的修复、不完整的修复覆盖或系统集成失败,以及未能将科学知识(https://huggingface.co/papers?q=scientific%20knowledge)推广到观察案例之外。我们进一步进行了一项配对消融实验(https://huggingface.co/papers?q=ablation),在保留代码仓库和可执行工程上下文的同时,移除了明确的科学指导。结果表明,科学知识(https://huggingface.co/papers?q=scientific%20knowledge)并非普遍有益:有根据的信息可以约束修复过程,提高平均性能和 token 效率;而对齐不佳的指导则可能引发锚定效应,并不必然能提高精确修复的成功率。总之,SWE-bench Science(https://huggingface.co/papers?q=SWE-bench%20Science)为研究编程智能体(https://huggingface.co/papers?q=coding%20agents)在科学软件工程(https://huggingface.co/papers?q=scientific%20software%20engineering)中的能力及失败机制(https://huggingface.co/papers?q=failure%20mechanisms)提供了一个广泛的测试平台。
查看 arXiv 页面 (https://arxiv.org/abs/2608.19799) 查看 PDF (https://arxiv.org/pdf/2608.19799) 项目页面 (https://swescience.github.io/) GitHub (https://github.com/OpenMOSS/SWE-bench-Science) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.19799)
引用此论文的模型 0
没有模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.19799 即可从本页面链接至该论文。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.19799 即可从本页面链接至该论文。
引用此论文的 Spaces 0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.19799 即可从本页面链接至该论文。
包含此论文的收藏 0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页面链接至该论文。
相似文章
Senior SWE-Bench:评估作为高级工程师的AI代理的开源基准
Senior SWE-Bench 是一个开源基准,用于评估AI代理在需要高级技能的软件工程任务上的表现。
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话
SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。
Senior SWE Bench:一个专注于现实未充分指定功能任务的新基准测试
Senior SWE-Bench 是一个新的开源基准测试,旨在评估 AI 智能体在现实、未充分指定的软件工程任务上的表现,强调意图对齐和代码质量等技能,而非过于详细的规范。
SWE-Touch:当用户修改代码时对编码智能体的基准测试
介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。