SWE-bench Science:编码代理能否解决科学工程任务?

Hugging Face Daily Papers 论文

摘要

SWE-bench Science 引入了一个仓库级基准,用于评估编码代理在科学软件修复任务中的表现,揭示了失败机制和科学指导的混合效应。

软件日益成为科学仪器的一部分,使得科学代码中的故障不仅可能影响程序行为,还可能损害科学结论的证据基础。然而,现有的编码代理评估大多侧重于整体任务成功率,对代理在修复科学软件时失败的原因洞察有限。我们引入 SWE-bench Science,一个用于科学软件工程的仓库级基准,包含来自 20 个科学领域的 98 个 GitHub 仓库中的 119 个任务。每个任务分为三种范式之一:问题驱动 (Issue-driven)、专家探索 (Expert-exploratory) 和工程集成 (Engineering-integration)。即使是最优的代理 Claude Code with Opus-5 (max),其 pass@1 也低于 50%,凸显了科学软件工程带来的巨大挑战。我们识别出四种常见的失败机制:科学知识或抽象的缺陷、误导性探索或表面修复、修复覆盖不完整或系统集成问题,以及在分析中未能将科学知识推广到观察案例之外。我们进一步进行了一项配对消融研究,在保留仓库和可执行工程上下文的同时移除了显式科学指导。结果显示,科学知识并非普遍有益:基于充分的信息可以约束修复,提高平均性能和令牌效率,而对齐不佳的指导可能导致锚定效应,不一定能改善精确修复成功率。总之,SWE-bench Science 为研究编码代理在科学软件工程中的能力和失败机制提供了一个广泛的测试平台。
查看原文
查看缓存全文

缓存时间: 2026/08/21 08:08

论文页面 - SWE-bench Science:编程智能体能否解决科学领域的工程任务?

来源:https://huggingface.co/papers/2608.19799

摘要

SWE-bench Science 基准测试了编程智能体在科学软件修复方面的表现,揭示了其失败机制及科学指导带来的混合影响。

软件正日益成为科学仪器本身的组成部分,这使得科学代码中的缺陷不仅可能影响程序行为,还可能破坏支撑科学结论的证据基础。然而,现有对编程智能体的评估(https://huggingface.co/papers?q=coding%20agents)大多侧重于整体任务成功率,对于智能体在修复科学软件时为何失败提供了有限的洞见。我们推出了 SWE-bench Science(https://huggingface.co/papers?q=SWE-bench%20Science),这是一个面向科学软件工程(https://huggingface.co/papers?q=scientific%20software%20engineering)的代码仓库级基准,包含来自 20 个科学领域、98 个 GitHub 仓库的 119 个任务。每个任务被组织成以下三种范式之一:Issue 驱动型、专家探索型和工程集成型。即使是表现最佳的智能体 Claude Code(使用 Opus-5 模型,最大设置),其 pass@1(https://huggingface.co/papers?q=pass%401)率也低于 50%,凸显了科学软件工程(https://huggingface.co/papers?q=scientific%20software%20engineering)所带来的重大挑战。我们的分析识别出了四种反复出现的失败机制(https://huggingface.co/papers?q=failure%20mechanisms):科学知识(https://huggingface.co/papers?q=scientific%20knowledge)或抽象能力的欠缺、误导性的探索或表面性的修复、不完整的修复覆盖或系统集成失败,以及未能将科学知识(https://huggingface.co/papers?q=scientific%20knowledge)推广到观察案例之外。我们进一步进行了一项配对消融实验(https://huggingface.co/papers?q=ablation),在保留代码仓库和可执行工程上下文的同时,移除了明确的科学指导。结果表明,科学知识(https://huggingface.co/papers?q=scientific%20knowledge)并非普遍有益:有根据的信息可以约束修复过程,提高平均性能和 token 效率;而对齐不佳的指导则可能引发锚定效应,并不必然能提高精确修复的成功率。总之,SWE-bench Science(https://huggingface.co/papers?q=SWE-bench%20Science)为研究编程智能体(https://huggingface.co/papers?q=coding%20agents)在科学软件工程(https://huggingface.co/papers?q=scientific%20software%20engineering)中的能力及失败机制(https://huggingface.co/papers?q=failure%20mechanisms)提供了一个广泛的测试平台。

查看 arXiv 页面 (https://arxiv.org/abs/2608.19799) 查看 PDF (https://arxiv.org/pdf/2608.19799) 项目页面 (https://swescience.github.io/) GitHub (https://github.com/OpenMOSS/SWE-bench-Science) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.19799)

引用此论文的模型 0

没有模型链接到此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.19799 即可从本页面链接至该论文。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.19799 即可从本页面链接至该论文。

引用此论文的 Spaces 0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.19799 即可从本页面链接至该论文。

包含此论文的收藏 0

没有包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页面链接至该论文。

相似文章

SWE-INTERACT: 将SWE基准重新构想为用户驱动的长期编码会话

Hugging Face Daily Papers

SWE-Interact是一个新的测试平台,用于评估编码智能体在真实的多轮用户驱动软件工程任务中的表现,揭示了强大的单轮基准性能并不能可靠地迁移到交互式、迭代的工作流程中,在这些流程中,智能体必须发现用户意图并适应不断变化的需求。