Schrödinger的代码仓库:LLM 是学会了 SWE-bench 还是记忆了它?
摘要
本文提出了 Schrödinger Repo,一个用于编码代理的评估框架,它动态实例化仓库以解决基准测试中的数据泄露问题,表明当前的 LLM 可能依赖于记忆的线索。
查看缓存全文
缓存时间: 2026/09/24 03:39
论文页面 - 薛定谔的代码仓库:大语言模型是学会了SWE-bench还是记住了它?
来源:https://huggingface.co/papers/2609.27891
摘要
仓库级编码基准测试已成为评估编码代理的标准,但由于它们基于被反复用于训练的流行开源仓库构建,因此天生存在数据泄露问题。因此,优异的表现可能反映的是对典型仓库线索的记忆,而非稳健的仓库推理能力。我们提出了SchrodingerRepo(薛定谔的仓库),这是一个用于在动态实例化仓库表示下测试编码代理的评估框架。SchrodingerRepo没有反复使用测试仓库的静态表示,而是将测试仓库视为一个评估时的潜在变量,仅在代理进入评估环境时才进行动态实例化。实例化后的仓库保留了原始的可执行行为,同时通过四个转换级别——问题陈述重建、命名空间重映射、文件内布局重排和功能保持的代码重写——削弱了熟悉的线索,如命名约定、文件布局和实现模式。我们在SWE-bench Verified和SWE-QA上评估了流行的大语言模型。结果显示,移除熟悉的仓库线索会持续降低代理性能,并显著增加所有模型的交互成本。进一步分析表明,额外的成本主要源于仓库探索和定位难度的增加。这些发现表明,当前的编码代理可能部分依赖于记忆化的仓库线索,突显了在动态实例化仓库表示下进行评估的必要性。
查看arXiv页面 (https://arxiv.org/abs/2609.27891) 查看PDF (https://arxiv.org/pdf/2609.27891) GitHub4 (https://github.com/cslsolow/Schrodinger-Repo) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.27891)
在你的代理中获取此论文:
hf papers read 2609\.27891
还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接到此论文
在模型README.md中引用arxiv.org/abs/2609.27891,以从此页面链接到该模型。
引用本文的数据集0
没有数据集链接到此论文
在数据集README.md中引用arxiv.org/abs/2609.27891,以从此页面链接到该数据集。
引用本文的Spaces0
没有Space链接到此论文
在Space README.md中引用arxiv.org/abs/2609.27891,以从此页面链接到该Space。
包含本文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到该收藏集。
相似文章
SWE Context Bench 刚刚证明了一件我想很多编码代理用户已经感受到的事情
新的基准论文《SWE Context Bench》测试编码代理能否跨任务复用知识,凸显了现有基准仅评估孤立问题解决的不足。作者讨论了外部记忆等解决方案,并提到了 langmem、mem0、supermemory 和 Greplica 等工具。
LLM智能体能够查看代码仓库
本文首次系统性地实证研究了使用可视化仓库表示来增强基于LLM的编码智能体,结果表明,将可视化图作为补充模态集成,可以在保持或提高问题解决准确率的同时,将令牌消耗降低高达26%。
@adithya_s_k: https://x.com/adithya_s_k/status/2067628584680710292
这篇文章讨论了代码代理如何通过复制已知补丁来作弊评估,并介绍了Repo2RLEnv,一个从真实仓库创建可验证编码环境的工具,用于为AI代码代理构建稳健的基准和训练数据。
SWE-bench Science:编码代理能否解决科学工程任务?
SWE-bench Science 引入了一个仓库级基准,用于评估编码代理在科学软件修复任务中的表现,揭示了失败机制和科学指导的混合效应。
SWE-Explore:编码代理仓库探索能力基准测试
SWE-Explore 引入了一个基准测试,用于评估编码代理的仓库探索能力,要求在行预算内返回相关代码区域的排序列表。实验表明,基于代理的探索优于传统检索,而行级覆盖仍然是关键区分因素。