Schrödinger的代码仓库:LLM 是学会了 SWE-bench 还是记忆了它?

Hugging Face Daily Papers 论文

摘要

本文提出了 Schrödinger Repo,一个用于编码代理的评估框架,它动态实例化仓库以解决基准测试中的数据泄露问题,表明当前的 LLM 可能依赖于记忆的线索。

仓库级编码基准已成为评估编码代理的标准,但它们固有地受到数据泄露的影响,因为它们基于流行的开源仓库构建,这些仓库被重复用于训练。因此,强劲的表现可能反映了对典型仓库线索的记忆,而不是稳健的仓库推理。我们提出 SchrodingerRepo,一个用于测试编码代理在动态实例化仓库表示下的评估框架。SchrodingerRepo 不是重复使用测试仓库的静态表示,而是将测试仓库视为评估时的潜在变量,仅在代理进入评估环境时动态实例化。实例化的仓库保留了原始可执行行为,同时通过四个转换级别侵蚀熟悉线索,如命名约定、文件布局和实现模式:问题陈述重构、命名空间重映射、文件内布局重排序和功能保持的代码重写。我们在 SWE-bench Verified 和 SWE-QA 上评估了流行的 LLM。结果显示,移除熟悉的仓库线索一致地降低了代理性能,并在不同模型中显著增加了交互成本。进一步分析表明,额外成本主要是由仓库探索和定位难度增加引起的。这些发现表明,当前的编码代理可能部分依赖于记忆的仓库侧线索,强调了在动态实例化仓库表示下进行评估的必要性。
查看原文
查看缓存全文

缓存时间: 2026/09/24 03:39

论文页面 - 薛定谔的代码仓库:大语言模型是学会了SWE-bench还是记住了它?

来源:https://huggingface.co/papers/2609.27891

摘要

仓库级编码基准测试已成为评估编码代理的标准,但由于它们基于被反复用于训练的流行开源仓库构建,因此天生存在数据泄露问题。因此,优异的表现可能反映的是对典型仓库线索的记忆,而非稳健的仓库推理能力。我们提出了SchrodingerRepo(薛定谔的仓库),这是一个用于在动态实例化仓库表示下测试编码代理的评估框架。SchrodingerRepo没有反复使用测试仓库的静态表示,而是将测试仓库视为一个评估时的潜在变量,仅在代理进入评估环境时才进行动态实例化。实例化后的仓库保留了原始的可执行行为,同时通过四个转换级别——问题陈述重建、命名空间重映射、文件内布局重排和功能保持的代码重写——削弱了熟悉的线索,如命名约定、文件布局和实现模式。我们在SWE-bench Verified和SWE-QA上评估了流行的大语言模型。结果显示,移除熟悉的仓库线索会持续降低代理性能,并显著增加所有模型的交互成本。进一步分析表明,额外的成本主要源于仓库探索和定位难度的增加。这些发现表明,当前的编码代理可能部分依赖于记忆化的仓库线索,突显了在动态实例化仓库表示下进行评估的必要性。

查看arXiv页面 (https://arxiv.org/abs/2609.27891) 查看PDF (https://arxiv.org/pdf/2609.27891) GitHub4 (https://github.com/cslsolow/Schrodinger-Repo) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.27891)

在你的代理中获取此论文:

hf papers read 2609\.27891

还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接到此论文

在模型README.md中引用arxiv.org/abs/2609.27891,以从此页面链接到该模型。

引用本文的数据集0

没有数据集链接到此论文

在数据集README.md中引用arxiv.org/abs/2609.27891,以从此页面链接到该数据集。

引用本文的Spaces0

没有Space链接到此论文

在Space README.md中引用arxiv.org/abs/2609.27891,以从此页面链接到该Space。

包含本文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到该收藏集。

相似文章

LLM智能体能够查看代码仓库

Hugging Face Daily Papers

本文首次系统性地实证研究了使用可视化仓库表示来增强基于LLM的编码智能体,结果表明,将可视化图作为补充模态集成,可以在保持或提高问题解决准确率的同时,将令牌消耗降低高达26%。

SWE-Explore:编码代理仓库探索能力基准测试

Hugging Face Daily Papers

SWE-Explore 引入了一个基准测试,用于评估编码代理的仓库探索能力,要求在行预算内返回相关代码区域的排序列表。实验表明,基于代理的探索优于传统检索,而行级覆盖仍然是关键区分因素。