agents.md文件对编码代理有帮助吗?

Hacker News Top 论文

摘要

这篇论文评估了诸如AGENTS.md或CLAUDE.md等仓库级上下文文件是否能提升编码代理的性能,发现由LLM生成的上下文文件几乎无益甚至可能降低效率,而开发者编写的文件效果稍好,但优势仍不明确。

<a href="https:&#x2F;&#x2F;xcancel.com&#x2F;rasbt&#x2F;status&#x2F;2063649136323252397" rel="nofollow">https:&#x2F;&#x2F;xcancel.com&#x2F;rasbt&#x2F;status&#x2F;2063649136323252397</a><p><a href="https:&#x2F;&#x2F;arxiv.org&#x2F;abs&#x2F;2602.11988" rel="nofollow">https:&#x2F;&#x2F;arxiv.org&#x2F;abs&#x2F;2602.11988</a>
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:17

https://arxiv.org/abs/2602.11988 — # AGENTS.md 文件真的能帮助编程助手吗?

在阅读与智能体相关的研究文献时,有一篇论文绝对引起了我的注意:《评估 AGENTS.md:仓库级上下文文件对编程助手有帮助吗?》。该研究探讨了在代码仓库中添加诸如 AGENTS.md 或 CLAUDE.md 这类仓库级指令文件,是否真的能帮助编程助手理解如何在这个代码库中工作。论文在两个场景下进行了评估。首先,使用 SWE-bench Lite 基准,由于原始仓库不一定包含开发者编写的上下文文件,作者生成了这些文件。其次,他们引入了 AGENTBENCH,这是一个新的基准测试,包含来自 12 个仓库的 138 个 Python 任务,这些仓库已经拥有开发者提供的上下文文件。然后,助手在三种条件下进行评估:没有上下文文件、使用 LLM 生成的上下文文件,以及在可用的情况下使用开发者编写的上下文文件。结果总结如下。

图 1:来自《评估 AGENTS.md》论文的主要结果(https://arxiv.org/abs/2602.11988)。

根据上图所示的结果,与不使用上下文文件相比,LLM 生成的上下文文件平均而言要么略微降低任务成功率,要么没有太大影响。这也许令人惊讶,也许并不惊讶,因为我认为 LLM/助手工具会动态生成所需的上下文信息。上下文文件更多是关于提高独立会话之间的效率。此外,开发者编写的上下文文件优于 LLM 生成的,这或许在意料之中,因为那里蕴含着领域专业知识。但非常令人惊讶的是,在他们的基准测试中,不使用上下文文件反而更便宜、更高效!

图 2:来自《评估 AGENTS.md》论文的效率结果(https://arxiv.org/abs/2602.11988)。

一开始,不使用上下文文件却能带来更高效率这一事实有点令人费解。我最初怀疑这可能是因为这里的工具可能处理了冗余信息(也就是说,它们读取了上下文文件,但无论如何,它们都会像没读过上下文文件一样从代码仓库解析额外信息)。研究人员在这里进行了追踪分析,显示助手通常会遵循上下文文件中的指令,但当工具被提及时,它们会运行更多测试、搜索更多文件、读取更多文件,并使用更多仓库特定工具。因此,负面或微弱的性能影响似乎并非来自助手忽略这些文件。更可能的解释是,上下文文件通常会增加要求和探索步骤,使任务更难或更彻底,但正如我们在图 11 中看到的,这未必能带来更高的成功率。

我的结论是:仓库级上下文文件应该尽可能保持简短和具体,或许理想情况下是分层级的(例如,“如果你执行 x,请检查另一个上下文文件 y.md,否则忽略它”)。当然,这里的问题是,LLM 和工具目前已经有些过时,如果用最新的工具和 LLM 重新进行这项研究,将会很有意义。

论文链接:https://arxiv.org/abs/2602.11988

相似文章