agents.md文件对编码代理有帮助吗?
摘要
这篇论文评估了诸如AGENTS.md或CLAUDE.md等仓库级上下文文件是否能提升编码代理的性能,发现由LLM生成的上下文文件几乎无益甚至可能降低效率,而开发者编写的文件效果稍好,但优势仍不明确。
查看缓存全文
缓存时间: 2026/06/08 09:17
https://arxiv.org/abs/2602.11988 — # AGENTS.md 文件真的能帮助编程助手吗?
在阅读与智能体相关的研究文献时,有一篇论文绝对引起了我的注意:《评估 AGENTS.md:仓库级上下文文件对编程助手有帮助吗?》。该研究探讨了在代码仓库中添加诸如 AGENTS.md 或 CLAUDE.md 这类仓库级指令文件,是否真的能帮助编程助手理解如何在这个代码库中工作。论文在两个场景下进行了评估。首先,使用 SWE-bench Lite 基准,由于原始仓库不一定包含开发者编写的上下文文件,作者生成了这些文件。其次,他们引入了 AGENTBENCH,这是一个新的基准测试,包含来自 12 个仓库的 138 个 Python 任务,这些仓库已经拥有开发者提供的上下文文件。然后,助手在三种条件下进行评估:没有上下文文件、使用 LLM 生成的上下文文件,以及在可用的情况下使用开发者编写的上下文文件。结果总结如下。
图 1:来自《评估 AGENTS.md》论文的主要结果(https://arxiv.org/abs/2602.11988)。
根据上图所示的结果,与不使用上下文文件相比,LLM 生成的上下文文件平均而言要么略微降低任务成功率,要么没有太大影响。这也许令人惊讶,也许并不惊讶,因为我认为 LLM/助手工具会动态生成所需的上下文信息。上下文文件更多是关于提高独立会话之间的效率。此外,开发者编写的上下文文件优于 LLM 生成的,这或许在意料之中,因为那里蕴含着领域专业知识。但非常令人惊讶的是,在他们的基准测试中,不使用上下文文件反而更便宜、更高效!
图 2:来自《评估 AGENTS.md》论文的效率结果(https://arxiv.org/abs/2602.11988)。
一开始,不使用上下文文件却能带来更高效率这一事实有点令人费解。我最初怀疑这可能是因为这里的工具可能处理了冗余信息(也就是说,它们读取了上下文文件,但无论如何,它们都会像没读过上下文文件一样从代码仓库解析额外信息)。研究人员在这里进行了追踪分析,显示助手通常会遵循上下文文件中的指令,但当工具被提及时,它们会运行更多测试、搜索更多文件、读取更多文件,并使用更多仓库特定工具。因此,负面或微弱的性能影响似乎并非来自助手忽略这些文件。更可能的解释是,上下文文件通常会增加要求和探索步骤,使任务更难或更彻底,但正如我们在图 11 中看到的,这未必能带来更高的成功率。
我的结论是:仓库级上下文文件应该尽可能保持简短和具体,或许理想情况下是分层级的(例如,“如果你执行 x,请检查另一个上下文文件 y.md,否则忽略它”)。当然,这里的问题是,LLM 和工具目前已经有些过时,如果用最新的工具和 LLM 重新进行这项研究,将会很有意义。
论文链接:https://arxiv.org/abs/2602.11988
相似文章
@dair_ai: If you maintain an AGENTS.md or a CLAUDE.md, this is worth a read. (bookmark it) 288 gold-test evaluated runs across Cl…
This paper presents a controlled ablation study across Claude Code and Codex, 17 real tasks, and 288 runs, finding that context files like AGENTS.md/CLAUDE.md do not measurably improve correctness; agents fail on implementation skill, not missing repository knowledge.
@kentcdodds:Claude Code 针对较新的模型削减了约80%的系统提示。一篇评估 AGENTS.md 的研究论文发现,这些文件……
Kent C. Dodds 讨论了一篇研究论文,该论文表明 AGENTS.md 通常不能提高任务成功率,反而增加了超过20%的推理成本,并询问实际应该将什么内容放入 AGENTS.md 中,同时指出 Claude Code 已将其系统提示减少了80%。
当编码任务变得混乱时,你在AGENTS.md里写些什么?
讨论了使用OpenClaw的开发者如何通过一个交接文档(AGENTS.md)来跟踪目标、文件、失败和决策,从而在混乱的编码会话中保持AI编码代理的上下文。
使用 agent.md 提升LLM辅助代码质量
本文分享了一种使用 agent.md 文件定义LLM辅助开发中编码风格偏好的方法,通过减少重复反馈来提升代码质量。
@_jaydeepkarale:AGENTS.md、SKILL.md 和 CLAUDE.md 各自的作用有何不同,以及如何在不浪费 token 的情况下使用它们
解释了 AGENTS.md、SKILL.md 和 CLAUDE.md 对 AI 编程代理的不同作用,并提供了如何在不浪费 token 的情况下使用它们的实用指南。