测试了我的编码 CLI 是否真的读取 AGENTS.md。

Reddit r/AI_Agents 新闻

摘要

一个实验测试了编码 CLI 是否真的读取 AGENTS.md,结果发现该文件被静默忽略;即使被读取,臃肿的指令文件也会增加 token 成本且无法提升性能。作者建议只写入模型无法从代码中推断出的内容。

这周我做了一个小实验,它改变了我对指令文件(AGENTS.md、CLAUDE.md,或者你的工具读取的任何文件)的看法。设置:全新克隆的 Flask 仓库,一个真实会话经常问的问题:“CI 运行测试的确切命令是什么,以及什么运行类型检查。”真正的答案包含三个非默认标志和一个环境变量,所以智能体要么翻查 CI 工作流,要么直接被告诉。五种配置,每种运行两次:无文件、一个约 950 字节的精简文件包含这些命令、一个 86KB 的文件把同样的命令埋在一长段架构概述之下,然后在测试工具自己偏好的文件名(而不是 AGENTS.md)下再次测试精简版和臃肿版。发现 1:我的测试工具静默忽略了 AGENTS.md。AGENTS.md 配置下的运行结果与没有文件时完全一致,差异小于运行间的噪声。该供应商在格式网站上被列为支持工具。我用一个无工具探针再次确认(询问指令文件内容,禁止读取文件):标准文件名得到“UNKNOWN”,而工具自己的文件名则逐字引用了文件内容。所以在你打磨任何一行之前,先检查你的工具是否真的加载了这个文件。发现 2:当精简文件确实被读取时,它节省了总输入 token 的三分之一。950 字节本身几乎不费什么;节省来自一个完整的回合从未发生:智能体从文件中回答,而不是挖掘 CI 配置,而避免一个回合意味着到目前为止的整个对话不会再次被重新发送。节省的单位是回合。发现 3:臃肿的文件比完全没有文件更糟糕。输入 token 比无文件配置多 83%,因为每个请求都会携带 86KB。而且它甚至没有阻止挖掘:智能体仍然多花了一个回合,在一次运行中明确表示它重新检查了 CI 工作流,显然不信任淹没在长文底部的两行有用信息。这与人们一直在争论的已发表评估结果出奇地一致。二月份的预印本发现上下文文件通常不会提高成功率,并且增加 20% 以上的成本,但其中还隐藏着:指令确实被很好地遵循,而仓库概述没有帮助。Vercel 的 53 到 100 的结果是在比训练数据更新的 API 上取得的,在这些场景中文件是唯一的信息来源。Augment 的数据:程序化检查清单将缺少接线的 PR 从 40% 降至 10%,而架构概述拖入了约 80K 个无关 token,并将完整性降低了 25%。到处都一样:写下模型无法知道的内容,而模型能从代码中推断出的一切都是你在每个请求上支付的税。顺便说一句,我的十次运行都正确回答了。在查找任务上,质量从未受到威胁。只有账单在变。通常的注意事项:一个仓库、一个问题、一个测试工具,每种配置 n=2。这是一次写照,而不是一个基准测试。很好奇大家会有什么发现。
查看原文

相似文章

agents.md文件对编码代理有帮助吗?

Hacker News Top

这篇论文评估了诸如AGENTS.md或CLAUDE.md等仓库级上下文文件是否能提升编码代理的性能,发现由LLM生成的上下文文件几乎无益甚至可能降低效率,而开发者编写的文件效果稍好,但优势仍不明确。