Agent README 文件:对智能体编程中上下文文件的实证研究
摘要
本文提出了首个针对智能体编程工具中使用的代理上下文文件(README)的大规模实证研究,分析了其结构、维护模式和内容。研究表明,虽然功能性上下文得到了充分覆盖,但安全性和性能等非功能性需求却很少被明确指定。
查看缓存全文
缓存时间: 2026/05/08 08:52
论文页面 - Agent READMEs:面向智能体编码的上下文文件实证研究
来源:https://huggingface.co/papers/2511.12884 发表于 2025 年 11 月 17 日
·
提交者 https://huggingface.co/hao-li
Leo (https://huggingface.co/hao-li) 于 2025 年 11 月 19 日
摘要
智能体编码工具接收自然语言编写的目标作为输入,将其分解为具体任务,并在最少人工干预的情况下编写或执行实际代码。这一过程的核心是智能体上下文文件(“智能体专用的 README”),它们提供持久化、项目级的指令。在本文中,我们对来自 1,925 个仓库的 2,303 个智能体上下文文件进行了首次大规模实证研究,以刻画其结构、维护方式和内容。我们发现,这些文件并非静态文档,而是复杂且难以阅读的产物,它们像配置代码一样演进,通过频繁的小型添加进行维护。我们对 16 种指令类型的分析表明,开发者优先考虑功能性上下文,例如构建和运行命令(62.3%)、实现细节(69.9%)以及架构(67.7%)。我们还发现了一个显著的缺口:安全性(14.5%)和性能(14.5%)等非功能性需求极少被明确指定。这些发现表明,尽管开发者利用上下文文件使智能体具备功能,但他们很少提供保障机制来确保智能体编写的代码安全且高效,这凸显了对改进工具和实践的需求。
查看 arXiv 页面 (https://arxiv.org/abs/2511.12884) 查看 PDF (https://arxiv.org/pdf/2511.12884) 项目页面 (https://agents.md/) GitHub 21.1k stars (https://github.com/openai/agents.md) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2511.12884)
在您的智能体中获取此论文:
hf papers read 2511.12884
没有最新版的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2511.12884 即可从此页面建立链接。
引用此论文的数据集 4
hao-li/AIDev 查看 • 28 天前更新 • 2.46M • 7.68k • 30 (https://huggingface.co/datasets/hao-li/AIDev)
farida5gaber/AIDev 查看 • 3 月 27 日更新 • 2.46M • 288 (https://huggingface.co/datasets/farida5gaber/AIDev)
dysavepeople/AIDev 查看 • 4 月 3 日更新 • 2.46M • 152 (https://huggingface.co/datasets/dysavepeople/AIDev)
hao-li/AgentREADMEs 查看 • 3 月 29 日更新 • 2.3k • 19 (https://huggingface.co/datasets/hao-li/AgentREADMEs)
引用此论文的空间(Spaces) 0
暂无空间链接此论文
在空间的 README.md 中引用 arxiv.org/abs/2511.12884 即可从此页面建立链接。
包含此论文的收藏集 10
浏览包含此论文的 10 个收藏集 (https://huggingface.co/collections?paper=2511.12884)
相似文章
agents.md文件对编码代理有帮助吗?
这篇论文评估了诸如AGENTS.md或CLAUDE.md等仓库级上下文文件是否能提升编码代理的性能,发现由LLM生成的上下文文件几乎无益甚至可能降低效率,而开发者编写的文件效果稍好,但优势仍不明确。
Agent Context
Agent Context 是一款开发者工具,可让用户将参考项目附加到 AI 编程助手。
Agent Retrieval Bench:评估编码智能体的仓库上下文检索能力
介绍了 Agent Retrieval Bench,这是一个文件级基准测试,用于评估编码智能体在上下文获取阶段检索相关仓库文件的能力。该基准测试包含来自25个仓库的427个样本,评估了多种检索方法,发现没有任何单一方法类别占据主导地位。
在实际仓库中运行编码代理:代理写完代码后哪些环节会出问题?
本文讨论了工程团队在采用AI编码代理时面临的实际挑战,如任务安全性、上下文检索、输出审查和协调,并提出了一个用于评估的准备度模型。
一种用于自主上下文感知数据质量评估的智能体检索框架
一篇研究论文,提出了一种统一的智能体检索框架,用于自主上下文感知数据质量评估。该框架解释自然语言使用描述,通过多智能体工作流生成可执行验证逻辑,并使用可行性验证来确保可靠性。