标签
对246个开源仓库和57篇关于代理框架的论文的分析,突出了最佳实践,如人工编写上下文、限制工具和增量测试,以提高AI代理的性能。
一个AI代理反思了自身运行数月来的四大失败,强调了在持久AI系统中独立监控、任务验证以及防止捏造的重要性。
这篇博客文章解释了为什么在Windows编程中,开发者必须将所有未处理的消息传递给DefWindowProc,并通过一个因不当清理处理导致的涉及RegisterDragDrop和RevokeDragDrop的内存泄漏案例进行说明。
关于在AI代理中管理API密钥的最佳实践的讨论,重点关注安全措施,如最小权限访问、密钥轮换和防止原始凭据暴露。
本文认为,使用 GitHub 的 Wiki 来编写文档是一种反模式,推荐使用带有 GitHub Pages 的文档文件夹,以获得更好的版本控制和协作体验。
本文讨论了AI系统中评估(evals)的重要性,解释了为什么传统测试不够用,介绍了三种主要评估类型,并提供了实施建议。
这篇博客文章提出了新编程语言的设计指南,强调了修复常见问题,如缩进多行字符串、正确的文件路径处理、一致的文件扩展名和可扩展的语法特性。
本文指出,许多用户错误地认为使用 Codex 或 Claude 创建的技能可以独立运行,但它们往往依赖本地 Memory,这一点在不同机器上运行失败时得到了证实。
本文探讨了AI辅助编程中的两大阵营:使用现有工具链如Codex配合工具和AGENTS.md, versus 构建自定义的编排代理。作者支持前者,认为后者被过度炒作。
本文讨论了在使用AI编程代理时如何管理代码质量,通过采用规范驱动开发和测试驱动开发等策略来减少错误并提高生产力。
GitHub分享了用于将语言模型系统从原型移至生产的评估实践,解决现实世界的挑战和指标,如精确率和召回率。
作者修订了编码代理评估的成功标准,从要求三次完美的88/88运行改为每个案例必须在三次运行中至少通过两次的标准,以减少随机性影响并提高稳定性。
作者建议在AI流水线中尽早记录详细信息以防止问题,分享了个人经历,其中缺乏文档导致调试困难。
本文概述了构建14个必要系统以确保AI智能体的可靠性和安全性,包括身份管理、访问控制和事件响应协议。
本文介绍了Thomas Ptacek提出的规则,即使用LLMs作为文案编辑时,永远不要采用LLM建议的短语,以维护原创性和写作纪律。
本文为编码代理提供风格规则,以确保输出清晰、简洁的语言,无术语或冗长,涵盖词汇、句子结构和Markdown格式。
本文讨论了一种关键的自动化失败模式,即操作成功但响应超时,导致重复执行,并提倡使用稳定的操作ID和状态检查来增强代理评估的鲁棒性。
文章强调了智能体AI部署中缺乏健全的安全实践,指出许多项目未能应用日志记录和最小权限等标准安全措施,并引用了OWASP的Top 10和AIUC-1标准。
这条推文分享了在构建软件工厂进行问题分类时从小处着手的建议,强调在扩展前进行渐进式调整和建立信任。