标签
本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。
本文讨论了一种通过将规划阶段与执行分离来减少AI代理上下文膨胀的技术,从而提高了代理的效率和准确性。
Andrew Ng将关注点从系统是否是智能体转向它拥有多少自主权,建议构建具有按任务精心设置的自主性水平的智能体工作流,而非完全自主。
本文探讨了状态化与无状态化智能体设计在可扩展人工智能系统中的权衡,并提供了使用 Groq API 和 Llama 3.1 8B Instant 模型的实现示例。
文章指出,AI智能体通常是在对低维行为的隐含假设下构建的,但实际上它们运行的空间维度要高得多,从而导致意想不到的复杂性。
本文介绍了用于构建可插拔AI代理架构的模型上下文协议(MCP),详细介绍了在Sentry构建MCP服务器的经验教训,包括OAuth 2.1集成、设计对代理友好的工具接口以及当前生态系统的局限性。
本文探讨了设计LLM控制框架的原则,旨在使其直观、透明且精简,借鉴Unix哲学以减少认知负荷并提高可靠性。
文章批判当前AI编程工具普遍使用聊天窗口作为界面,认为这种设计从两端(用户和开发者)限制了AI的自主工作能力,并提出应转向异步、任务驱动的协作模式。
作者分享了运行AI代理循环一个月后的实际经验,强调了循环契约、状态和日志的重要性,以使代理实现自主和可靠。
本文介绍了AgentCanvas(一种用于具身智能体的类型化图运行时)和KDLoop(一种编码智能体搜索程序),以自动化具身智能体架构的设计,并在多个具身任务上进行评估,揭示了诸如 rollout 噪声和局部编辑盆地等挑战。
作者质疑在多Agent架构中分离写作Agent与审校Agent是否比单一Agent带自我批评步骤更具优势,并分享了构建doc-to-wiki系统的经验。
这篇文章讨论了AI记忆系统的设计方法,主张从评估出发让好的记忆系统自然涌现,而不是从上到下设计记忆架构。作者认为记忆是系统在压力下进化出来的二阶效应,并提出纵向评估框架。
作者分享了构建AI代理的经验,发现提供清晰的上下文和指导(定义任务、规则和工具)比模型大小更能减少错误并提升性能。
作者认为,AI 代理的可靠性来自于确定性代码,而非 LLM,并分享了在混乱的真实世界数据上构建可信代理的五项关键实践。
伦敦大学学院的研究人员对Claude Code进行了逆向工程,发现只有1.6%的代码库是AI决策逻辑,而98.4%是操作基础设施,这揭示了一种设计理念,即优先考虑丰富的确定性框架而非模型驱动路由。
文章提出在Coding Agent中,工具调用应视为契约而非简单函数,强调Harness在验证、权限、生命周期管理等环节的裁决作用,并详细讨论了工具契约的组成和生命周期。
一条技术性 Twitter 线程,分享构建高性能垂直 AI Agent 的原则,以 Shortcut 电子表格 Agent 为例。核心见解:将上下文视为分层缓存(L1/L2/L3),以在分布中最小化每个任务的成本。
文章认为,AI代理由持久事件日志定义,而非运行时或模型,从而支持容错恢复并简化对代理状态的推理。
一位开发者分享,将智能体的上下文窗口减少一半意外地提升了其在客户资格筛选和CRM自动化方面的表现,暗示过多的上下文可能掩盖糟糕的架构并导致决策犹豫不决。