标签
分析 LLM 智能体中情景记忆与程序性记忆之间的差距,引用浙江大学和阿里巴巴的一篇新论文 (Memp),该论文从智能体轨迹中构建程序性记忆,并利用失败信号修正存储的程序。
在 AI Engineer 世界博览会上,Phil Schmid 做了演讲,阐述了为什么凭感觉评估代理技能在生产中会失效,以及如何使用负面测试用例、技能限制和消融测试构建可靠的自动评估。
一位开发者反思了在公开发布AI Agent应用之前应落实的关键安全措施——例如支出上限、速率限制和备用模型——以避免隐藏成本和意外行为。
Netflix 分享了其内部 LLM 服务栈背后的设计决策,包括引擎选择(vLLM)、模型打包、API 接口和部署策略,重点介绍了在生产负载下揭示的权衡取舍。
Jerry Liu强调了将智能体检索系统投入生产时所面临的工程挑战,指出成功的关键在于对分块、同步、重排序、工具API设计等细节进行精心调优,而非依赖新颖的技术。
对三个语音 AI 代理——Retell、Vapi 和 Plura AI——进行比较,评估它们在生产用例中的表现。
Kevin Bass 主张快速将 'vibe code slop' 投入生产,认为未来的人工智能模型将负责架构改进,从而解放人类。
丰田企业AI团队在Interrupt会议上分享了ToyotaGPT平台,基于LangGraph和LangSmith,将AI智能体交付从6个月缩短至4天,并在生产环境中运行50多个智能体,节省数百万美元。
一个GitHub上7.7k stars的7周课程,从零搭建生产级RAG系统,涵盖Docker、FastAPI、混合检索、LangGraph agentic RAG和Telegram bot,全程动手写代码。
一个讨论贴,询问开发者如何处理AI代理依赖的工具、API或模型版本在生产环境中发生变化的情况,包括检测、修复和成本。
Mozilla发布的《开源AI现状》报告指出,开源权重模型在许多任务上已与闭源模型达到同等水平,同时推理成本在36个月内下降了50倍。目前,大多数生产环境中的token通过开源模型路由,竞争格局已转移到上层的智能体层。
Alvin Sng 解释了他们的团队为何放弃使用 Stripe、WorkOS 和 Slack 的客户端 SDK,转而通过集中式包装器直接调用其 REST API。他们认为,SDK 会隐藏关键的调试细节,在生产环境中不稳定,并且容易引发反模式,而借助 AI 辅助编码,这些反模式如今可以更轻松地避免。
本文讨论了企业在将AI代理部署到生产环境时面临的重大挑战,着重指出了缺乏标准部署基础设施、安全问题以及需要编排层来管理代理生命周期。
本文分享了在生产环境中可靠地从LLM生成结构化JSON输出的经验,涵盖JSON模式、模式验证和重试循环等方法,实现了99.5%的有效性。
微软分享了从原型到生产过程中,在企业级规模下部署数千个AI代理的工程经验,涵盖代理框架、检索即子代理、代理身份以及基于评估标准的自动化优化循环等关键挑战。
一项调查显示,大多数团队对agent严格控制,数据表明,窄范围agent的成功率为65%,而宽范围仅为16%,这暗示可靠性问题可能更多与范围有关,而非模型能力。
一篇介绍循环工程的文章,认为它是2026年提示工程的继承者,重点在于设计智能体循环而非手写提示,并强调验证者是瓶颈。
一位AI工程师发布了一个开源项目,教授如何从零构建本地RAG系统,以及一个生产级别的智能体架构,包含LangGraph、混合检索、缓存和可观测性。