标签
作者讨论了在模型和工具不断演进的情况下保持AI代理技术栈更新的挑战,并寻求生产团队关于基准测试和更新实践的见解。
本文概述了2026年AI智能体工程师的12步路线图,重点介绍了七个相互关联的支柱,如上下文、工具和记忆,并结合基于Claude的工作流,以构建可靠的生产环境智能体。
LinkedIn presents a self-evolving agentic customer support system that integrates RAG with evolutionary auto-prompting and modular evaluation, achieving significant gains in production A/B tests including a 9.0-point increase in QA self-serve and 30.6-point improvement in routing accuracy.
本文认为,生产环境中的LLM幻觉通常是系统架构问题,而非模型问题,并概述了四个关键护栏:RAG接地、实时工具/函数调用、选择性人工监督,以及红队/对抗性测试。
Uber Eats 描述其自调优多智能体 AI 系统,用于自动修复商家照片,使用路由、编辑、QA 智能体,配合集中式日志记录,以及一个自主的诊断智能体(Diagnoser Agent),在通过黄金基准测试后自动重写提示并自动部署。
本文认为,销售AI封装器(现有模型的简单接口)比构建能在生产中可靠运行的AI系统更容易,并强调了部署中的挑战。
一篇技术文章讨论了在生产级AI代理工作中从代理循环到结构化图的转变,并引用了持久化执行引擎(Temporal、Restate)以及AFlow等研究——AFlow使用蒙特卡洛树搜索来优化工作流图。
本文提出 Agentic Context Management(ACM),将智能体记忆视为包含五个原语的生命周期问题,并介绍了参考实现 Maximem Synap,该实现取得了强劲的基准测试结果。
本文讨论了开放权重模型(尤其是来自中国公司的模型)在生产型AI工作负载中日益占据主导地位,这挑战了像Anthropic和OpenAI这样的公司的前沿模型的相关性。
一个生产团队将其QA智能体从GPT-5.3-codex迁移到MiniMax M3,发现虽然新模型每个任务使用更多token,但由于其更低的每token价格,中位成本降低了55%。文章还强调了推理提供商选择以及隐藏推理token对有效定价的影响。
本文探讨了AI智能体系统在生产环境中因过度上下文、不恰当的模型选择及重试等隐藏低效而浪费开销的现象,并质疑哪些运行时决策应控制模型调用。
观察从应对AI幻觉转向更紧迫的生产级AI故障问题,强调企业部署中需要系统可靠性、决策追踪和限制爆炸半径。
作者分享了运行AI代理循环一个月后的实际经验,强调了循环契约、状态和日志的重要性,以使代理实现自主和可靠。
施耐德电气使用 LangChain 的 LangSmith 在100多个国家运行超过60个生产级AI代理,通过其AI助手为16万名员工提供服务,展示了企业级LLMOps能力。
本文认为,常见的专注于减少token的LLM成本建议过于肤浅,而在生产环境中更具影响力的策略是,将不同的工作流步骤路由到不同的模型,而不是使用单一的默认模型。
本文讨论了构建一个可靠、长期运行的多代理生产系统所面临的挑战,指出目前需要集成多个碎片化工具,如 CrewAI、Temporal、Browserbase 和 Langfuse,并提出是否可能存在更统一的运行时。
A 22-chapter skeleton course on building production AI agents, using an innovative approach where the AI partner fills in details. The course covers tool calling, agent loops, memory, multi-agent collaboration, and more.
文章指出,当前生产环境中AI的最大瓶颈并非初始模型部署,而是持续的迭代周期——将生产使用(推理日志、用户反馈)转化为用于微调和重新部署的数据集。文章强调了构建集成反馈循环而非一次性项目的重要性。
AI Gateway 的2026年5月数据显示,DeepSeek的代币份额飙升至17%,但支出极少,而 Anthropic 保持了65%的支出,表明路由策略注重成本且整体使用量在增长。
Salesforce部署了20,000个企业级AI代理,揭示了大部分精力在发布之后而非之前。Agentforce首席产品官John Kucera分享了成功代理与停滞代理的区别。