代理演示看起来很惊艳,因为没人拍那90%的错误处理部分
摘要
作者将精心打磨的AI代理演示与生产系统的现实进行对比,指出大多数代理代码用于错误处理和护栏(guardrails),而非核心智能。
我总看到那些流畅的代理演示,然后回到自己的工作中,想起构建这些系统的真实情况。演示是代理在一条别人设定好的快乐路径上干净地执行一次任务。生产环境则是路径不快乐时发生的一切。我的代理大部分代码都花在演示中永远不会出现的事情上:API超时时重试、传递前检查输出格式是否正确、在即将无限循环时自我停止、记录足够的信息以便凌晨2点能找出问题。真正的“智能”可能只占十分之一,其余都是管道工程,防止一个错误步骤污染整个运行。另一件没人展示的事情是:代理会以一种脚本不会的方式静默失败。一个出错的脚本会抛出一个错误。一个出错的代理会自信地做错事,然后告诉你它成功了。所以我最终围绕代理构建了检查机制,其工作量几乎与代理本身相当。我并不是贬低它们,那些能正常工作的代理确实为我节省了时间。但我已经不再信任任何不展示步骤失败时会发生什么的演示。你实际的代理逻辑与围绕它的护栏(guardrails)的比例是多少?
相似文章
生产环境中的AI代理:演示中绝不会提及的失败模式
对在生产环境中部署AI代理的真实挑战的实用深度剖析,涵盖演示与可靠系统之间的差距、提示注入等攻击面,以及安全自主性的设计原则。
AI agent演示总能成功。但一旦投入生产,你就会意识到'它能跑'从来不是最难的。
本文讨论了AI agent演示往往成功,而生产部署却暴露出关键的安全和授权问题,强调模型质量并不能解决诸如访问控制、数据泄露和可审计性等问题。
无代码智能体工具:演示完美,却忽略了乏味的部分
本文批评无代码AI智能体工具能够打造令人印象深刻的演示,却忽视了实际部署和维护中那些必不可少却又乏味的方面。
有没有人也觉得AI代理在事情变得复杂之前都表现得很惊艳?
对AI代理令人印象深刻的演示和可靠的实际执行之间差距的反思,认为当前代理擅长结构化任务但在不可预测条件下会失败,并指出近期AI角色将主要集中于带人类监督的窄范围自动化。
最令人印象深刻的AI智能体演示仍然是最简单的
文章指出,最有效的AI智能体演示简单可靠,专注于明确任务和结构化输出,而非完全自主,这标志着行业正健康地向可靠性转变。