我开始认为我们过多地将AI代理的可靠性框架化为一个可观测性问题。
摘要
作者认为,生产环境中的AI代理可靠性不应仅关注可观测性,还应确保具有真实副作用的行为产生预期结果。
最近我遇到一个讨论,有人在构建一个语音AI代理,用于接收订单并写入生产数据库。他们的担忧是:在允许代理在生产环境中创建东西之前,如何知道对话实际上符合潜在客户资格?有人建议在写入之前添加一个分阶段/队列层,并进行确定性验证。然后另一个问题是:如果代理重试并发送完全相同的写入两次会发生什么?那个兔子洞很快就变得有趣了。因为我们现在实际上不再讨论可观测性了。我们在讨论是否可以信任代理执行具有副作用的行为。代理可以拥有完美的日志。你可以确切知道它调用了什么工具、传递了什么参数,以及API是否返回了200。系统仍然可能是错误的。数据库可能不包含代理意图的内容。潜在客户可能被创建了两次。状态转换可能在不应该发生时发生了。外部动作可能已经成功,即使代理认为它失败并重试了它。因此,代理的可靠性层可能不应只回答“代理做了什么?”还应该回答“该动作是否产生了我们实际期望的状态?”这实际上是我正在构建的一个小项目中探索的问题。对于在生产环境中运行代理的人:你们如何确保具有真实副作用的代理行为实际上是可靠的,而不仅仅是可观测的?
相似文章
我们花了太多时间构建智能体,而没有足够时间思考生产环境
本文认为,AI社区过于专注于构建功能强大的智能体,而忽视了在生产环境中可靠部署它们所需的运维挑战,强调了增强可观测性、调试能力和系统稳健性的必要性。
小众观点:大多数生产环境下的AI代理都在盲目运行,而开发者却浑然不知
一位开发者认为,大多数生产环境下的AI代理缺乏必要的可观测性,例如会话追踪和成本监控,并将其比作在没有监控的情况下部署Web应用。文章质疑代理可观测性是否仍是一个未解决的问题。
AI代理没有智能问题,它们有状态管理问题
文章认为,AI代理在生产中的大多数故障是由于不稳定的运行状态和内存退化造成的,而非模型能力不足,并强调需要更好的基础设施来支持状态管理、可观测性和自适应可靠性。
我最近一直在为企业开发 AI Agent,我认为大多数人高估了自主性,却低估了可靠性。
作者认为,在企业级 AI Agent 开发中,运行的可靠性和稳定性比高度自主性更为关键,倡导受控智能而非完全自主的系统。
我认为我们在AI代理上重蹈了早期微服务的覆辙
作者将早期的微服务热潮与当前的多智能体系统热潮进行了类比,认为工程实践——而非更好的模型——可能是实现可靠多智能体系统的关键。