我开始认为我们过多地将AI代理的可靠性框架化为一个可观测性问题。

Reddit r/AI_Agents 新闻

摘要

作者认为,生产环境中的AI代理可靠性不应仅关注可观测性,还应确保具有真实副作用的行为产生预期结果。

最近我遇到一个讨论,有人在构建一个语音AI代理,用于接收订单并写入生产数据库。他们的担忧是:在允许代理在生产环境中创建东西之前,如何知道对话实际上符合潜在客户资格?有人建议在写入之前添加一个分阶段/队列层,并进行确定性验证。然后另一个问题是:如果代理重试并发送完全相同的写入两次会发生什么?那个兔子洞很快就变得有趣了。因为我们现在实际上不再讨论可观测性了。我们在讨论是否可以信任代理执行具有副作用的行为。代理可以拥有完美的日志。你可以确切知道它调用了什么工具、传递了什么参数,以及API是否返回了200。系统仍然可能是错误的。数据库可能不包含代理意图的内容。潜在客户可能被创建了两次。状态转换可能在不应该发生时发生了。外部动作可能已经成功,即使代理认为它失败并重试了它。因此,代理的可靠性层可能不应只回答“代理做了什么?”还应该回答“该动作是否产生了我们实际期望的状态?”这实际上是我正在构建的一个小项目中探索的问题。对于在生产环境中运行代理的人:你们如何确保具有真实副作用的代理行为实际上是可靠的,而不仅仅是可观测的?
查看原文

相似文章

AI代理没有智能问题,它们有状态管理问题

Reddit r/AI_Agents

文章认为,AI代理在生产中的大多数故障是由于不稳定的运行状态和内存退化造成的,而非模型能力不足,并强调需要更好的基础设施来支持状态管理、可观测性和自适应可靠性。