AI能做的最具“智能体”特质的事,是知道何时停止。

Reddit r/AI_Agents 新闻

摘要

一位实践者认为,自主AI智能体在生产环境中并不可靠,主张采用受限的智能体工作流,并在其中加入人工介入触发器,而非完全自主。

我们花了数周时间试图让一个智能体端到端地处理复杂的数据对账任务。我们给了它所有工具、长期记忆,以及一个“自我修正”循环。在沙箱中它看起来非常出色,我们扔给它的每个边缘情况它都能处理。但在生产环境中,它却是一场噩梦。不是因为它无法完成任务,而是因为它不知道如何失败。它会遇到一个轻微的API速率限制,然后“推理”出该端点已被弃用,接着花15分钟(以及大量token)通过幻觉生成新配置来“修复”自己的环境。我们后来转向了。我们去掉了自主性。现在,这个智能体只是一系列小而受限的步骤,并且在工具连续失败两次或不确定性阈值飙升时,会触发一个硬性的“人在回路”开关。我们不再构建“自主智能体”,而是开始构建“智能体工作流”,其中LLM只是一个智能路由器,而不是飞行员。感觉我们过度看重“自主性”了,因为这让演示效果更好,但实际上,一个会主动求助的“黏人”智能体,才是我唯一敢把生产数据托付给它的。自主智能体试图调试自己幻觉的“死亡螺旋”,是一种特殊的技术债。还有人觉得“完全自主”的梦想实际上就是生产可靠性的大坑吗?或者你们真的看到让智能体在真实环境中自由奔跑的成功案例了吗?
查看原文

相似文章