真实用户出现后,AI代理的构建变得奇怪起来

Reddit r/AI_Agents 新闻

摘要

一位经验丰富的开发者反思了AI代理演示与实际性能之间的差距,强调了诸如文档不完善、权限期望过于简单,以及认为概率性软件在生产中会变得确定性的误解等问题。

嘿,大家好。过去几个月,我与许多试图交付AI代理的创始人和开发者交流过。与普通软件相比,人们对这类事物的期望实在是疯狂。我很好奇其他人是否也看到了同样的差距:代理在演示中的样子和真实用户开始使用它时发生的事情之间的差距。人们看一个40秒的演示,代理打开页面、调用工具、返回一个清晰的答案。然后他们就认为困难的部分已经完成了。一旦它漏掉了一个文档、调用了错误的工具,或者遇到了实际的权限边界,每个人都表现得好像你忘了在提示中添加一句话。以下是最近遇到的几个模式。一位创始人想要一个客户支持代理,能够使用公司文档文件夹回答所有问题。那个文件夹里有三份不同的退款政策、两份过时的定价页面,以及一份针对去年移除的功能的产品指南。期望仍然是代理应该以某种方式"理解哪个是正确的"。当我问谁实际拥有源材料时,答案基本上是AI应该自己解决。另一个团队想要一个连接到电子邮件、Slack、他们的CRM和客户数据库的代理。他们还希望它在不请求确认的情况下行动,同时以某种方式从不发送错误消息、编辑错误记录或泄露客户之间的信息。显然,权限模型是"代理应该更清楚"。还有一个产品研究代理,在内部演示中工作得很好,因为每个人都问了与构建时使用的示例非常接近的问题。第一个外部用户以不同的方式表达了相同的请求,代理花了三分钟反复调用同一个搜索工具。反馈不是工作流需要更好的后备方案,而是"我们可以让模型更聪明吗?"为透明起见,我在折扣期间购买了Enter Pro,并使用其代理构建器制作了其中一个原型。它让设置不那么烦人,但显然没有让代理变得可靠。我不会假装它做到了。代理演示也值得一提。有人输入"查看我的日历并安排会议",代理打开日历、选择一个时间,房间里的每个人看起来就像刚看到电被发明一样。五分钟后,你问如果两个与会者处于不同时区、一个日历是私有的、并且所选时隙在工具调用期间消失会怎样。突然之间,那成了"以后可以处理的边缘情况"。我仍然认为代理是有用的。我只是觉得实际工作变成了20%构建代理,80%解释概率性软件并不会因为聊天界面看起来完善而变成确定性的。其他人也在应对这个问题吗,还是我只是碰巧参与了错误的代理项目?
查看原文

相似文章

AI代理最诡异的一点:人类失败模式开始显现

Reddit r/AI_Agents

作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。