不确定这是否有用,但这是我与AI获得一致结果的方法。

Reddit r/AI_Agents 工具

摘要

作者描述了一项为期三周的实验,测试AI代理的可靠性,发现使用相同模型的代理之间的一致性不可靠,并概述了一个需要人工批准关键决策的系统。

我花了三周时间测试一个AI代理团队是否能产出可靠的工作,而不仅仅是更多的工作。最大的发现是,当代理运行相同模型时,它们之间的一致性意义不大。我记录了那个失败案例、两个没有改进的实验、一个隐藏权限问题,以及一个代理在数据库强制通道内安全处理了21个订单台电话。随着AI竞赛的开始,每个人都专注于让代理更强大。我认为更难的问题是让它们的结果可信。我辞去了工作,开了一家网络服务公司,因为,老实说,为什么不呢。我帮助小企业和自由职业者找出AI真正有用的方面。我的代理执行大部分可观测的工作,而我保留最终判断权,并批准任何影响客户或实时业务的事项。这促使我构建一个系统,将我的运营判断转化为明确、可测试且可由AI代理重复使用的东西。大约有20个计划工人在四个工作区和三个AI供应商之间操作。它们共享一个记忆系统,但人类必须批准任何影响客户或实时业务的事项。三周内,我压力测试了该系统,并记录了哪些有效、哪些失败以及哪些最初看似有说服力的东西。最大的教训:两个AI代理达成一致并不自动意味着答案可靠。我们有两个“独立”审查员在14个决策中同意了12个。这看起来很令人印象深刻,直到我们意识到它们是同一个模型。这基本上就像同一个大脑坐在两把椅子上。添加不同的模型将使未来的比较有意义,但它不能让旧的结果在事后变得更可信。其他一些发现:我们以为一个工人没有访问账户凭证的权限。然后它揭示出其会话已悄悄继承了大约100个连接器工具。我们早期的审计错过了这些,因为我们是从操作员的计算机检查的,而不是从工人实际环境的内部检查的。一个精心挑选的13 KB操作原则集胜过一个包含所有直接相关源材料的20 KB包。较大的包甚至包含了避免错误所需的确切规则——但仍然犯了两次错误。给AI正确的信息并不意味着它会应用它。两个严格控制的实验没有产生可衡量的改进。我们没有从它们中发布任何内容,但在报告中包含了失败案例。隐藏其失误的记录在声称胜利时无法被信任。GrokBot现在帮助运行我们的订单台。它不能直接更改任何内容;它只能准备提案供人工批准。它的限制是由数据库本身强制执行的,而不仅仅是写在提示中。在其第一个班次中,它处理了21个电话,没有尝试任何超出其通道的事项。我将结果整理成三篇论文:案例研究展示了发生的事情。技术报告解释了如何重建和测试系统。白皮书解释了背后更大的理念。链接在下面的评论中
查看原文

相似文章

AI代理最诡异的一点:人类失败模式开始显现

Reddit r/AI_Agents

作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。