不确定这是否有用,但这是我与AI获得一致结果的方法。
摘要
作者描述了一项为期三周的实验,测试AI代理的可靠性,发现使用相同模型的代理之间的一致性不可靠,并概述了一个需要人工批准关键决策的系统。
我花了三周时间测试一个AI代理团队是否能产出可靠的工作,而不仅仅是更多的工作。最大的发现是,当代理运行相同模型时,它们之间的一致性意义不大。我记录了那个失败案例、两个没有改进的实验、一个隐藏权限问题,以及一个代理在数据库强制通道内安全处理了21个订单台电话。随着AI竞赛的开始,每个人都专注于让代理更强大。我认为更难的问题是让它们的结果可信。我辞去了工作,开了一家网络服务公司,因为,老实说,为什么不呢。我帮助小企业和自由职业者找出AI真正有用的方面。我的代理执行大部分可观测的工作,而我保留最终判断权,并批准任何影响客户或实时业务的事项。这促使我构建一个系统,将我的运营判断转化为明确、可测试且可由AI代理重复使用的东西。大约有20个计划工人在四个工作区和三个AI供应商之间操作。它们共享一个记忆系统,但人类必须批准任何影响客户或实时业务的事项。三周内,我压力测试了该系统,并记录了哪些有效、哪些失败以及哪些最初看似有说服力的东西。最大的教训:两个AI代理达成一致并不自动意味着答案可靠。我们有两个“独立”审查员在14个决策中同意了12个。这看起来很令人印象深刻,直到我们意识到它们是同一个模型。这基本上就像同一个大脑坐在两把椅子上。添加不同的模型将使未来的比较有意义,但它不能让旧的结果在事后变得更可信。其他一些发现:我们以为一个工人没有访问账户凭证的权限。然后它揭示出其会话已悄悄继承了大约100个连接器工具。我们早期的审计错过了这些,因为我们是从操作员的计算机检查的,而不是从工人实际环境的内部检查的。一个精心挑选的13 KB操作原则集胜过一个包含所有直接相关源材料的20 KB包。较大的包甚至包含了避免错误所需的确切规则——但仍然犯了两次错误。给AI正确的信息并不意味着它会应用它。两个严格控制的实验没有产生可衡量的改进。我们没有从它们中发布任何内容,但在报告中包含了失败案例。隐藏其失误的记录在声称胜利时无法被信任。GrokBot现在帮助运行我们的订单台。它不能直接更改任何内容;它只能准备提案供人工批准。它的限制是由数据库本身强制执行的,而不仅仅是写在提示中。在其第一个班次中,它处理了21个电话,没有尝试任何超出其通道的事项。我将结果整理成三篇论文:案例研究展示了发生的事情。技术报告解释了如何重建和测试系统。白皮书解释了背后更大的理念。链接在下面的评论中
相似文章
AI代理在什么时候变得足够有用,可以信任它处理实际工作?
文章讨论了信任AI代理处理现实任务的标准,质疑实用性与风险之间的平衡,并寻求用户在实际工作流程中的见解。
AI代理最诡异的一点:人类失败模式开始显现
作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。
哪些条件会让你愿意将重要的商业工作托付给AI代理?
本文探讨了超越模型智能之外,要在真实商业工作中信任AI代理所需的关键因素,包括可靠性、错误处理与透明度等。
我一直在思考,AI代理在做重要决策时是否应该只依赖单个模型。
作者在某个研究任务上对多个AI模型进行了对比测试,发现模型有时会自信地给出不同答案。他们建议,对于规划、代码审查或研究等重要决策,AI代理应考虑多个模型的观点,并询问他人如何处理这一问题。
当多个模型参与时,AI代理感觉更加可靠
探索如何使用多个AI模型进行代理工作流,揭示隐藏的不确定性和推理差距,表明未来的系统可能依赖跨模型共识而非单模型链。