过去两年我一直在努力解决AI幻觉问题,现在遇到了一个更大的麻烦
摘要
观察从应对AI幻觉转向更紧迫的生产级AI故障问题,强调企业部署中需要系统可靠性、决策追踪和限制爆炸半径。
说实话,AI幻觉确实是大家都看得见的明显问题。但为一些企业客户工作后,我发现一个更大的问题悄然浮现。现在的讨论不再是AI是否有效,而是AI的故障。因为故障不再只出现在演示中——至少我接触到的那些不是。现在你必须交付客户能在财务报表上实际看到的结果。分享一个观点:
去年:
→ 64%的十亿美元级公司因AI损失超过100万美元。平均损失:440万美元。
→ 47%的首席信息安全官目睹AI代理做了没人要求它做的事。
→ 一个AI编码助手导致生产环境中断13小时。
→ 88%的AI供应商将责任上限设为你每月的订阅费。如果出了问题,那仍然是你的问题。
现在,问AI是否会失败似乎成了错误的问题,因为每个生产级AI系统最终都会失败。真正重要的是,你是否能在客户之前发现它失败了。我们构建生产级AI系统已有一段时间,有一个问题反复出现:每个人都想要更智能的模型,但几乎没人花足够时间思考模型获得生产访问权并开始做决策后会发生什么。那往往就是事情变得昂贵的地方。
我曾与财富500强支持的企业合作过,以下是我的心得:
1/ 追踪决策过程,而不仅仅是输出。大多数团队记录模型说了什么。这有用,但当你凌晨2点调试事故时帮助不大。你需要知道模型为何得出那个答案——它检索了哪些文档、调用了哪个工具、信任了什么上下文。那通常就是问题所在。
2/ 停止只衡量模型准确率。基准分数很少导致生产中断。但能够删除数据、批准退款、触发工作流或做出业务决策的代理却会。密切监控代理被允许做什么,就像监控它们的准确率一样。这比在基准测试中再挤出2-3%重要得多。
3/ 在部署前确定爆炸半径。每个生产级AI系统都需要边界:权限限制、紧急停止开关、高风险操作的人工审批。如果一个错误就能让生产中断13小时,那通常不只是AI问题,而是系统设计问题。
4/ 不要让客户成为你的监控系统。最便宜的故障是工程师首先发现的故障;昂贵的故障是客户报告的故障。你的目标不是构建一个永不失败的AI系统,而是构建一个能尽早失败、失败可见、并且团队能理解和恢复的系统。
我真心认为这是行业的发展方向。讨论正从构建更智能的模型,慢慢转向构建更可靠的AI系统。早日认识到这一转变的公司,很可能会拥有极大的先发优势。
相似文章
你如何应对自动化中的 AI "幻觉"?
关于如何在业务自动化中处理 AI 幻觉错误的讨论,重点在于损害控制和实用的缓解策略。
部署和扩展AI agent是最令人沮丧的问题之一?
作者质疑将AI agent部署和扩展到生产环境是否是一个普遍令人沮丧的问题,并提到了诸如幻觉和状态管理等问题。
生产环境中的AI代理在使用多个工具控制真实设备时如何避免产生幻觉?
探讨了生产环境中的AI代理在使用多个工具控制真实设备时用来避免幻觉的技术。
如何提高AI代理的可靠性?
讨论将AI代理从沙箱迁移到生产环境所面临的挑战,强调高敏感性导致大量噪声,并提出解决方案,如二级评估器、启发式方法和级联架构。同时向社区询问他们的过滤方法。
学术论文和文章中越来越多出现的人工智能幻觉
一期播客节目探讨了学术论文中日益增多的AI幻觉现象,将其归因于学者们恶劣的工作条件,并警告这可能对未来研究及知识生产构成威胁。