过去两年我一直在努力解决AI幻觉问题,现在遇到了一个更大的麻烦

Reddit r/AI_Agents 新闻

摘要

观察从应对AI幻觉转向更紧迫的生产级AI故障问题,强调企业部署中需要系统可靠性、决策追踪和限制爆炸半径。

说实话,AI幻觉确实是大家都看得见的明显问题。但为一些企业客户工作后,我发现一个更大的问题悄然浮现。现在的讨论不再是AI是否有效,而是AI的故障。因为故障不再只出现在演示中——至少我接触到的那些不是。现在你必须交付客户能在财务报表上实际看到的结果。分享一个观点: 去年: → 64%的十亿美元级公司因AI损失超过100万美元。平均损失:440万美元。 → 47%的首席信息安全官目睹AI代理做了没人要求它做的事。 → 一个AI编码助手导致生产环境中断13小时。 → 88%的AI供应商将责任上限设为你每月的订阅费。如果出了问题,那仍然是你的问题。 现在,问AI是否会失败似乎成了错误的问题,因为每个生产级AI系统最终都会失败。真正重要的是,你是否能在客户之前发现它失败了。我们构建生产级AI系统已有一段时间,有一个问题反复出现:每个人都想要更智能的模型,但几乎没人花足够时间思考模型获得生产访问权并开始做决策后会发生什么。那往往就是事情变得昂贵的地方。 我曾与财富500强支持的企业合作过,以下是我的心得: 1/ 追踪决策过程,而不仅仅是输出。大多数团队记录模型说了什么。这有用,但当你凌晨2点调试事故时帮助不大。你需要知道模型为何得出那个答案——它检索了哪些文档、调用了哪个工具、信任了什么上下文。那通常就是问题所在。 2/ 停止只衡量模型准确率。基准分数很少导致生产中断。但能够删除数据、批准退款、触发工作流或做出业务决策的代理却会。密切监控代理被允许做什么,就像监控它们的准确率一样。这比在基准测试中再挤出2-3%重要得多。 3/ 在部署前确定爆炸半径。每个生产级AI系统都需要边界:权限限制、紧急停止开关、高风险操作的人工审批。如果一个错误就能让生产中断13小时,那通常不只是AI问题,而是系统设计问题。 4/ 不要让客户成为你的监控系统。最便宜的故障是工程师首先发现的故障;昂贵的故障是客户报告的故障。你的目标不是构建一个永不失败的AI系统,而是构建一个能尽早失败、失败可见、并且团队能理解和恢复的系统。 我真心认为这是行业的发展方向。讨论正从构建更智能的模型,慢慢转向构建更可靠的AI系统。早日认识到这一转变的公司,很可能会拥有极大的先发优势。
查看原文

相似文章

如何提高AI代理的可靠性?

Reddit r/AI_Agents

讨论将AI代理从沙箱迁移到生产环境所面临的挑战,强调高敏感性导致大量噪声,并提出解决方案,如二级评估器、启发式方法和级联架构。同时向社区询问他们的过滤方法。