我的研究助手虚构了一项产品功能,我差点向副总裁汇报了它
摘要
一位物流规划师讲述了他的AI研究助手如何虚构了一项不存在的产品功能,导致他尴尬地向副总裁进行演示。这一事件凸显了AI幻觉的危险性以及单独验证步骤的必要性。
我从事物流规划工作。几周前,我的团队正在评估一个货运代理平台以进行销售审核,我让我的研究助手总结该供应商的欧盟合规功能。它给出的总结看起来相当可靠。其中有一项功能格外引人注目,类似于“动态报关路由器”,据称可以实时自动处理税务申报。我未经核对就直接把它粘贴到了演示文稿中。在审核会上,我们的副总裁停在了那一页幻灯片上。他一年前才从那家航运公司离职。他说这个功能从未被实现过,那只是2023年因为海关规定而被否决的一个头脑风暴想法。我当时恨不得找个地缝钻进去。那天剩下的时间我都在发送更正邮件并重做演示文稿。最让我耿耿于怀的是,这个助手并不是以一种显而易见的方式猜错。它的错误非常具体、非常逼真。当我让它核实的时候,它因为读取了自己之前的输出而更加坚持错误。相同的模型、相同的提示窗口、相同的盲点。从那时起我一直在重建工作流程。我最终定下的规则很简单:负责生成答案的东西不能同时负责检查它。如果你想要真正的核查,必须分开运行,最好使用不同的上下文、不同的搜索,并且不记得最初的答案。有个朋友提到了一款名为Apodex的新代理验证工具,正是基于这种分离设计的,但老实说,你自己用两次不同的模型调用加上一些网络搜索也能做到同样的事。光是这份尴尬就足以让我从现在开始手动验证一切了。
相似文章
我的AI智能体自信地给出了完全错误的信息。以下是我的收获。
一位开发者分享了其AI智能体产生幻觉数据的亲身经历,以及关于验证和提示具体性的教训。
我的AI对我撒谎的那天,以及我为何对此感到高兴
一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。
让AI帮忙调试代码,它却自信地编造了一个不存在的函数,连续三次
一位用户讲述了AI编程助手在调试代码时自信地编造了三次不存在的函数,每次道歉后又给出同样虚构的建议,凸显了AI在技术任务中常见的“幻觉”问题。
我的智能体不停撒谎,于是我让它们展示工作过程
作者描述构建了一个‘门控’,记录工具调用并验证AI智能体回答中的声明是否对应实际日志条目,迫使智能体展示其工作过程,从而减少幻觉回答。
KPMG报告关于AI益处的描述出现AI幻觉
一份关于AI益处的KPMG报告包含了主要组织使用AI的捏造案例,凸显了专业咨询中AI幻觉的风险。