我的研究助手虚构了一项产品功能,我差点向副总裁汇报了它

Reddit r/AI_Agents 新闻

摘要

一位物流规划师讲述了他的AI研究助手如何虚构了一项不存在的产品功能,导致他尴尬地向副总裁进行演示。这一事件凸显了AI幻觉的危险性以及单独验证步骤的必要性。

我从事物流规划工作。几周前,我的团队正在评估一个货运代理平台以进行销售审核,我让我的研究助手总结该供应商的欧盟合规功能。它给出的总结看起来相当可靠。其中有一项功能格外引人注目,类似于“动态报关路由器”,据称可以实时自动处理税务申报。我未经核对就直接把它粘贴到了演示文稿中。在审核会上,我们的副总裁停在了那一页幻灯片上。他一年前才从那家航运公司离职。他说这个功能从未被实现过,那只是2023年因为海关规定而被否决的一个头脑风暴想法。我当时恨不得找个地缝钻进去。那天剩下的时间我都在发送更正邮件并重做演示文稿。最让我耿耿于怀的是,这个助手并不是以一种显而易见的方式猜错。它的错误非常具体、非常逼真。当我让它核实的时候,它因为读取了自己之前的输出而更加坚持错误。相同的模型、相同的提示窗口、相同的盲点。从那时起我一直在重建工作流程。我最终定下的规则很简单:负责生成答案的东西不能同时负责检查它。如果你想要真正的核查,必须分开运行,最好使用不同的上下文、不同的搜索,并且不记得最初的答案。有个朋友提到了一款名为Apodex的新代理验证工具,正是基于这种分离设计的,但老实说,你自己用两次不同的模型调用加上一些网络搜索也能做到同样的事。光是这份尴尬就足以让我从现在开始手动验证一切了。
查看原文

相似文章