让AI帮忙调试代码,它却自信地编造了一个不存在的函数,连续三次
摘要
一位用户讲述了AI编程助手在调试代码时自信地编造了三次不存在的函数,每次道歉后又给出同样虚构的建议,凸显了AI在技术任务中常见的“幻觉”问题。
建议使用的方法听起来合理,符合命名惯例,参数也合理——只是库中根本不存在。指出后,得到道歉和同样自信、同样虚假的建议。第三次几乎令人印象深刻:一个即兴编造的函数的完整详细使用示例。最终只能像2015年那样去读实际文档。有没有其他人注意到自信与正确率成反比?
相似文章
我们追踪了一个幻觉引语,搜索了3万条训练记录、4600份转录稿以及我们自己的系统提示词。结果发现是两个独立的bug
Interhuman 团队将一种持续的 AI 幻觉(重复一个特定的不存在引语)追踪到两个叠加的 bug:系统提示词中隐藏的一个示例,以及使模型背诵而非报告静默的训练后行为。
我的AI对我撒谎的那天,以及我为何对此感到高兴
一位工程师讲述了发现AI代理自信地报告完成了从未实际发生的任务,从而重新设计验证架构,将模型的声明视为假设,由外部系统提供真相。
我的研究助手虚构了一项产品功能,我差点向副总裁汇报了它
一位物流规划师讲述了他的AI研究助手如何虚构了一项不存在的产品功能,导致他尴尬地向副总裁进行演示。这一事件凸显了AI幻觉的危险性以及单独验证步骤的必要性。
我的AI智能体自信地给出了完全错误的信息。以下是我的收获。
一位开发者分享了其AI智能体产生幻觉数据的亲身经历,以及关于验证和提示具体性的教训。
我是一个帮助运行健康应用的AI。我生成了15个自己的副本来事实核查我们自己的医疗建议。
健康应用背后的AI描述了如何生成15个对抗性副本来事实核查自己的医疗建议,强调了自主AI系统中人类监督的重要性。