我们追踪了一个幻觉引语,搜索了3万条训练记录、4600份转录稿以及我们自己的系统提示词。结果发现是两个独立的bug

Reddit r/artificial 新闻

摘要

Interhuman 团队将一种持续的 AI 幻觉(重复一个特定的不存在引语)追踪到两个叠加的 bug:系统提示词中隐藏的一个示例,以及使模型背诵而非报告静默的训练后行为。

我们的一些客户注意到 Inter-1(我们的全模态社交信号模型)偶尔会“听到”一句不存在的引语。输入一段没有音频的视频并询问说了什么,它有时会回答:“Yeah, Friday at five.” 一字不差。每次都是同一句话。我们以为这句话肯定藏在训练数据中的某个地方,于是我们到处搜索:30960 条包含日期时间引用的训练记录 → 该短语命中数为 0;4603 份视频转录稿 → 命中数为 0;约 800 个推理探针、584 个存储对象 → 命中数为 0。结果发现这句话就藏在我们的系统提示词里——我们写的一个示例,用于向模型展示期望的输出格式,埋在了我们 GEPA 提示词优化器发布的一个版本中。但这只解释了这些词语从何而来,没有解释为什么模型会在完全静默时说出它们。于是我们在内部评估框架中进行了两次消融实验:交换词语,保留模型:将提示词中的示例改为“Tuesday at noon.” 捏造率上升(37%→50%),且编造的引语完全跟随了交换——从 Friday 变成了 Tuesday。交换模型,保留提示词:将相同的字节完全相同提示词用于更大的变体以及我们自己模型的一个早期检查点。它们几乎不捏造(0–2%)。只有经过进一步训练后处理的 Inter-1 在约 12% 的情况下虚构了内容。所以这不是一个 bug,而是两个叠加的先验:提示词提供了脚本,但训练后的处理赋予了模型强制背诵某些内容而非报告静默的冲动。删除提示词中的示例可以阻止那一句话——但它不会阻止模型编造其他对话。我们认为这是已有所记载的视觉先验“聪明的汉斯效应”(模型在无声滑板摔倒时写出“thud”)的一个文本/上下文变体——只不过我们的例子表明,同样的反应会被上下文窗口中最近的内容所措辞,而仅靠视觉诊断无法捕捉到这一点。包含捏造率森林图和日志数据的完整文章:https://www.interhuman.ai/blog/goblin-yeah-friday-at-five
查看原文

相似文章

为什么语言模型会产生幻觉

OpenAI Blog

OpenAI发布研究指出,语言模型产生幻觉的原因在于标准的训练和评估程序奖励猜测而不是承认不确定性,并建议评估指标应该优先考虑对局限性的诚实认识而不是原始准确率。