视觉-语言模型中提示诱导幻觉的机制研究
摘要
本文通过机制分析研究视觉-语言模型中的提示诱导幻觉,识别出导致模型偏向文本提示而忽视视觉证据的特定注意力头。作者证明了删除这些PIH头可以在无需额外训练的情况下减少至少40%的幻觉,揭示了该故障模式背后的模型特定机制。
arXiv:2601.05201v2 公告类型:交叉替换
摘要:大型视觉-语言模型(VLM)功能强大,但经常通过偏向文本提示而忽视视觉证据而产生幻觉。我们在一个受控的物体计数设置中研究了这种故障模式,其中提示言过其实了图像中的物体数量(例如,当只有三朵睡莲时,要求模型描述四朵睡莲)。在物体数量较少时,模型通常会纠正高估,但随着物体数量增加,它们越来越多地遵循提示,不管差异有多大。通过对三个VLM的机制分析,我们识别了一小组注意力头,删除它们可以在无需额外训练的情况下将提示诱导幻觉(PIH)减少至少40%。跨模型来看,PIH头以模型特定的方式调解提示复制。我们表征了这些差异,并展示了PIH删除如何增加对视觉证据的纠正。我们的发现为驱动提示诱导幻觉的内部机制提供了见解,揭示了这些行为在不同模型中实现方式的差异。
查看缓存全文
缓存时间: 2026/04/20 08:33
# 视觉-语言模型中提示诱导幻觉的机制 来源:https://arxiv.org/abs/2601.05201 查看PDF (https://arxiv.org/pdf/2601.05201) > 摘要:大型视觉-语言模型(VLMs)虽然能力强大,但往往会因为偏向文本提示而忽视视觉证据,从而产生幻觉。我们在受控的物体计数设置中研究了这一失效模式,其中提示高估了图像中物体的数量(例如,当只有三朵睡美莲时,要求模型描述四朵)。在物体数量较少时,模型通常会纠正高估,但随着物体数量增加,它们越来越倾向于符合提示,而不管偏差有多大。通过对三个VLM的机制分析,我们识别了少量注意力头,其消融在不需要额外训练的情况下能将提示诱导幻觉(PIH)减少至少40%。在各个模型中,PIH头以特定于模型的方式介导提示复制。我们刻画了这些差异,并展示PIH消融增强了对视觉证据的纠正。我们的发现深入了解了驱动提示诱导幻觉的内部机制,揭示了这些行为在不同模型中实现方式的特定差异。 ## 提交历史 来自:William Rudman Jr [查看邮箱 (https://arxiv.org/show-email/22c8a476/2601.05201)] **[[v1]](https://arxiv.org/abs/2601.05201v1)**周四,2026年1月8日 18:23:03 UTC (4,825 KB) **[v2]**周五,2026年4月17日 15:14:39 UTC (4,822 KB)
相似文章
从架构到输出:大型语言模型中幻觉的结构根源及数据的放大作用
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
理解语言模型为何产生幻觉:测试推理与先验知识之间的对抗
本文研究语言模型产生幻觉的原因,提出幻觉通常源于有偏的潜在推理(推理失配),而非知识缺失。它引入了TrapQA,一个受控的诊断测试平台,用于测试推理与先验知识之间的对抗,并证明幻觉可能源于误导性的潜在关联。
幻觉作为特性而非缺陷:评估多智能体架构将推测性语言模型输出转化为可测试科学假设的能力
本文提出了一种基于Rust的多智能体架构,利用LLM幻觉作为特性来生成和评估科学假设,并将其性能与直接提示和其他方法进行比较。
拆解病态捷径:用于忠实LVLM解码的因果框架
本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。
模态冲突幻觉中注意力头不平衡的因果证据
本文识别了MLLMs中不平衡的注意力头组,这些头组驱动或抵抗模态冲突幻觉,并提出了MACI(模态冲突感知因果干预),一种仅在检测到冲突时抑制幻觉驱动头的因果干预方法,在五个模型上实现了大幅的幻觉减少。