视觉-语言模型中提示诱导幻觉的机制研究

arXiv cs.CL 论文

摘要

本文通过机制分析研究视觉-语言模型中的提示诱导幻觉,识别出导致模型偏向文本提示而忽视视觉证据的特定注意力头。作者证明了删除这些PIH头可以在无需额外训练的情况下减少至少40%的幻觉,揭示了该故障模式背后的模型特定机制。

arXiv:2601.05201v2 公告类型:交叉替换 摘要:大型视觉-语言模型(VLM)功能强大,但经常通过偏向文本提示而忽视视觉证据而产生幻觉。我们在一个受控的物体计数设置中研究了这种故障模式,其中提示言过其实了图像中的物体数量(例如,当只有三朵睡莲时,要求模型描述四朵睡莲)。在物体数量较少时,模型通常会纠正高估,但随着物体数量增加,它们越来越多地遵循提示,不管差异有多大。通过对三个VLM的机制分析,我们识别了一小组注意力头,删除它们可以在无需额外训练的情况下将提示诱导幻觉(PIH)减少至少40%。跨模型来看,PIH头以模型特定的方式调解提示复制。我们表征了这些差异,并展示了PIH删除如何增加对视觉证据的纠正。我们的发现为驱动提示诱导幻觉的内部机制提供了见解,揭示了这些行为在不同模型中实现方式的差异。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:33

# 视觉-语言模型中提示诱导幻觉的机制
来源:https://arxiv.org/abs/2601.05201
查看PDF (https://arxiv.org/pdf/2601.05201)

> 摘要:大型视觉-语言模型(VLMs)虽然能力强大,但往往会因为偏向文本提示而忽视视觉证据,从而产生幻觉。我们在受控的物体计数设置中研究了这一失效模式,其中提示高估了图像中物体的数量(例如,当只有三朵睡美莲时,要求模型描述四朵)。在物体数量较少时,模型通常会纠正高估,但随着物体数量增加,它们越来越倾向于符合提示,而不管偏差有多大。通过对三个VLM的机制分析,我们识别了少量注意力头,其消融在不需要额外训练的情况下能将提示诱导幻觉(PIH)减少至少40%。在各个模型中,PIH头以特定于模型的方式介导提示复制。我们刻画了这些差异,并展示PIH消融增强了对视觉证据的纠正。我们的发现深入了解了驱动提示诱导幻觉的内部机制,揭示了这些行为在不同模型中实现方式的特定差异。

## 提交历史

来自:William Rudman Jr [查看邮箱 (https://arxiv.org/show-email/22c8a476/2601.05201)] **[[v1]](https://arxiv.org/abs/2601.05201v1)**周四,2026年1月8日 18:23:03 UTC (4,825 KB) **[v2]**周五,2026年4月17日 15:14:39 UTC (4,822 KB)

相似文章

拆解病态捷径:用于忠实LVLM解码的因果框架

arXiv cs.AI

本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。

模态冲突幻觉中注意力头不平衡的因果证据

arXiv cs.AI

本文识别了MLLMs中不平衡的注意力头组,这些头组驱动或抵抗模态冲突幻觉,并提出了MACI(模态冲突感知因果干预),一种仅在检测到冲突时抑制幻觉驱动头的因果干预方法,在五个模型上实现了大幅的幻觉减少。