标签
介绍了ENTRAP-VL,这是一个由1500个条目构成的分类结构化数据集,用于探测视觉语言模型中的语境夹带现象,并研究文本语境与视觉语境如何独立影响模型输出。
本文将上下文夹带从标记级扩展到句子级,表明提示中的反事实句子在推理时也会增加其概率。该效应随模型规模增大而减弱,且由2-4%的注意力头驱动,这些注意力头可被消融而不影响性能。