标签
本文研究视觉-语言模型如何解决视觉证据与世界知识之间的冲突,揭示了视觉基础是默认的,而先验知识依赖于一小部分位于后层的注意力头。作者在三个VLM系列上进行因果分析,展示了一种不对称结构:消融这些头部会使得预测从基于知识的答案转向基于视觉的答案。