标签
本文介绍了Visual Access Sweep,一种因果干预方法,用于衡量视觉语言模型推理所需的最小图像标记访问量,并发现思维链(Chain-of-Thought)提示并非主要通过延长直接图像访问来提升性能,而是通过在视觉信息上扩展语言侧计算来实现。