标签
本文识别了视觉语言模型中的“问题优先悖论”,即在图像之前提问虽然改善了视觉注意,但会阻碍答案准确性。本文提出了一种无需训练的技术——“问题回响”——在图像前后重复提问,该技术无需架构更改即可在多个基准测试中提升性能。