LVLMs 能否揭示视觉错觉背后的真相?感知与推理能力分析

arXiv cs.CL 论文

摘要

本文介绍了 IllusionReasoning,一个使用真实世界视觉错觉的基准,用于联合评估大型视觉语言模型(LVLMs)的感知和推理能力,发现当前模型的推理能力并不像声称的那样先进。

arXiv:2607.27747v1 公告类型:新 摘要:大型视觉语言模型已整合推理能力,将认知性能提升到新水平。然而,现有评估要么仅关注感知,要么依赖数学或编程等特定领域。仍然需要与开放世界环境相一致的推理能力评估,尤其是将感知和推理联合考虑的评估。为弥补这一差距,我们提出利用视觉错觉作为诊断工具来评估 LVLMs。视觉错觉是人类视觉系统误解客观信号,导致理解偏离现实的现象。我们构建了 IllusionReasoning,这是一个从现实世界收集的错觉图像基准,包含多样化的带标注问答对。基于 IllusionReasoning,我们表明多种 LVLMs 的推理能力并不像声称的那样先进。我们的工作为 LVLMs 提供了新见解,并为优化提供了未来方向。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:02

# 大型视觉语言模型能否揭开视觉错觉背后的真相?感知与推理能力分析
来源:https://arxiv.org/html/2607.27747
梁杰赵¹ 佳庆吕⁴ 可欣唐⁵ 泽成方³ 荣尹⁶ 玉兰胡⁵ 达李²,³ 佳宁李²,³††脚注:¹阿德莱德大学 ²中国科学院计算技术研究所人工智能安全国家重点实验室 ³中国科学院大学 ⁴清华大学 ⁵高德,阿里巴巴集团 ⁶北京航空航天大学 zhaoliangjie55@gmail\.com, lida\.ucas@gmail\.com, lijianing@ict\.ac\.cn

###### 摘要

大型视觉语言模型已整合推理能力,将认知表现提升至新的水平。然而,现有评估要么仅关注感知,要么依赖于数学或编程等特定领域。仍需要与开放世界环境对齐的推理能力评估,尤其是需要同时考虑感知与推理的评估。为了弥合这一差距,我们提出利用视觉错觉作为诊断工具来评估LVLMs。视觉错觉是人类视觉系统在特定视觉条件下误解客观信号,从而导致对现实的理解产生偏离的现象。我们构建了 IllusionReasoning,这是一个从现实世界收集的错觉图像基准,包含了多样化的带标注问答对。基于 IllusionReasoning,我们发现广泛使用的LVLMs的推理能力并未如其宣称的那样先进。我们的工作为LVLMs提供了新的见解,并为未来的优化指明了方向。

大型视觉语言模型能否揭开视觉错觉背后的真相?感知与推理能力分析

梁杰赵¹ 佳庆吕⁴ 可欣唐⁵ 泽成方³ 荣尹⁶ 玉兰胡⁵ 达李²,³††感谢:通讯作者。佳宁李²,³††脚注:¹阿德莱德大学 ²中国科学院计算技术研究所人工智能安全国家重点实验室 ³中国科学院大学 ⁴清华大学 ⁵高德,阿里巴巴集团 ⁶北京航空航天大学 zhaoliangjie55@gmail\.com, lida\.ucas@gmail\.com, lijianing@ict\.ac\.cn

## 1 引言

大型视觉语言模型(LVLMs)(OpenAI,2024(https://arxiv.org/html/2607.27747#bib.bib7);Bai等人,2025(https://arxiv.org/html/2607.27747#bib.bib8))通过将视觉感知模块与大型语言模型(LLMs)的语言建模能力相结合(Meta-AI,2025(https://arxiv.org/html/2607.27747#bib.bib1);OpenAI等人,2024b(https://arxiv.org/html/2607.27747#bib.bib5);Yang等人,2025(https://arxiv.org/html/2607.27747#bib.bib6)),在视觉问答和多模态对话等任务中展现出卓越表现。在此基础之上,LVLMs通过思维链(Chain-of-Thought)和强化学习等策略进一步整合推理能力,实现了类似于人类的思维水平,例如 OpenAI-o1(OpenAI等人,2024a(https://arxiv.org/html/2607.27747#bib.bib31))和 DeepSeek-R1(DeepSeek-AI等人,2025(https://arxiv.org/html/2607.27747#bib.bib30))等模型。这种整合使LVLMs能够处理诸如逻辑视觉问答等复杂任务,将其能力提升到新的水平。

随着能力的提升,对LVLMs的评估正转向追求多任务上的全面竞争力(Liu等人,2024(https://arxiv.org/html/2607.27747#bib.bib2);Chen等人,2024a(https://arxiv.org/html/2607.27747#bib.bib3);Cheng等人,2025(https://arxiv.org/html/2607.27747#bib.bib4))。然而,这些评估框架最初侧重于感知。随着诸如Qwen3-VL(Bai等人,2025(https://arxiv.org/html/2607.27747#bib.bib8))等LVLMs整合推理能力,评估开始关注它们在OlympiadBench(He等人,2024(https://arxiv.org/html/2607.27747#bib.bib45))和MathVista(Lu等人,2024b(https://arxiv.org/html/2607.27747#bib.bib46))等复杂任务上的推理表现。然而,这种针对特定领域的评估不足以全面捕捉LVLMs真正的推理能力。核心原因在于它们在这些特定领域之外的覆盖范围有限。迫切需要与开放世界环境中复杂逻辑场景紧密对齐的评估范式,以更好地评估LVLMs的推理能力。视觉错觉天然地满足这些需求。

视觉错觉(Gregory,1968(https://arxiv.org/html/2607.27747#bib.bib49),1997(https://arxiv.org/html/2607.27747#bib.bib48);Bach 和 Poloschek,2006(https://arxiv.org/html/2607.27747#bib.bib47))指的是视觉感知与认知现实相冲突的现象,其根本源于人类直觉中的偏差。作为开放世界中视觉认知冲突的普遍场景,视觉错觉包含了来自真实世界环境的多样化输入。回答与错觉相关的问题需要LVLMs调用跨模态常识、因果逻辑和认知推理能力,以辨别视觉现象背后的潜在逻辑(Sun 和 Dekel,2021(https://arxiv.org/html/2607.27747#bib.bib50))。已有一些工作聚焦于将错觉相关内容作为LVLMs的评估基准。这些研究通常选择经典视觉错觉,如穆勒-莱尔线段错觉(García-Garibay 和 de Lafuente,2015(https://arxiv.org/html/2607.27747#bib.bib51))和彭罗斯三角空间悖论(Plotnitsky,1997(https://arxiv.org/html/2607.27747#bib.bib52))。通过设计诸如“图像中的两条线段长度实际上是否相等?”或“这个三维图形能否存在于真实物理空间中?”等问题,这些研究利用输出结果来评估LVLMs能否克服误导性的视觉表象,而不是仅仅依赖原始视觉特征得出结论(Zhang等人,2025(https://arxiv.org/html/2607.27747#bib.bib41);Shahgir等人,2024(https://arxiv.org/html/2607.27747#bib.bib40);Zhang等人,2023(https://arxiv.org/html/2607.27747#bib.bib42))。

上述评估主要关注LVLMs的感知能力。在本工作中,我们尝试通过视觉错觉直接分析LVLMs的感知和推理能力。首先,我们构建了 IllusionReasoning,一个来自真实世界的视觉错觉基准。然后,基于这些图像,我们鼓励人类标注者在以下维度提出问题并提供答案:(1)检测:给定一个物体,LVLMs能否判断它是否出现在图像中?(2)描述:LVLMs如何描述错觉图像?(3)错觉成因:在告知视觉错觉内容的情况下,LVLMs能否解释其成因?在构建 IllusionReasoning 之后,我们旨在从不同角度评估LVLMs:(1)视觉物体识别:LVLMs是否具备基本的图像理解能力?(2)对齐偏好:LVLMs更倾向于人类直觉还是物理世界?(3)推理:LVLMs能否分析错觉与物理世界不一致的原因?在这些角度中,前两个旨在评估感知能力,而最后一个旨在评估推理能力。

我们在 IllusionReasoning 上评估了广泛的LVLMs,包括不同规模的开源和闭源模型。我们发现,即使是最先进的LVLMs也难以对与视觉错觉相关的问题提供正确回答。我们还从多个角度进行了全面分析,包括问题类别、对齐偏好和推理能力。我们发现,LVLMs在不同任务上并不总能从它们的思考模式中获益。在简单的推理相关任务中,过度思考可能会损害性能。此外,当面对难题时,LVLMs倾向于生成安全回答,以避免对有歧义的内容做出断言。这会损害错觉识别的性能,并且在现有的对齐范式下可能难以避免。需要精细化的策略来缓解这一现象并增强LVLMs的能力。

总之,我们的贡献如下:

- •我们收集并构建了 IllusionReasoning,一个来自真实世界的视觉错觉基准,用于评估LVLMs的感知和推理能力。
- •我们对广泛使用的LVLMs进行了全面评估。结果表明,这些模型的推理能力并不如其宣称的那样出色。
- •我们从多个维度分析了LVLMs的感知和推理能力,为后续优化提供了方向。

## 2 相关工作

### 2\.1 大型视觉语言模型

通过将大型语言模型(LLMs)的语义推理能力与视觉编码器的感知能力相结合,大型视觉语言模型(LVLMs)在视觉问答和具身智能方面表现出强大的性能(Lu等人,2024a(https://arxiv.org/html/2607.27747#bib.bib11);Huang等人,2024(https://arxiv.org/html/2607.27747#bib.bib12))。LVLMs通常由三个组件组成:视觉编码器、连接器和LLM。作为LVLMs的核心,视觉编码器通常基于ViT(Dosovitskiy,2020(https://arxiv.org/html/2607.27747#bib.bib14)),将原始视觉输入处理为高维视觉特征。然后,需要一个跨模态对齐连接器,将来自视觉编码器的视觉特征投射到文本空间中,使LLM能够将视觉数据解释为文本标记(Liu等人,2023(https://arxiv.org/html/2607.27747#bib.bib15);Chen等人,2024b(https://arxiv.org/html/2607.27747#bib.bib16);Zhao等人,2025(https://arxiv.org/html/2607.27747#bib.bib19);Zhu等人,2023(https://arxiv.org/html/2607.27747#bib.bib18))。这种转换赋予LLM视觉能力,使其能够完成与视觉相关的任务。

### 2\.2 幻觉评估

幻觉是LVLMs在现实场景中应用的主要障碍。现有基准已从简单的对象级别评估发展为更复杂的属性和关系评估(Bai等人(2024(https://arxiv.org/html/2607.27747#bib.bib27)))。POPE(Li等人,2023(https://arxiv.org/html/2607.27747#bib.bib21))建立了一个对象存在性基准,而AMBER Wang等人(2023(https://arxiv.org/html/2607.27747#bib.bib44))将评估范围扩展到衡量关于属性和关系的幻觉。最近,PhD(Liu等人,2025(https://arxiv.org/html/2607.27747#bib.bib36))引入了一种ChatGPT提示的基准设计,并扩展了评估视角。然而,这些幻觉基准主要关注感知能力,缺乏专门针对推理能力评估的设计。

### 2\.3 错觉评估

LVLMs中的错觉诱发错误被视为一种特殊类型的幻觉,很少有工作专门评估错觉。GVIL Zhang等人(2023(https://arxiv.org/html/2607.27747#bib.bib42))开创了这一领域,评估了五种经典错觉类型下模型与人类的对齐程度。HallusionBench Guan等人(2024(https://arxiv.org/html/2607.27747#bib.bib43))引入了视觉对照组,以解耦视觉误感知与语言先验。IllusionVQA Shahgir等人(2024(https://arxiv.org/html/2607.27747#bib.bib40))将范围扩展到12个类别,并引入了用于几何不一致性的软定位。最近,IllusionBench+ Zhang等人(2025(https://arxiv.org/html/2607.27747#bib.bib41))通过“陷阱错觉”和色盲测试扩大了评估规模,以识别捷径学习行为。尽管取得了这些进展,现有数据集主要依赖固定的问题格式,使得模型可以利用随机猜测或语言捷径,而无需展示真正的视觉理解。此外,关于视觉数据本身,最近的机制研究 Ullman(2024(https://arxiv.org/html/2607.27747#bib.bib59));Shinozaki等人(2025(https://arxiv.org/html/2607.27747#bib.bib58))使用“反错觉”来确认错觉错误主要是先验驱动的推理错误,而非感知错误。这意味着模型在处理经典或合成错觉时会严重依赖记忆化的知识。因此,在这些合成图像上进行评估无法准确衡量真实的视觉感知和推理能力。

## 3 为什么我们需要 IllusionReasoning?

### 3\.1 模型能力:从感知到推理

LVLMs的演进展示了从感知处理到复杂推理能力的转变。以LLaVA(Liu等人,2023(https://arxiv.org/html/2607.27747#bib.bib15))和InternVL(Chen等人,2024b(https://arxiv.org/html/2607.27747#bib.bib16))为代表的LVLMs获得了基础的感知能力,能够处理图像-文本匹配和简单视觉问答等任务。然而,它们仍局限于对模态信息的表面理解。随着LLMs在文本推理方面的突破,一些研究开始探索将思维链(CoT)推理范式适配到视觉语言任务中。这种适配催生了诸如LLaVA-CoT(Xu等人,2025(https://arxiv.org/html/2607.27747#bib.bib28))和Insight-V(Dong等人,2025(https://arxiv.org/html/2607.27747#bib.bib29))等模型,它们展示了初步的推理能力。这种演进在GPT-5.5(OpenAI,2026(https://arxiv.org/html/2607.27747#bib.bib53))和DeepSeek-V4(DeepSeek-AI,2026(https://arxiv.org/html/2607.27747#bib.bib54))等LLM中达到了新的高度,它们在逻辑问答等任务中展示了类似人类的逐步推理能力。相应的优化策略催生了具有推理能力的LVLMs,例如Qwen3.5(Qwen Team,2026(https://arxiv.org/html/2607.27747#bib.bib55))。为了匹配快速增长的推理能力,需要更强的评估协议来更好地评估LVLMs的表现。

参见图注 图1:IllusionReasoning 构建概览。IllusionReasoning 中的图像从搜索引擎收集以确保真实性。标注包括两个阶段:(1)内容分析,通过比较人类描述与真实事实来确定错觉类型;(2)QA构建,包括创建与答案配对的高质量检测、描述和推理问题。
### 3\.2 为什么使用视觉错觉?

LVLMs在视觉问答和图像描述等基础任务中表现出稳定的性能。这些任务难以反映不同LVLMs之间的性能差异。相比之下,更复杂的视觉错觉任务能够有效揭示不同LVLMs之间的性能差异。要回答关于错觉的问题,LVLMs必须进行复杂的、多粒度的推理。这个过程要求理解宏观的语义上下文,同时精确定位诱发错觉的特征,并整合微观视觉线索,以看穿欺骗性的表象,辨别背后的现实,从而得出正确答案。因此,基于视觉错觉的评估能够反映感知和推理能力的类人程度,从而提供了超越一般评估的新维度。

## 4 IllusionReasoning 构建

视觉错觉被定义为一种现象,即观察者在特定视觉条件下,对包括长度、角度、颜色或物体运动在内的物理属性的感知系统性地偏离客观现实。

相似文章

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。