多模态大语言模型评估中我们缺失了什么?
摘要
本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。
arXiv:2606.26348v1 Announce Type: new
摘要:多模态大语言模型(MLLMs)能够处理多种输入,例如文本、图像、音频和视频,并生成文本回复。尽管它们的能力快速提升,但对此类模型的评估却未能跟上。现有的大多数评估基准仅限于孤立任务,很少能揭示模型是否跨模态整合信息。我们审视了当前评估MLLMs的方法,并回顾了现有的基准分类,以找出差距,包括时空连贯性、物理世界理解、多模态一致性和选择性注意力。解决这些差距对于衡量多模态智能的真实进展以及揭示能力边界至关重要。
查看缓存全文
缓存时间: 2026/06/26 05:12
# 多模态大语言模型评估中缺失了什么? 来源:https://arxiv.org/html/2606.26348 ###### 摘要 多模态大语言模型(MLLMs)能够处理多种输入,例如文本、图像、音频和视频,并生成文本回复。虽然其能力发展迅速,但对此类模型的评估却未能同步跟进。大多数现有的评估基准局限于孤立的任务,很少能揭示模型是否在模态之间整合信息。我们审视了当前评估MLLMs的方法,并回顾了现有的基准分类学,以识别差距,包括时空连贯性、物理世界理解、多模态一致性和选择性注意力。解决这些差距对于衡量多模态智能的真实进展和揭示能力边界至关重要。 多模态大语言模型,模型评估,基准 ††ccs:计算方法 人工智能††ccs:计算方法 机器学习††ccs:计算方法 自然语言处理††ccs:计算方法 计算机视觉 ## 1. 引言 多模态大语言模型(MLLMs),如 Gemini-3.1-Pro 和 GPT-5,处理多种输入模态,包括文本、图像、音频和视频,并产生文本回复。这些模型旨在将感知和推理统一在单一框架内。通过结合多种模态,MLLMs 执行视频理解、多媒体文档分析等任务。尽管能力增长迅速,评估方法却未能同步跟进。 评估在 MLLMs 的迭代开发周期中是一个关键组成部分,如图1(https://arxiv.org/html/2606.26348#S1.F1)所示。评估并非仅仅作为诊断工具,而是与模型开发形成反馈循环:更强的模型需要更具挑战性的基准,而更难的评估反过来推动更强模型的发展。评估有助于识别能力边界和失败模式,例如跨模态差异,即 MLLMs 正确处理每种模态但未能将其合并为连贯输出。图1(https://arxiv.org/html/2606.26348#S1.F1)中一个著名的例子说明了这一局限:当被问及“香蕉是什么颜色?”并给出香蕉图像时,早期的 MLLMs 经常回答黄色,这反映了其预训练数据中的主导颜色 (Kv and Mittal, 2020 (https://arxiv.org/html/2606.26348#bib.bib7))。如果评估从未测试过其他颜色的香蕉,这种对文本先验的过度依赖就不会被发现。 与单模态大语言模型(LLMs)不同,MLLMs 必须将多种感官输入与文本推理连接起来,这需要一个能够验证跨模态对齐的框架。大多数现有基准侧重于孤立的任务,例如识别图像中的物体或回答简短的问题。虽然在这些基准上的成功表明在特定子任务上的熟练度,但它几乎不能揭示模型是否真正在模态之间整合信息。 现实世界的部署暴露了标准评估经常遗漏的多模态失败。模型可能错误归因视频中的动作,或忽略复杂文档中的关键细节。此类错误引入了安全和问责风险,尤其是在自动驾驶、医学成像和金融分析领域。 因此,新的评估变得必要。多模态评估必须将感知信号与逻辑推理对齐,以揭示纯文本基准无法发现的失败模式。它应评估模型是否整合多种模态、保持时空连贯性,并在现实条件下生成可靠输出。从以人为中心的角度看,评估不仅应衡量基准准确率,还应衡量在时间压力和模糊跨模态证据下的可靠性。通常未被充分评估的关键能力包括时空连贯性、物理世界理解、多模态一致性和选择性注意力。 参见标题图1. MLLM 开发与评估之间的迭代反馈循环。更强的模型需要更具挑战性的评估,而这又揭示出潜在的失败模式。 ## 2. 为什么当前评估在现实世界中失败 随着 MLLMs 从实验工具走向医疗诊断、自主系统和金融分析等现实应用,错误的成本急剧上升。幻觉反映了在模态间锚定信息的失败——例如,误读视频中的时间事件,或遗漏音频警报与视觉信号之间的关联。现实世界的部署容错空间很小,因此要求评估更加严格。 当前可靠性危机的一部分源于传统静态基准的局限性。这些数据集曾用于追踪进展,现在却常常无法揭示 MLLMs 如何在模态间整合信息。导致这个问题的两个关键问题是数据泄露和基准污染。当基准示例与模型训练数据重叠时,就会发生数据泄露,这通常是因为训练集和评估集都来自同一无处不在的互联网来源。因此,MLLMs 可能看起来在推理一个复杂任务,而实际上是在回忆其预训练中的特定数据对。基准污染出现在真实标签不正确或提供的上下文不足或矛盾时。随着密集、多面性数据(如视频-音频同步或复杂技术图表)的出现,这个问题会恶化。它通过夸大报告分数和掩盖真正的泛化能力,损害了评估的有效性,使得区分记忆和真正的多模态推理变得困难。 为了解决静态基准的局限性,社区已经开始探索交互式的、真实的评估平台。像 LMArena 这样的系统通过人类用户的大规模成对投票来比较模型,允许通过开放式对话而非固定数据集进行评估 (Chiang et al., 2024 (https://arxiv.org/html/2606.26348#bib.bib4))。最近的扩展已经开始纳入 MLLMs,尽管主要仍限于静态图像。虽然这些平台提供了对真实世界使用模式的宝贵见解,但它们也引入了新的偏见。人类评分者往往更喜欢流利、自然或较长的回复,而非严格准确或信息丰富的回复。此外,模型开发者可能会微调系统以专门提高排名,再次将模型开发与排行榜表现而非底层能力联系起来。 结果是出现了一个矛盾的局面:行业看到源源不断的新最佳排行,但这些排行却始终无法转化为对用户的实际效用。这导致了一种能力差距,表现为令人印象深刻的排行榜分数与经常不一致的用户体验之间的脱节。为了弥合这一差距,评估必须超越简单的模式学习,转向衡量功能性的模态集成。我们必须确保模型的高性能反映出其综合各种感官线索(如视觉信号、听觉输入或文本指令)的能力,同时应用逻辑约束。评估还应捕捉对用户的有形益处,包括节省的时间、金钱或减少的努力。 参见标题图2. MLLMs 利用多模态集成(文本、图像、音频和视频)为各种任务产生文本输出。示例来源:(Xiao et al., 2024 (https://arxiv.org/html/2606.26348#bib.bib9); Krishna et al., 2017 (https://arxiv.org/html/2606.26348#bib.bib6); Wei et al., 2025 (https://arxiv.org/html/2606.26348#bib.bib8); Cheng et al., 2024 (https://arxiv.org/html/2606.26348#bib.bib3); Zhang et al., 2025 (https://arxiv.org/html/2606.26348#bib.bib11); Xie et al., 2025 (https://arxiv.org/html/2606.26348#bib.bib10))。 ## 3. 多模态基准分类学 目前的评估仍然由静态的、以图像为中心的基准主导,这些基准测试感知和视觉问答(如图2 (https://arxiv.org/html/2606.26348#S2.F2) 所示)。虽然这些任务可以达到很高的难度,但它们很大程度上忽略了时间动态和跨模态交互。 视频基准将评估扩展到长序列,测量目标跟踪和随时间变化的因果推理。然而,它们通常强调有限的视觉时刻并忽略音频,将多模态理解简化为一个主要的视觉任务。类似地,OCR 基准侧重于结构化文档,要求模型解析布局并提取语义含义,但仍局限于静态输入。 更真实的评估出现在具身和自我中心设置中。机器人基准,例如 VLABench (Zhang et al., 2025 (https://arxiv.org/html/2606.26348#bib.bib11)),评估模型是否能够将感知转化为行动,需要空间锚定和长程推理。自我中心基准进一步测试在遮挡和运动条件下,对第一人称视角下人类意图和交互的理解。尽管前景广阔,但这些设置的范围和标准化仍然有限。 在这些基准中,一个共同的限制持续存在:它们孤立地评估能力,而不是测试模型是否将信息整合为连贯的、有根据的理解。这因过度依赖多项选择格式和预定义的金标准而加剧。正如 OpenAI 的报告中指出的 (Kalai et al., 2025 (https://arxiv.org/html/2606.26348#bib.bib5)),MLLMs(和 LLMs)表现出一种“强制选择”偏见,倾向于猜测答案,而不是承认视觉模糊性或内部不确定性。这暴露了一个评估差距,即真实答案常常缺失或流变,特别是在强化学习、自动驾驶和人类对齐任务等领域。扩展评估格式,例如将模型性能与物理世界任务 (Zhang et al., 2025 (https://arxiv.org/html/2606.26348#bib.bib11)) 或人类任务有效性 (Chen et al., 2025 (https://arxiv.org/html/2606.26348#bib.bib2)) 相关联,可以实现更复杂的性能衡量。 ## 4. 新评估的多模态测试平台能力 表1. MLLM 能力覆盖热力图(L:低,M:中,H:高)。 评估形式的转变需要我们在定义模型能力时做出转变。新的评估必须衡量将多种模态整合为连贯的世界内部表征的能力。这些能力界定了仅仅处理像素的模型与拥有类似人类感知的世界理解模型之间的边界。除了问答基准,我们需要超越真实答案的交互式评估,测试在动态场景中的响应和适应。我们强调了几种仍未得到充分评估的能力,并在表1中总结了它们与现有评估的关系。 ### 时空连贯性 这些能力基于时空连贯性的双重需求。时间分析评估模型随时间保持叙事连续性的能力,需要理解跨越几分钟输入的序列和因果关系。它涉及识别一个动作并理解定义事件的“前因后果”。空间分析测试模型对3D几何和物体定位的理解,需要即使在相机或环境变化的情况下也能保持几何一致性。 ### 物理世界建模 真正的多模态能力需要对物理定律进行建模,通常通过变化的视角和物体交互来测试。基准应评估“不同人物视角”以测试物体恒存性,要求模型在不同视角或完全遮挡期间跟踪物体。这种能力辅以交互式物体跟踪,即模型必须推断物体在受到外力作用时如何在3D空间中行为。除了跟踪,评估还应评估模型的物理理解,特别是深度、速度和碰撞轨迹。一个关键指标是因果预测:预测物理序列合理结果的能力,例如,一个杯子掉落在坚硬的表面上很可能会碎。 ### 多模态集成 评估的最先进阶段侧重于模态之间的协同作用,要求模型在各种感官输入之间保持统一的内部状态。多模态处理强制执行严格的对齐和一致性,惩罚产生矛盾输出的模型。例如,一个模型描述玻璃破碎的声音,而视觉证据显示它完好无损。这种跨模态验证对于确保 MLLMs 不仅仅是 hallucinate 离散的细节,而是从其输入中综合出一个单一的、有根据的理解至关重要。 ### 显著性和选择性注意力 显著性和选择性注意力衡量模型是否优先处理与任务相关的信号并抑制跨模态的无关信号。可靠的系统突出关键线索,如突然的运动、说话者切换或异常读数,而不是平等地加权所有输入。扰动、干扰和归因测试评估当关键信号变化时预测是否正确响应。这至关重要,因为许多现实世界的失败源于关注了错误的信号,而不是感知缺失。忽视注意力的基准可能会奖励那些出于错误原因而成功的脆弱模型。 ## 5. 结论 排行榜分数与现实世界表现之间日益扩大的差距凸显了重新思考我们如何评估模型能力的必要性。当前的基准通过提供明确的目标推动了快速进步,但越来越多地受到古德哈特定律的影响:当一个指标成为目标时,它就不再是一个好的衡量标准。例如,在经济学中,过度优化关键绩效指标可能会扭曲决策制定。曾经是有用代理的指标在持续的优化压力下会退化。 潜在的解决方案包括设计多指标评估框架,超越单一的标量值,以捕捉多个维度之间的权衡。它们还包括保留部分评估内容以保密,防止过度拟合和排行榜游戏。此外,定期更新数据集内容有助于反映新颖的多模态场景。 ## 参考文献 - (1) Chen et al. (2025) Shenghui Chen, Po-han Li, Sandeep Chichali, and Ufuk Topcu. 2025. VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR. *Annual Conference on Neural Information Processing Systems* 38 (2025). - Cheng et al. (2024) Sijie Cheng, Zhicheng Guo, Jingwen Wu, Kechen Fang, Peng Li, Huaping Liu, and Yang Liu. 2024. EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models. In *Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)*. 14291–14302. - Chiang et al. (2024) Wei-Lin Chiang, Lianmin Zheng, Ying Sheng, Anastasios Nikolas Angelopoulos, Tianle Li, Dacheng Li, Hao Zhang, Banghua Zhu, Michael Jordan, Joseph E Gonzalez, et al. 2024. Chatbot arena: An open platform for evaluating llms by human preference, 2024. *URL https://arxiv.org/abs/2403.04132* 2, 10 (2024). - Kalai et al. (2025) Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, and Edwin Zhang. 2025. Why Language Models Hallucinate. arXiv:2509.04664 [cs.CL] https://arxiv.org/abs/2509.04664 - Krishna et al. (2017) Ranjay Krishna, Kenji Hata, Frederic Ren, Li Fei-Fei, and
相似文章
Mind's Eye:面向多模态大模型的视觉抽象、变换与组合基准
研究者推出 Mind’s Eye,一项包含八道视觉认知任务的基准测试,显示顶级多模态大模型得分不足 50%,而人类可达 80%,暴露出视觉抽象、关系映射与心理变换方面的巨大差距。
TokenSwap:基准测试并缩小多模态大语言模型中的模态差距
本文介绍了TokenSwap,一种将纯文本基准测试转换为图像交错对应物的方法,以及TokenSwap-Bench,用于衡量42个多模态大语言模型的模态差距。研究发现推理模型的差距较小,并表明基于TokenSwap的训练可以缩小这一差距。
面向多模态大语言模型的移动用户体验推理:任务、基准与方法
本文介绍了UXBench,这是一个用于评估多模态大语言模型在移动用户体验推理任务上的多模态基准,并提出了UI-UX,一种基于Qwen3-VL-4B-Thinking微调的多模态大语言模型,在该基准上取得了最先进的性能。
多模态大语言模型能理解OCT吗?
本文介绍了OCT-Bench,一个用于评估多模态大语言模型在OCT图像理解能力的全面基准,包含10,076个问题,覆盖感知、认知和推理三个维度的20个细粒度任务。对20个模型的评估表明,当前MLLMs在可靠的OCT理解方面仍有很大差距。
MeetingToM:在多参与者会议中评估多模态大语言模型的心智理论推理
介绍MeetingToM,这是一个用于评估多模态大语言模型在多参与者会议中进行心智理论推理的基准,包含个体、二元和群体层面的任务,包括伪共识检测。