C$^3$PO: 评估全模态模型中的跨模态组合与反事实表现
摘要
介绍了C$^3$PO,一个包含3,404个样本的基准测试,用于评估多模态LLM中的跨模态组合与反事实推理。研究发现模态主导性导致了大多数失败,即使最佳模型(Gemini-3.1-Pro)也远低于人类准确率。
arXiv:2608.05381v1 公告类型:新
摘要:当前的多模态大型语言模型(MLLMs)能够处理多种感官输入,但其推理仍然严重偏向于主导模态,导致跨模态推理脆弱。我们引入了 C$^3$PO,一个包含 3,404 个样本的基准测试,涵盖视频、音频、图像和文本,评估两种能力:信息组合(融合分散的证据)和反事实冲突(解决故意矛盾)。C$^3$PO 的成对 IC/CC 结构和四层设计能够对跨模态推理何时以及为何失败进行针对性诊断。通过全自动流水线和 25 个逻辑基础模板构建,C$^3$PO 揭示了尽管人类准确率达到 88.64%,最佳模型(Gemini-3.1-Pro)仅达到 73.17%,而开源模型在冲突下崩溃。通过注意力探针,我们发现 86-95% 的失败源于模态主导性:模型提交到一种模态而忽略矛盾的证据,将 87-95% 的注意力集中在文本上。中层注意力熵可以预测正确性——持续探索成功,过早崩溃失败。复杂度相当的模板之间 56 个百分点的准确率差距表明,性能取决于模态在冲突解决中的结构角色,而非组合方式。这些发现表明,多模态感知并不能保证稳健的推理;架构必须支持持续的跨模态注意力以避免过早崩溃。
查看缓存全文
缓存时间: 2026/08/07 07:46
# C3PO:在全模态模型中评估跨模态组合与反事实表现 来源:https://arxiv.org/html/2608.05381 Swapnanil Mukherjee1, Agyeya Negi2, Tanuja Ganu1, Ponnurangam Kumaraguru2 1微软研究院印度,2印度海得拉巴国际信息技术学院 通讯作者:swapnanil\.mukherjee12@gmail\.com ###### 摘要 当前的多模态大语言模型 \(MLLMs\) 能够处理多种感官输入,但其推理仍严重偏向于某一主导模态,导致跨模态推理脆弱易碎。我们提出了 C3PO,一个包含 3,404 个样本、涵盖视频、音频、图像和文本的基准测试,用于评估两种能力:信息组合(融合分散的证据)和反事实冲突(解决刻意引入的矛盾)。C3PO 成对设计的 IC/CC 结构及四层分级体系,能够有针对性地诊断跨模态推理在何时、为何失败。通过完全自动化的流水线,基于 25 个逻辑严密的模板构建,C3PO 揭示出:人类准确率达到 88.64%,而最好的模型(Gemini-3.1-Pro)仅达到 73.17%,开源模型在冲突情境下更是完全崩溃。通过注意力探针分析,我们发现 86–95% 的失败源于模态主导:模型在忽略矛盾证据的同时,将 87–95% 的注意力集中在文本上。中间层注意力熵可以预测正确性——持续探索有助于成功,而过早收敛则导致失败。同等复杂度的模板之间高达 56 个百分点的准确率差距表明,性能取决于模态在冲突解决中的结构性角色,而非模态组合本身。这些发现表明,多模态感知并不能保证稳健的推理;架构必须支持持续的跨模态注意力,以避免过早的模态承诺。 C3PO:在全模态模型中评估跨模态组合与反事实表现 Swapnanil Mukherjee1, Agyeya Negi2, Tanuja Ganu1, Ponnurangam Kumaraguru2 1微软研究院印度,2印度海得拉巴国际信息技术学院 通讯作者:swapnanil\.mukherjee12@gmail\.com ## 1 引言 人工智能模型经历了快速的演进,从单模态架构迅速过渡到能够同时处理文本、视觉和听觉数据的功能强大的多模态大语言模型 \(MLLMs\)。随着这些架构不断进步,以整合多样化的感官数据流,相应的评估范式也在同步演变。早期的评估依赖于诸如图像描述或问答等简单任务,但该领域已逐步转向复杂且跨学科的视听推理任务(Li et al.\(2025a\);Jiang et al.\(2025\))。然而,尽管这类模型的多模态能力取得了令人瞩目的提升,它们仍然饱受“模态偏差”的困扰。模态偏差是指模型不成比例地依赖或“偏好”某一单一主导模态(最常见的是预训练语言先验),而低估、忽略或错误解读来自其他模态的伴随输入(Zheng et al.\(2025\);Wang et al.\(2025\);Cai et al.\(2025\))。 图 1:领先 MLLMs 在 C3PO 数据集上按模板划分的性能表现。 这一问题源于这些模型背后的架构和训练选择。偏差在很大程度上源于数据集的不平衡:语言数据在预训练中占据主导,而视觉和听觉数据相对有限,从而产生有偏的学习动态(Leng et al.\(2025\);Zheng et al.\(2025\);Cai et al.\(2025\);Park et al.\(2025\))。架构的不对称性进一步加剧了这一问题:现代 MLLMs 使用大型预训练语言编码器作为骨干,而图像和音频编码器则通过微调或轻量级模态特定适配器集成进来(Microsoft et al.\(2025\);Fu et al.\(2025c\))。由于这些模块远小于语言模型,文本模态经常占据主导,牺牲了尚不成熟的视觉和声学组件(Team et al.\(2025\))。当前的训练目标也未能强制实现均衡的跨模态对齐,反而鼓励了对语言捷径和先验的依赖(Zheng et al.\(2025\);Yang et al.\(2025\))。先前的研究进一步表明,即使在更均衡的设置下,多模态训练本身也常会收敛为对主导模态的依赖(Wang et al.\(2020\);Huang et al.\(2022\))。当模态呈现冲突或异步信息、需要跨多模态进行推理时,跨模态能力的缺失便暴露无遗(Leng et al.\(2025\))。 现有的评估协议主要依赖人工整理的基准数据集,这些数据集扩展成本高昂、数据和任务多样性有限,并且偏向于简单的感知或多选题——这些问题往往可以通过单模态先验解决。尽管最近的基准试图解决这些局限,但仍存在关键缺陷。大多数现有数据集(如 WorldSense(Hong et al.\(2025\))、MAVERIX(Xie et al.\(2026\))、OmniVideoBench(Li et al.\(2025a\))等)局限于三模态(如视频+音频+文本)或更少的输入。FysicsWorld(Jiang et al.\(2025\))包含了全部四种模态,但需要大量的人工与 LLM 协作审查,限制了可扩展性。此外,像 MMA-Bench(Chen et al.\(2025\))和 DAVE(Radevski et al.\(2025\))这样的基准评估了简单的模态矛盾,但缺乏评估真实场景中跨全部四种输入模态的反事实推理和信息组合所需的任务多样性。 因此,本文的贡献如下: 1. 我们引入了一个新的基准数据集 C3PO,由共置的视频、音频、图像和文本模态组成,用于沿两个广泛认知轴评估 MLLMs 的能力,其中包括一个新颖的反事实冲突类别。 2. 我们提出了一种完全自动且可扩展的生成框架,由 25 个对应真实世界能力的细粒度任务模板组成,解决了人工标注的可扩展性限制。 3. 我们对领先 MLLMs 在不同模态组合的多样化任务中的各种失败模式进行了细粒度分析,证明了我们的基准在揭示模态偏差方面的有效性——即便是最强的全模态模型也会受到这种偏差的影响。 图 2:C3PO 基准数据集的分层分类体系。两大主要任务类别“信息组合”和“反事实推理”按模态组合细分为层 \(1-4\)。每个层进一步细分为 25 个任务模板。 ## 2 相关工作 **MLLMs 中的模态偏差与干扰。** 现有研究已越来越多地将模态偏差认定为多模态学习中的严重脆弱性。Leng et al.\(2025\) 引入了多模态诅咒 \(CMM\) 基准,表明 MLLMs 会出现幻觉,这源于对单模态先验的过度依赖以及预训练期间学到的虚假模态间相关性。Cai et al.\(2025\) 使用因果扰动式诊断方法揭示模态干扰,证明非必要模态会严重扭曲模型决策。Hua et al.\(2025\) 研究了冲突输入下的视觉-语言模型,发现模型经常对文本表现出“盲目信任”。在音频领域,Wang et al.\(2025\) 提出了用于音频-语言模型的 MCR-BENCH,并展示了普遍存在的文本偏差:模型在矛盾条件下经常忽视清晰的听觉证据。 图 3:用于自动化和可扩展基准构建的流水线。 **全模态基准。** 早期基准聚焦于静态视觉理解和学术推理,包括 MME(Fu et al.\(2025a\))和 MMMU(Yue et al.\(2024\))。MMT-Bench(Ying et al.\(2024\))通过跨 162 个子任务的 31,325 道精选多选题扩展了这一点,涵盖多任务理解、空间定位和专家知识。Video-MME(Fu et al.\(2025b\))使用字幕和音轨评估了跨 13 个任务类别(包括感知、因果推理和情感分析)的时间性和长视频理解能力。WorldSense(Hong et al.\(2025\))聚焦于通过真实场景中集成的音视频输入进行全模态视频理解。OmniBench(Li et al.\(2025b\))评估了跨视觉、声学和文本输入的并发推理,表明开源模型在三模态设置中表现挣扎。更近期的基准研究对抗性或冲突条件。DAVE(Radevski et al.\(2025\))和 AURA(Galougah et al.\(2025\))考察了音视频同步和跨模态推理,表明模型会在没有证据的情况下推断虚假相关性,并在因果推理方面表现不佳。MAVERIX(Xie et al.\(2026\))引入了跨六个评估维度的 8 选多选题和开放式问题,揭示了长视频和微妙的异步音频线索带来的困难。JointAVBench(Chao et al.\(2026\))研究了三种音频类型的多场景联合推理,要求跨时间和空间语境关联听觉和视觉线索。Wang et al.\(2026\) 引入了 XModBench 来评估跨模态一致性,并证明了领先 MLLMs 中存在显著的方向性失衡和模态差异。最后,SONIC-01(Radwan et al.\(2026\))引入了双向的人口统计感知真实世界评估。 ## 3 C3PO:基准数据集 C3PO 包含 3404 个样本、2137 个唯一视频片段、1646 张唯一图像、3426 个唯一音频文件。表 1(https://arxiv.org/html/2608.05381#S3.T1)展示了各层级和类别中的样本分布。 ### 3.1 构建方法 #### 3.1.1 数据来源 为避免纯合成数据中固有的严重幻觉和物理细微性缺失,我们采用了一种基于真实环境的混合方法。我们的自动化流水线从公共数据集中选取真实世界的“基础媒体”(视频/图像/音频),并以它为锚点来合成缺失的互补模态。这使我们能够通过受约束的生成对整体样本的机制进行细粒度控制,同时确保任务评估的真实性和可靠性。数据源的完整列表见附录 A(https://arxiv.org/html/2608.05381#A1)。 | 信息组合 | 反事实冲突 | 总计 | |---|---|---| | Tier 1 | 69 | 272 | 341 | | Tier 2 | 624 | 795 | 1419 | | Tier 3 | 472 | 924 | 1396 | | Tier 4 | 01 | 632 | 633 | | 总计 | 1363 | 1979 | 3342 | \(a\) 样本分布 | 视频 | 音频 | 图像 | 文本 | |---|---|---|---| | Tier 1 | ✗ | ✓∗ | ✓∗ | ✓ | | Tier 2 | ✓∗ | ✓ | ✗ | ✓ | | Tier 3 | ✓∗ | ✓ | ✓ | ✓ | | Tier 4 | ✓∗ | ✓ | ✓ | ✓ | \(b\) 各层级的模态可用性 表 1:C3PO 中各类别和层级的样本分布与模态构成。∗表示基础模态。 | 基准 | 模态 | IC | CC | 任务数 | 来源数据集 | 样本数 | 生成流水线 | |---|---|---|---|---|---|---|---| | Video-MME | V++A++T | ✓ | ✗ | 12 | 12,700 | 人工 | | OmniBench | I++A++T | ✓ | ✗ | 831 | 1,142 | 人工 | | CMM | V++A++T | ✓ | ✓ | 62 | ∼1,200 | 人工 | | WorldSense | V++A++T | ✓ | ✗ | 813 | 3,172 | 人工 | | MAVERIX | V++A++T | ✓ | ✗ | 752 | 2,556 | 人工 | | OmniVideoBench | V++A++T | ✓ | ✗ | 132 | 1,000 | 人工 | | Daily-Omni | V++A++T | ✓ | ✗ | 631 | 1,197 | 半自动 | | JointAVBench | V++A++T | ✓ | ✗ | 151 | 2,853 | 半自动 | | DAVE | V++A++T | ✓ | ✓ | 322 | 2,426 | 半自动 | | MMA-Bench | V++A++T | ✗ | ✓ | - | 11,316 | 半自动 | | AURA | V++A++T | ✓ | ✗ | 621 | 1,600+ | 自动 | | FysicsWorld | V++A++I++T | ✓ | ✗ | 164 | 0+3,268 | 半自动 | | XModBench | V, I++A++T | ✓ | ✗ | 171 | 06 | 1,320 | 半自动 | | C3PO(我们的) | V++A++I++T | ✓ | ✓ | 258 | 3,342 | 自动 | 表 2:C3PO 与现有多模态和全模态基准的对比。模态:视频、音频、图像、文本。IC:信息组合,测试跨模态分散信息的整合能力。CC:反事实冲突,测试反事实推理、模态干扰或刻意错位。 #### 3.1.2 生成模板 生成模板定义了各模态之间的关系,规定了任务的逻辑形式和求解机制。它们定义了一个骨架,用于根据逻辑形式从基础媒体中实例化内容。该基准由 25 个这样的模板组成¹¹¹所有模板及其完整描述列表见附录。附录 G(https://arxiv.org/html/2608.05381#A7)中提供了一个示例模板。 在本基准中,我们针对两个主要的认知任务: 1. 信息组合:这些模板将所需信息分散到不同模态中,使得跨模态融合成为正确求解样本的必要条件。例如,在 `InstructionalGapDetection` 中,一个静音视频展示完整的动作序列,而生成的音频则仅使用过渡性标记叙述后一半内容。模型必须将音频的起始点与视频序列相连接,以识别未提及的初始步骤。 2. 反事实冲突:这些模板引入跨模态矛盾,模型必须忽略并解决冲突信息。例如,在 `CausalMisattribution` 中,视频显示由清晰可见的机制触发的事件,而音频则自信地(错误地)将其归因于视频中不存在的其他原因。要正确回答,必须忽略具有欺骗性的听觉主张,转而信任可验证的视觉证据。 这些模板根据其具体的模态组合,被划分为四个认知复杂度递增的层级。表 1(https://arxiv.org/html/2608.05381#S3.T1)详细说明了这些层级和类别中的样本分布和模态构成²²²按模板和层级的样本详细分布见附录。 #### 3.1.3 生成流水线 为构建样本,我们采用了一个多阶段流水线,包括候选选择、多模态生成和自动过滤。³³³通过 Gemini API 使用 gemini-3-pro-preview。所有提示词、模型和实现细节见附录。 ##### 基础媒体选择 对于每个生成模板,我们根据基础模态选择合适的源数据集。候选媒体文件通过数据集注释和模板特定约束进行筛选,随后进行轻量级预处理。
相似文章
Tri-PvP:通过感知-命题证据冲突揭示全模态大语言模型中的模态偏差
本文介绍了Tri-PvP,这是一个基准测试,揭示了全模态大语言模型中的视觉偏差和非对称证据形式偏好,表明深层模态偏差可以从早期层线性解码,并且难以通过表面干预缓解。
MMOOC:多模态大语言模型上下文外评估的综合基准
MMOOC 是一个大规模基准,包含超过 41K 个图像-问题对,用于评估多模态大语言模型在拒绝上下文外问题的同时回答上下文偏移问题的能力,结果显示当前模型难以平衡这两种能力。
超越文本主导:理解全模态大语言模型的模态偏好
# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa
M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准
本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。