M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准
摘要
本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。
arXiv:2608.05817v1 公告类型:新
摘要:隐喻通过跨域映射使抽象概念得以理解,同时传达情感态度。在多模态场景中,视觉和文本信息共同构建目标-源映射,既需要概念理解,也需要跨模态推理。然而,现有基准主要通过孤立子任务评估隐喻理解,且缺乏基于证据的解释,难以判断模型是否建立了基于视觉和文本线索的映射。为解决这些局限,我们提出了M$^3$R-Bench,一个统一且基于证据的基准,包含1,000个人工验证的图文实例。在概念隐喻理论和非字面语言理解理论的指导下,M$^3$R-Bench提供了对隐喻出现、目标-源映射、情感以及遵循“证据识别-映射建立-情感推断”的分阶段解释的联合标注。在M$^3$R-Bench上的评估显示,现有模型常常忽略视觉证据,依赖表面的文本线索,并产生不准确的目标-源映射,暴露出跨模态证据-映射不匹配的问题。为解决这一不匹配,我们提出了M$^3$R-Reasoner,它结合基于课程学习的推理监督与任务感知强化学习,使模型推理与隐喻解释对齐。实验表明,仅凭8B参数骨干网络,M$^3$R-Reasoner在四项统一任务指标上优于更大的专有MLLM,并在视觉证据和情感论证得分上分别比GPT-5.5高出28.45和30.11分,同时平均标准评分超过Claude-Sonnet-4.6 8.00分。数据集和代码可在https://github.com/hongshi4/M3R-Bench获取。
查看缓存全文
缓存时间: 2026/08/07 07:52
# M3R\text{M}^3\text{R}-Bench:一个统一的基于证据的多模态隐喻理解基准
Hong Jiang1\equalcontrib, Junnan Zhu2\equalcontrib, Jingwang Huang1\equalcontrib, Xiao Sun1, Yuming Yang1, Jiang Zhong1\corresponding, Ruirui Chen3, Jingman Shi4, Hao Wu4, Nayu Liu5, Xinyi Jiang6, Kaiwen Wei1\corresponding
###### 摘要
隐喻通过跨域映射使抽象概念得以理解,同时传达情感态度。在多模态场景中,视觉和文本信息共同构建目标–源映射,既需要概念理解,也需要跨模态推理。然而,现有基准主要通过孤立子任务评估隐喻理解,且缺乏基于证据的解释,难以评估模型是否建立了基于视觉和文本线索的映射。为解决这些局限性,我们提出了M3R\text{M}^3\text{R}-Bench,这是一个统一的、基于证据的基准,包含1,000个图像–文本实例,并带有人工验证的标注。在概念隐喻理论和非字面语言理解理论的指导下,M3R\text{M}^3\text{R}-Bench提供了隐喻出现、目标–源映射、情感以及遵循“证据识别–映射建立–情感推断”的分阶段解释的联合标注。对M3R\text{M}^3\text{R}-Bench的评估表明,现有模型往往忽略视觉证据、依赖表面文本线索,并产生不准确的目标–源映射,暴露出跨模态证据–映射不匹配的问题。为解决这一不匹配问题,我们提出了M3R\text{M}^3\text{R}-Reasoner,它结合基于课程表的推理监督与任务感知强化学习,使模型推理与隐喻解读对齐。实验表明,仅使用8B参数主干,M3R\text{M}^3\text{R}-Reasoner在四个统一任务指标上优于更大的专有MLLM,并在视觉证据和情感论证得分上分别比GPT-5.5提高28.45和30.11分,同时在平均评分标准得分上超过Claude-Sonnet-4.6达8.00分。数据集和代码可在https://github.com/hongshi4/M3R-Bench获取。
## 引言
参照图Figure 1:本工作的动机。现有研究预测隐喻和情感,但缺少基于证据的目标–源映射。相比之下,M3R\text{M}^3\text{R}-Bench以基于证据的解释联合评估隐喻识别、映射和情感。
隐喻通过将源域结构映射到目标域上,使抽象概念得以理解[Lakoff and Johnson1980 (https://arxiv.org/html/2608.05817#bib.bib1)]。在广告和社交媒体等真实场景中,这种映射通常通过视觉和文本模态共同构建,形成多模态隐喻[Forceville and Urios-Aparisi2009 (https://arxiv.org/html/2608.05817#bib.bib2)]。理解这些表达对于恢复概念映射、情感态度和交际意图至关重要[Zhanget al.2021 (https://arxiv.org/html/2608.05817#bib.bib3); Xuet al.2022 (https://arxiv.org/html/2608.05817#bib.bib4)]。
表Table 1:M3R\text{M}^3\text{R}-Bench与现有隐喻基准的比较。
多模态大语言模型(MLLM)的最新进展显著提升了视觉感知和多模态推理能力,为超越表面分类、走向可解释推理的隐喻理解研究提供了新机遇[Kunduet al.2025 (https://arxiv.org/html/2608.05817#bib.bib10); Zhenget al.2026 (https://arxiv.org/html/2608.05817#bib.bib11)]。现有的多模态隐喻基准为这一研究方向提供了有价值的资源。例如,MultiMET[Zhanget al.2021 (https://arxiv.org/html/2608.05817#bib.bib3)]、MultiCMET[Zhanget al.2023 (https://arxiv.org/html/2608.05817#bib.bib5)]和MultiMM[Yanget al.2025 (https://arxiv.org/html/2608.05817#bib.bib6)]引入了隐喻出现、目标–源关系、情感和相关属性的标注。然而,现有基准通常将隐喻识别、目标–源映射和情感推断作为独立任务进行评估,而不是对完整的理解过程进行建模。这种碎片化的设置无法揭示正确的预测是来自有效的跨模态推理还是表面相关性。此外,大多数基准缺乏基于证据的解释,无法验证概念映射是如何由视觉和文本线索支撑的。如图Figure 1 (https://arxiv.org/html/2608.05817#Sx1.F1)所示,一个MLLM可能正确识别隐喻及其积极情感,却将基于证据的目标–源关系替换为诸如低碳发展、环境保护等主题级概念。尽管近期研究探索了思维链提示和解释生成[Xuet al.2024 (https://arxiv.org/html/2608.05817#bib.bib25); Tianet al.2025 (https://arxiv.org/html/2608.05817#bib.bib13)],但这些解释主要是辅助信号或不受约束的输出,而非标准化的基于证据的评估。
为解决这些局限性,我们引入了多模态隐喻理解基准(M3R\text{M}^3\text{R}-Bench),这是一个统一的基于证据的多模态隐喻理解基准。M3R\text{M}^3\text{R}-Bench包含从现有资源收集的1,000个图像–文本实例,在理论引导的框架下重新标注,并经人工标注者验证[Lakoff and Johnson1980 (https://arxiv.org/html/2608.05817#bib.bib1); Wilks1975 (https://arxiv.org/html/2608.05817#bib.bib19)]。每个实例都提供隐喻出现、目标–源映射、情感以及遵循“证据识别–映射建立–情感推断”的分阶段解释的标注。如表Table 1 (https://arxiv.org/html/2608.05817#Sx1.T1)所示,M3R\text{M}^3\text{R}-Bench以基于证据的解释联合评估这些维度,从而实现对跨模态隐喻推理的整体评估和细粒度诊断。
我们在M3R\text{M}^3\text{R}-Bench上对13个基线进行了广泛评估,包括传统的视觉-语言模型、特定任务的隐喻方法以及具有代表性的开源和闭源MLLM。结果表明,现有方法在统一的基于证据的多模态隐喻理解方面仍不可靠。特别是,MLLM常常忽视关键视觉证据,依赖表面文本线索,并生成概念粒度不恰当的目标–源映射。在基于评分标准的评估中,GPT-5.5在视觉证据上仅得29.66分,在映射正确性上得43.95分。这些失败暴露了跨模态证据–映射不匹配:模型可能产生看似合理的预测,却未建立预期的隐喻关系。
为解决这一跨模态证据–映射不匹配问题,我们提出了M3R\text{M}^3\text{R}-Reasoner,它将基于课程表的推理监督微调(SFT)与任务感知强化学习相结合,逐步对齐证据识别、目标–源映射和情感推断。仅使用8B参数主干,M3R\text{M}^3\text{R}-Reasoner就在四个统一任务指标和三个基于评分标准的解释指标上达到了最先进性能,优于更大的通用MLLM。这些结果验证了基于证据的推理在多模态隐喻理解中的有效性。
总之,本工作的贡献如下:
1. 1.我们指出现有多模态隐喻基准在评估碎片化和可解释性受限的问题,并通过引入M3R\text{M}^3\text{R}-Bench解决了这些局限性——这是一个统一的基于证据的基准,为隐喻识别、目标–源映射、情感和推理解释提供联合标注。
2. 2.我们在M3R\text{M}^3\text{R}-Bench上对13个基线进行了系统评估,发现现有方法常常忽视关键视觉证据、依赖表面文本线索,并产生不准确的目标–源映射。
3. 3.我们提出了M3R\text{M}^3\text{R}-Reasoner,一个结合任务感知强化学习的基于课程表的推理框架。实验表明,M3R\text{M}^3\text{R}-Reasoner通过基于证据的推理有效缓解了跨模态证据–映射不匹配问题。
## 相关工作
#### 多模态隐喻基准。
多模态隐喻基准已从隐喻检测扩展到更丰富的概念域、目标–源关系、情感和意图标注。MultiMET[Zhanget al.2021 (https://arxiv.org/html/2608.05817#bib.bib3)]、MET-Meme[Xuet al.2022 (https://arxiv.org/html/2608.05817#bib.bib4)]和MultiCMET[Zhanget al.2023 (https://arxiv.org/html/2608.05817#bib.bib5)]建立了代表性的图像–文本设置,而最近的进一步数据集研究了文化变异性(MultiMM[Yanget al.2025 (https://arxiv.org/html/2608.05817#bib.bib6)])、细粒度情感(EmoMeta[Luet al.2025 (https://arxiv.org/html/2608.05817#bib.bib7)])、显式概念映射(CM3D[Zhanget al.2025b (https://arxiv.org/html/2608.05817#bib.bib8)])以及针对多模态大语言模型的统一评估(M3UCD[Zhenget al.2026 (https://arxiv.org/html/2608.05817#bib.bib11)])。视觉隐喻资源(如MetaCLUE[Akula and others2023 (https://arxiv.org/html/2608.05817#bib.bib9)]和ImageMet[Kunduet al.2025 (https://arxiv.org/html/2608.05817#bib.bib10)])还额外引入了定位、理解、生成、描述和问答任务。尽管任务覆盖面更广,现有基准仍将隐喻理解视为孤立的子任务,缺乏基于证据的解释。因此,它们无法确定模型是从跨模态证据中恢复隐喻映射,还是依赖表面相关性。
#### 隐喻理解方法。
早期方法主要依赖图像–文本特征融合和特定任务的语义知识,包括概念域和情感表示[Zhanget al.2021 (https://arxiv.org/html/2608.05817#bib.bib3); Xuet al.2022 (https://arxiv.org/html/2608.05817#bib.bib4); Zhanget al.2023 (https://arxiv.org/html/2608.05817#bib.bib5); Yanget al.2025 (https://arxiv.org/html/2608.05817#bib.bib6)]。近期研究越来越多地利用多模态大语言模型进行显式推理:C4MMD[Xuet al.2024 (https://arxiv.org/html/2608.05817#bib.bib25)]通过分阶段思维链推理迁移多模态知识;CoC[Zhanget al.2025a (https://arxiv.org/html/2608.05817#bib.bib12)]引出候选目标–源实体及其关联;CPMMIM[Zhanget al.2025b (https://arxiv.org/html/2608.05817#bib.bib8)]将思维链提示与分层优化相结合;ImaRA[Tianet al.2025 (https://arxiv.org/html/2608.05817#bib.bib13)]通过想象框架、域不一致性和跨域属性相似性进行推理。然而,现有方法往往只关注部分子任务,或独立优化隐喻识别、映射和情感。它们的推理信号通常通过提示或自由形式输出引入,而非统一的过程。为解决这一局限性,M3R\text{M}^3\text{R}-Reasoner引入了基于课程表的推理监督和任务感知奖励,将基于证据的隐喻推理与最终预测对齐。
参照图Figure 2:M3R\text{M}^3\text{R}-Bench的数据分布和统计信息。
参照图Figure 3:通过数据整理、共识标注、人工裁决和基于证据的解释生成来构建M3R\text{M}^3\text{R}-Bench。
## M3R\text{M}^3\text{R}-Bench
我们引入了M3R\text{M}^3\text{R}-Bench,一个用于可解释多模态隐喻理解的统一基准。据我们所知,这是第一个在统一的完整任务设置下联合评估多模态隐喻识别、目标–源概念映射和隐喻感知情感推断的基准,同时提供捕获从跨模态证据到最终输出的推理过程的分阶段解释。
#### 任务定义。
给定一个图像–文本样本x=\(I,T\),其中II和TT分别表示图像和文本,模型联合预测:
y=\(m,t,s,e\), (1)
其中m∈{Yes,No}表示样本是否包含多模态隐喻;tt和ss分别表示隐喻映射中最核心的目标和源;e∈{Positive,Neutral,Negative}表示图像–文本对传达的整体情感。对于非隐喻样本,t=s=None。
#### 数据来源。
遵循MultiMET[Zhanget al.2021 (https://arxiv.org/html/2608.05817#bib.bib3)]、MultiCMET[Zhanget al.2023 (https://arxiv.org/html/2608.05817#bib.bib5)]、MultiMM[Yanget al.2025 (https://arxiv.org/html/2608.05817#bib.bib6)]和EmoMeta[Luet al.2025 (https://arxiv.org/html/2608.05817#bib.bib7)]的做法,我们的候选图像–文本样本来自:通过标签#metaphor和#metaphorical检索的公开英文Twitter和Facebook帖子;通过百度和必应关键词搜索收集的中文商业和公益广告;以及公开广告语料库,包括2021年科大讯飞广告图像分类比赛的中文广告和Ye等人[Yeet al.2021 (https://arxiv.org/html/2608.05817#bib.bib21)]的英文产品和公益广告。由于这些渠道可能包含重叠内容,我们进行了跨来源去重,并移除了图像损坏或图像–文本信息不完整的实例。由于原始资源在任务定义、标签空间和标注粒度上有所不同,我们没有继承它们的标注,而是统一框架下对所有保留实例重新标注。详细的数据来源及对应URL见附录。
#### 标签标注方案。
为平衡标注效率和可靠性,我们采用了MLLM主导、人工辅助的标注协议。五个代表性MLLM(包括Grok-4.1[xAI2025 (https://arxiv.org/html/2608.05817#bib.bib32)]、Kimi-K2.5[Kimi Team and others2026 (https://arxiv.org/html/2608.05817#bib.bib28)]、GPT-5.5[OpenAI2026 (https://arxiv.org/html/2608.05817#bib.bib30)]、Claude-Opus-4.7[Anthropic2026a (https://arxiv.org/html/2608.05817#bib.bib33)]和Gemini-3.1-Pro[Google DeepMind2026 (https://arxiv.org/html/2608.05817#bib.bib34)])独立标注隐喻出现、核心目标–源映射和情感。至少三个模型未达成共识的实例由标注者重新标注并裁决。整个过程以概念隐喻理论(CMT)[Lakoff and Johnson1980 (https://arxiv.org/html/2608.05817#bib.bib1)]和选择偏好违反(SPV)[Wilks1975 (https://arxiv.org/html/2608.05817#bib.bib19)]为指导。三位受过训练、具有计算机科学或心理学背景的研究生标注者参与标注和裁决。我们最终得到了1,000个实例,所有标注均通过人工审核。附录中报告了标注者间一致性。
#### 基于证据的解释。
对于每个实例,我们以分阶段方式收集解释:(1) 识别支持隐喻解读的视觉证据和文本证据;(2) 解释文本和视觉元素如何建立目标–源映射;(3) 说明映射如何支撑情感推断。解释由上述MLLM生成,并由标注者修订以保证清晰性和一致性。相似文章
MultivationBench:多模态序列动机推理基准
介绍了MultivationBench,这是一个基于马斯洛需求层次和赖斯基本欲望的故事驱动视觉叙事,用于评估多模态大语言模型序列动机推理能力的基准。结果表明,所有测试模型在动态动机推断方面均表现不佳。
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
MetaphorVU:面向隐喻视频理解
本文介绍了MetaphorVU-Bench,这是首个针对隐喻视频理解的系统化基准,并提出了MetaphorBoost,一种推理时增强框架,可改善多模态大语言模型中的跨域映射。
RRM:经验驱动的反思性检索记忆用于长时程多模态推理
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。