ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试
摘要
本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。
arXiv:2608.03358v1 公告类型:新
摘要:现有的视觉情感理解方法通常忽略情感感知中的文化差异。我们引入了文化条件视觉情感理解,这一任务旨在预测给定图像在特定文化下的情感感知,并解释其潜在理据。尽管已有相关基准测试,但它们受到个体标注不一致的限制,难以推导出多数支持的文化层面情感标签,且文化覆盖不均衡。为此,我们提出了ArtECulture,一个包含6,792件艺术品的基准测试,涵盖英语、中文和阿拉伯文化,并带有文化特定的情感标签和解释,西方与非西方内容均衡。对16个开源和闭源多模态大语言模型(MLLMs)在零样本设置下的评估显示,该任务仍具挑战性,最佳模型的准确率低于50\%。为解决这一局限,我们引入了一个检索增强的文化条件情感理解框架,该框架利用基于概念的文化情感知识库,在无需额外训练的情况下将显性文化知识注入MLLMs。该框架同时提升了文化对齐的情感预测和基于依据的解释生成。我们的基准测试和代码将公开发布。
查看缓存全文
缓存时间: 2026/08/05 07:45
# ArtECulture:多模态大语言模型中文化条件视觉情绪理解的基准评测 来源:https://arxiv.org/html/2608.03358 ###### 摘要 现有的视觉情绪理解方法通常忽略情绪感知中的文化差异。我们引入了文化条件视觉情绪理解(culture-conditioned visual emotion understanding)任务,该任务要求预测给定图像在特定文化背景下的情绪感知,并解释其背后的原理。尽管已有相关基准,但它们受限于不一致的个体标注(这妨碍了推导出多数人支持的文化层面情绪标签)以及不均衡的文化覆盖。为此,我们提出了 ArtECulture,一个包含 6,792 件艺术品、涵盖英语、中文和阿拉伯语文化下文化特定情绪标签与解释的基准,且西方与非西方内容分布均衡。对 16 个开源和闭源多模态大语言模型(MLLMs)的零样本评估表明,该任务仍具挑战性,最佳模型准确率低于 50%。为应对这一局限,我们提出了一种检索增强的文化条件情绪理解框架,该框架利用基于概念的文化情绪知识库,在无需额外训练的情况下将显式文化知识注入 MLLMs。该框架同时提升了文化对齐的情绪预测和可解释的解释生成。我们的基准和代码将公开发布。 ## 引言 随着多模态大语言模型(MLLMs)融入对话式助手,人机交互正从以文本为中心向多模态交互演变,助手能够在响应中检索和生成图像。图像作为人类交流的丰富媒介,可能在不同用户中引发多样的情绪感知,从而影响他们与 AI 系统的体验和互动。因此,让 MLLMs 理解这些感知对于构建更具共情力和用户对齐的助手至关重要。然而,现有的视觉情绪理解方法(Aslan et al. 2022 (https://arxiv.org/html/2608.03358#bib.bib16); Yang et al. 2023 (https://arxiv.org/html/2608.03358#bib.bib14); Bhattacharyya and Wang 2025 (https://arxiv.org/html/2608.03358#bib.bib15))假设图像在观众中引发普遍情绪,忽略了塑造情绪感知的文化因素(Kitayama and Cohen 2019 (https://arxiv.org/html/2608.03358#bib.bib19))。如图1 (https://arxiv.org/html/2608.03358#Sx1.F1) 所示,同一图像可能在中国观众中引发悲伤,他们将独自望月的人解读为孤独;而在英语和阿拉伯语观众中则引发满足感。 参见图注 图1:ArtECulture 示例。来自不同文化的观众从同一图像中感知到不同的情绪,并提供相应的文化特定解释。 参见图注 图2:提出的范式:检索增强的文化条件情绪理解 和 监督微调。 近期的研究开始将文化因素纳入情绪理解。早期工作引入了基准,例如 ArtELingo(Mohamed et al. 2022a (https://arxiv.org/html/2608.03358#bib.bib10))和 ArtELingo-28(Mohamed et al. 2024 (https://arxiv.org/html/2608.03358#bib.bib11)),它们提供了跨语言和文化、文化多样的图像情绪解释,每张图像配有一个情绪标签和一段解释性说明。然而,这些任务假设目标情绪已给定,聚焦于情绪条件下的说明生成,而非情绪预测。包括 CuLEmo(Belay et al. 2025 (https://arxiv.org/html/2608.03358#bib.bib13))和 CEDAR(Dai et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib12))在内的更近期工作研究了文化条件下的情绪预测。尽管如此,它们主要研究文本语境而非视觉感知:CuLEmo 纯基于文本,而 CEDAR 有限的多模态子集(∼400\sim 400 张图像)将图像作为文本叙事的插图,捕捉的是从描述中推断出的情绪,而非从视觉内容中感知到的情绪。因此,我们定义了文化条件视觉情绪理解任务,该任务要求预测来自特定文化的观众在观察图像时所感知的情绪,并生成相应的文化理由。 评估该任务需要一个具备两个关键属性的基准。首先,每张图像应具有文化层面的情绪标签,以捕捉每种文化内的主导情绪感知,从而能够评估文化共享模式和跨文化差异。其次,基准应保持视觉内容的文化覆盖均衡,以避免对主流文化的评估偏差。ArtELingo 是现有最接近的资源,提供了大规模、文化多样的图像-情绪-说明配对,可以潜在地支持我们的任务。然而,它并不满足这些要求。其个体层面的标注无法产生文化层面的标签,因为仅有 40.22% 的阿拉伯语图像和 43.13% 的英语图像具有多数感知情绪。此外,其 79.75% 的图像描绘西方艺术,导致文化覆盖不均衡。 因此,我们通过重组 ArtELingo 并添加具有新标注、覆盖英语、中文和阿拉伯语文化的文化多样艺术品,构建了 ArtECulture,这是第一个同时满足这两个要求的基准。具体来说,我们保留了 ArtELingo 中在每种文化内具有主导情绪感知的样本,并收集额外的非西方艺术品,由母语者进行标注,以实现文化覆盖均衡。最终,ArtECulture 包含 6,792 件艺术品和 92,062 条跨英语、中文和阿拉伯语文化的文化特定情绪-解释标注,西方(55.89%)和非西方(44.11%)内容分布均衡。 利用 ArtECulture,我们评估了 16 个开源和闭源 MLLMs,并得出两个发现。首先,该任务仍具挑战性,表现最佳的模型总体准确率低于 50%。其次,当前 MLLMs 表现出以英语为中心的 affective priors,每个模型在英语上表现最佳,几乎所有模型在阿拉伯语上表现最差。基于这些发现以及文化情绪感知高度依赖上下文并需要文化特定知识的观察,我们提出了一种无需训练的检索增强框架,利用从 ArtECulture 训练集中提取的概念级文化情绪知识增强 MLLMs。具体来说,我们构建了一个文化情绪知识库,其中每个条目将一个视觉概念与文化特定的情绪和理由相关联。给定图像和目标文化,该框架检索相关概念及其关联的文化知识,以指导 MLLMs 进行情绪预测和解释生成。作为对比,我们还在 ArtECulture 上微调了开源 MLLMs。两种范式显示出互补的权衡:微调实现了最高的预测准确率,但降低了解释质量(可能是由于多参考训练设置),而检索增强则同时提升了预测和解释,并能够部署在闭源模型上。 我们的贡献总结如下: - •我们研究了文化条件视觉情绪理解,这是一个新任务,要求预测图像在给定文化中引发的情绪,并解释情绪产生的原因。我们提出了 ArtECulture,这是该任务的第一个基准,其中每张图像针对每种文化携带一个情绪标签,且西方和非西方内容分布均衡。 - •我们在 ArtECulture 上评估了 16 个 MLLMs,结果表明该任务远未解决,并且每个模型在英语上表现最强,揭示了当前 MLLMs 中明显的英语中心情感先验。 - •我们构建了一个文化情绪知识库,并提出了一个无需训练的检索增强流水线,将其注入 MLLMs。与监督微调的比较揭示了预测准确率和解释质量之间的互补权衡。 ## 相关工作 视觉情绪理解预测视觉内容引发的情绪。现有数据集将网络或艺术图像与离散情绪标签(Machajdik and Hanbury 2010 (https://arxiv.org/html/2608.03358#bib.bib21); Borth et al. 2013 (https://arxiv.org/html/2608.03358#bib.bib22); Peng et al. 2015 (https://arxiv.org/html/2608.03358#bib.bib23); You et al. 2016 (https://arxiv.org/html/2608.03358#bib.bib24); Panda et al. 2018 (https://arxiv.org/html/2608.03358#bib.bib25); Mertens et al. 2024 (https://arxiv.org/html/2608.03358#bib.bib26); Zhang et al. 2025 (https://arxiv.org/html/2608.03358#bib.bib40))、解释(Mohammad and Kiritchenko 2018 (https://arxiv.org/html/2608.03358#bib.bib27); Mathews et al. 2016 (https://arxiv.org/html/2608.03358#bib.bib43); Achlioptas et al. 2021 (https://arxiv.org/html/2608.03358#bib.bib28); Mohamed et al. 2022b (https://arxiv.org/html/2608.03358#bib.bib29))或情绪相关属性(You et al. 2017 (https://arxiv.org/html/2608.03358#bib.bib44); Yang et al. 2023 (https://arxiv.org/html/2608.03358#bib.bib14))配对。除了早期手工特征(Aslan et al. 2022 (https://arxiv.org/html/2608.03358#bib.bib16)),近期工作通过指令微调(Xie et al. 2024 (https://arxiv.org/html/2608.03358#bib.bib30); Yang et al. 2024 (https://arxiv.org/html/2608.03358#bib.bib31); Chen et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib38); Wu et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib39); Rha et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib42))适配 MLLMs,或对引发的情绪(Bhattacharyya and Wang 2025 (https://arxiv.org/html/2608.03358#bib.bib15))和情绪智能(Hu et al. 2025 (https://arxiv.org/html/2608.03358#bib.bib32))进行基准评测。然而,这些工作将来自不同文化背景的标注合并为每张图像的一个标签,忽视了情绪感知的文化依赖性。 文化感知的情绪理解将文化因素纳入情绪理解。第一条研究路线是情感字幕生成:ArtELingo(Mohamed et al. 2022a (https://arxiv.org/html/2608.03358#bib.bib10))和 ArtELingo-28(Mohamed et al. 2024 (https://arxiv.org/html/2608.03358#bib.bib11))用多文化标注扩展了 ArtEmis,用于情感字幕生成,其中情绪作为输入而非预测目标。第二条路线从文本中在文化或语言条件下预测情绪。多语言资源(Muhammad et al. 2025a (https://arxiv.org/html/2608.03358#bib.bib33), b (https://arxiv.org/html/2608.03358#bib.bib34))覆盖 28 种语言的情绪检测,但每个文本仅与单一语言绑定,缺乏对同一刺激的跨文化判断。CuLEmo(Belay et al. 2025 (https://arxiv.org/html/2608.03358#bib.bib13))使用纯文本输入研究文化感知,CEDAR(Dai et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib12))使用说明文本叙事的有限图像子集。这些基准侧重于无解释的单标签评估,并且未探索模型适配。相比之下,我们针对文化条件下视觉情绪感知,要求同时进行情绪预测和文化理由生成,并研究如何增强 MLLMs 以完成该任务。 MLLMs 的文化理解考察 MLLMs 是否掌握关于多元文化的知识。基准(Liu et al. 2021 (https://arxiv.org/html/2608.03358#bib.bib35); Romero et al. 2024 (https://arxiv.org/html/2608.03358#bib.bib3); Nayak et al. 2024 (https://arxiv.org/html/2608.03358#bib.bib5); Vayani et al. 2024 (https://arxiv.org/html/2608.03358#bib.bib36); Schneider et al. 2025 (https://arxiv.org/html/2608.03358#bib.bib9); Tan et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib4); Wang et al. 2025 (https://arxiv.org/html/2608.03358#bib.bib41))测试关于食物、服饰、仪式和地标的客观文化知识,揭示了在非西方文化上持续存在的差距,后续研究通过文化训练数据(Nyandwi et al. 2025 (https://arxiv.org/html/2608.03358#bib.bib37))或检索(Li et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib2); Lewis et al. 2020 (https://arxiv.org/html/2608.03358#bib.bib20))来缓解这一差距。与这些关于客观文化事实的工作不同,我们研究由视觉内容在跨文化中引发的主观情绪感知,并使用一个编码概念级情绪惯例而非事实性知识的知识库。 ## ArtECulture 基准 我们分两步构建 ArtECulture:将 ArtELingo 重新整理为具有多数支持文化层面标签的基础池,并收集具有新标注的非西方艺术品以重新平衡区域分布。 表1:ArtECulture 的详细统计数据。 ### ArtELingo 的重新整理 ArtELingo 中的每张图像由来自每种文化的多名标注者进行标注。我们仅当所有三种文化内部均达到多数一致时才保留图像,并将每种文化中的多数情绪指定为其文化层面的标签。这产生了 4,928 张图像,三种文化均提供情绪-解释标注,包括 3,796 张西方(77.03%)和 1,132 张非西方(22.97%)艺术品。然而,该池仍以西方为中心,需要非西方艺术品的扩充。 ### 非西方艺术品扩充 ##### 收集。 我们从公共基准 VULCA-BENCH(Yu et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib1))中收集额外的非西方艺术品,这是一个源自权威博物馆开放藏品、面向多元文化艺术批评的基准。我们总共获得 2,783 件艺术品,涵盖五大传统,即中国、日本、韩国、印度和伊斯兰艺术。 ##### 标注。 我们从 Prolific¹¹https://www.prolific.com. 招募标注者,要求目标语言为其母语。遵循 ArtELingo(Mohamed et al. 2022a (https://arxiv.org/html/2608.03358#bib.bib10))和 CEDAR(Dai et al. 2026 (https://arxiv.org/html/2608.03358#bib.bib12))的做法,母语作为文化成员资格的标准,每个文化层面的标签反映相应语言社群内的主导感知。在每个社群中,约 70% 的标注者居住在占主导地位的国家(英语社群 69.1% 在英国,中文社群 74.6% 在中国,阿拉伯语社群 73.9% 在埃及);完整的统计信息见补充材料。与 ArtELingo 相同,每位标注者从九个类别(即 contentment、awe、amusement、sadness、fear、excitement、disgust、anger 和 other)中选择一种情绪,并用其母语写一段简短解释。对于每个图像-文化对,我们收集三个独立标注,并将多数情绪作为文化层面的标签;如果未达到多数,则额外招募两名标注者,在五个标注上进行投票,仍然没有多数则丢弃图像。重要的是,每种文化内的标注是独立收集的,以保留跨文化差异。该过程保留了 2,783 张收集图像中的 1,864 张,在三种文化中产生 17,526 条情绪-解释标注。 ### 统计与洞察 ##### 数据集统计。 表1 (https://arxiv.org/html/2608.03358#Sx3.T1) 总结了 ArtECulture 的统计信息。ArtECulture 包含 6,792 件艺术品,其中 4,928 件保留自 ArtELingo,1,864 件为新收集,将西方内容的比例降至 55.89%,非西方内容升至 44.11%(见表1)。
相似文章
EduArt:一个用于评估大语言模型艺术史知识的教育级基准
本文介绍了EduArt,一个包含871道人工编写题目的教育级基准,用于评估多模态大语言模型的艺术史知识与视觉推理能力,揭示了单格式基准会高估模型能力。
MuseBench: 对多模态大语言模型中意图层面视听艺术理解的基准评估
MuseBench是一个全面基准,旨在评估多模态大语言模型对视听艺术中细微意图层面的理解,结果显示即使最佳模型也仅达到48.29%的准确率,而人类专家为87.18%。
Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
表达社会情感:大语言模型与人类文化情感规范的错位
本研究论文考察了大语言模型表达社会情感的方式与人类文化规范的匹配度,发现两者存在系统性错位。与人类回应相比,大语言模型在不同文化身份(欧美裔美国人与拉美裔美国人)下表现出的参与型与抽离型情感表达模式不一致。
AlignCultura:迈向文化对齐的大语言模型?
AlignCultura 推出基于 UNESCO 框架的 CulturaX 数据集与两阶段对齐流程,在 Qwen3-8B 与 DeepSeek-R1-Distill-Qwen-7B 上实现 HHH 指标提升 4–6%,文化失误率降低 18%。