MemeBridge:用于基准测试和缓解表情包解读中双向文化鸿沟的数据集

arXiv cs.CL 论文

摘要

MemeBridge是一个旨在基准测试和缓解表情包解读中双向文化鸿沟的数据集,专注于美国起源的表情包以及来自中国和美国参与者的观点。它包括情感、情绪和文化意义的标注,并表明使用此数据集进行微调可以提高LLM在跨文化理解方面的性能。

arXiv:2609.00491v1 公告类型:新 摘要:跨文化交流本质上具有挑战性,尤其是通过像表情包这样文化密集且模糊的形式。虽然人们期望大型语言模型(LLMs)有望弥合此类鸿沟,但现有的基准数据集往往无法捕捉准确解读所需的文化背景。为此,我们引入MemeBridge,一个以美国起源的表情包为中心的精选数据集,旨在捕捉两种互补的视角:(1)中国参与者如何解读这些表情包,(2)美国参与者如何预期来自其他文化的人可能误解它们。在这里,上下文指隐含的文化知识,包括背景信念、规范和共享假设,这些影响表情包的理解。数据集通过多阶段众包管道构建,并经过严格验证,包括人类一致性检查和基于GPT的分类验证。每个表情包都标注了情感、情绪、文化意义和知识类型,为下游任务提供丰富的监督。值得注意的是,我们观察到美国参与者预期的误解往往不准确,这突显了文化理解的不对称性以及超越自身视角的挑战。这种双向框架,既关注表达又关注感知,使得跨文化理解的基准测试更加细致。我们对多个LLM的探测显示,虽然在不同文化背景下开发的模型表现出部分跨文化理解,但它们往往在复杂解读上挣扎。相比之下,使用MemeBridge进行微调提高了模型性能,强调了在全球化多元环境中训练和评估LLM时,基于文化资源的价值。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:53

# MemeBridge:一个用于评估和缓解表情包解读中双向文化鸿沟的数据集
来源:https://arxiv.org/html/2609.00491
会议:第32届ACM SIGKDD知识发现与数据挖掘会议论文集 第1卷;2026年8月9日至13日;韩国济州岛;第32届ACM SIGKDD知识发现与数据挖掘会议论文集 第1卷(KDD '26),2026年8月9日至13日,韩国济州岛DOI:10.1145/3770854.3785691 (https://doi.org/10.1145/3770854.3785691)ISBN:979-8-4007-2258-5/2026/08CCS:以人为本的计算;人机交互(HCI)CCS:应用计算;社会学,秦苏柳https://orcid.org/0009-0004-0131-2783邮箱:[[email protected]](mailto:[email protected])所属机构:独立研究者,美国德克萨斯州大学城,李卓言https://orcid.org/0000-0001-7143-9262邮箱:[[email protected]](mailto:[email protected])所属机构:美国印第安纳州西拉法叶市普渡大学,姜明https://orcid.org/0000-0002-3604-166X邮箱:[[email protected]](mailto:[email protected])所属机构:美国威斯康星州麦迪逊市威斯康星大学麦迪逊分校,张宇https://orcid.org/0000-0003-0540-6758邮箱:[[email protected]](mailto:[email protected])所属机构:美国德克萨斯州大学城德州农工大学,夏萌https://orcid.org/0000-0002-2676-9032邮箱:[[email protected]](mailto:[email protected])所属机构:美国德克萨斯州大学城德州农工大学

© cc

###### 摘要

跨文化交流本身就充满挑战,尤其是通过表情包这样文化密集且含义模糊的媒介进行沟通。虽然人们期望大语言模型(LLMs)有望弥合此类鸿沟,但现有的基准数据集往往未能捕捉到准确解读所需的文化背景。为解决此问题,我们推出了 MemeBridge,一个以美国原创表情包为核心的精选数据集,旨在捕捉两种互补的视角:(1)中国参与者如何解读这些表情包,以及(2)美国参与者如何预期其他文化背景的人们可能会误解它们。此处的“背景”指隐含的文化知识——塑造表情包理解的背景信念、规范与共享假设。该数据集通过一个包含严格验证的多阶段众包流程构建,包括人类一致性检查和基于 GPT 的分类验证。每个表情包都标注了情感、情绪、文化意义和知识类型,为下游任务提供了丰富的监督信号。值得注意的是,我们观察到美国参与者预期的误解往往是不准确的,突显了文化理解的不对称性以及超越自身视角的挑战。这种双向框架——同时关注表达与感知——使得对跨文化理解的评估更加细致入微。我们对多个 LLM 的探查显示,虽然在不同文化背景下开发的模型表现出一定程度的跨文化理解能力,但它们在面对复杂的解读时往往力不从心。相比之下,使用 MemeBridge 进行微调提升了模型性能,强调了在多元化全球环境中训练和评估 LLM 时,具备文化基础资源的价值。

###### 关键词:

人类行为分析,用于社会分析的 NLP 工具

††cc-许可:by

## 1. 引言

(图片说明中引用了一张表情包图片。)图 1。该表情包以幽默方式扭曲历史,夸大了 Mendes 和 Cabello 的关系。不熟悉‘Gonna Tell My Kids’表情包格式或美国流行文化的中国人可能会感到困惑,导致尴尬的交流。(图片说明中引用了另一张表情包图片。)表情包作为数字通信中的一种言语行为形式,使网民能够通过共享的文化参考和符号线索进行社会互动(Grundlingh, 2018 (https://arxiv.org/html/2609.00491#bib.bib1))。然而,表情包不仅仅是视觉幽默;它们作为文化产物,反映着社会趋势、语言差异和代际差异。对其解读往往深深植根于文化背景,使其容易受到不同背景个体的误解(Mukhtar 等,2024 (https://arxiv.org/html/2609.00491#bib.bib2))。例如,当中国人试图解读源自美国的表情包时,在幽默、历史引用和社会规范方面可能观察到显著的差距。为研究此问题,我们对八位目前居住在美国的中国人进行了非正式访谈。许多参与者分享了他们对使用表情包可能导致沟通不畅的担忧,如下引用所示。

> “……老实说,有时我担心用错表情包,不小心和我的(美国)朋友引起尴尬或冲突……”

此外,随着全球社交媒体平台的持续扩张,这个问题可能变得越来越普遍,甚至影响到不居住在美国的中国人。在我们的访谈之后发现,虽然中国人通常使用其自身文化圈内的平台,如微信和微博,但他们中的许多人也使用 Twitter 和 Facebook 等全球平台,从而也接触到其他文化(Tsai and Men, 2017 (https://arxiv.org/html/2609.00491#bib.bib4))。缺乏文化熟悉度可能导致无意的误解或不协调的社会互动,如图 1 (https://arxiv.org/html/2609.00491#S1.F1) 所示。解决这些鸿沟对于改善跨文化数字沟通和降低在线讨论中的误解风险至关重要。

随着大语言模型(LLMs)的不断进步,GPT-4o(Hurst 等,2024 (https://arxiv.org/html/2609.00491#bib.bib29))、Llama-3.2-Vision(Dubey 等,2024 (https://arxiv.org/html/2609.00491#bib.bib28))、GLM-4V(Team 等,2024 (https://arxiv.org/html/2609.00491#bib.bib6))和 Qwen-VL(Bai 等,2023 (https://arxiv.org/html/2609.00491#bib.bib5))等多模态变体已日益普及于公众。鉴于其处理和生成文本与视觉内容的能力,多模态 LLM 为弥合沟通中的文化鸿沟(包括表情包解读)提供了一个潜在的解决方案。然而,先前关于文化知识库的研究(Shi 等,2024 (https://arxiv.org/html/2609.00491#bib.bib23))已证明,LLMs 主要反映以西方为中心的视角,使得非西方受众难以充分理解蕴含文化背景的内容。此外,训练数据中的偏差以及对文本与图像关系理解的局限,可能导致 LLM 生成有偏差或不准确的表情包解释(Zhong and Baghel, 2024 (https://arxiv.org/html/2609.00491#bib.bib7))。尽管 LLM 日益复杂,但这些局限引发了对其能否有效跨文化解读和语境化表情包,以及能否帮助人们理解来自不同国家的表情包的担忧,因此有必要进一步研究其在跨文化表情包理解方面的性能。

已有的几个表情包数据集支持了表情包理解、标题生成和有害内容检测方面的进展。然而,这些数据集并非设计用于明确解决跨文化解读问题。相比之下,我们的工作通过引入双向框架,旨在弥合表情包理解中的文化鸿沟,同时捕捉母语者的解读和潜在的跨文化误解。此外,我们纳入了基于文化背景的情感和情绪标注,以及母语者验证以确保解读的忠实度。表 1 (https://arxiv.org/html/2609.00491#S1.T1) 总结了这些关键区别,突显了 MemeBridge 如何补充而非直接替代现有资源。

| 特征 | FigMemes(Liu 等,2022 (https://arxiv.org/html/2609.00491#bib.bib14)) | MemeCap(Hwang and Shwartz, 2023 (https://arxiv.org/html/2609.00491#bib.bib16)) | Multi3Hate(Bui 等,2024 (https://arxiv.org/html/2609.00491#bib.bib22)) | MemeBridge |
| :--- | :---: | :---: | :---: | :---: |
| 双向框架 | ✗ | ✗ | ✗ | ✓ |
| 情感标注 | ✗ | ✗ | ✗ | ✓ |
| 情绪标注 | ✗ | ✗ | ✗ | ✓ |
| 解读说明 | ✗ | ✓ | ✗ | ✓ |
| 母语者标注 | ✗ | ✓ | ✓ | ✓ |

表 1。MemeBridge 与现有表情包数据集的比较。

在本文中,我们研究了先进的 LLM 解读美国表情包的能力,重点关注其提供解释、检测情感和识别情绪的能力。为促进本研究,我们构建了 MemeBridge,一个由美国本土参与者贡献的精心策划的表情包数据集。每个表情包条目都包含解释、不同文化背景的个体可能遇到的误解,以及情感和情绪标注。使用此数据集,我们评估和微调了多个 LLM,以评估其在跨文化表情包解读方面的有效性。

通过大量实验,我们有以下关键观察:(1)表情包解读中的文化鸿沟是双向的。中国人在理解美国表情包时面临挑战,在确定其解释方面的准确率为 58.8%,标注情感的准确率为 45%,标注情绪的准确率为 48.9%。同样,美国参与者也难以准确预测中国人如何误解表情包,因为美国参与者提出的误解往往与中国人实际持有的误解不一致。(2)模型性能与开发国的关联不强。尽管由中国或美国的组织开发,所有评估的 LLM 在各任务上表现出可比的性能和行为模式。这表明,当代的对齐和安全调整实践减轻了明显的、源于特定文化背景的偏见,而非嵌入强烈的国家视角。(3)LLM 展现出文化意识和适应性。明确指示 LLM 采用特定的文化视角会显著影响其解读性能。与默认设置相比,所有测试的模型在扮演美国参与者或中国参与者时都表现出性能差异。这表明它们能够适应不同的文化身份和视角。

## 2. 相关工作

LLM 中的文化意识。LLM 在各个领域的普及和应用带来了挑战以及对文化意识的需求(Pawar 等,2025 (https://arxiv.org/html/2609.00491#bib.bib20); Ramezani and Xu, 2023 (https://arxiv.org/html/2609.00491#bib.bib9))。现有研究发现,LLM 在理解文化符号时存在偏见,对不同区域文化的性能不同,且难以达到人类水平(Yao 等,2024 (https://arxiv.org/html/2609.00491#bib.bib10))。例如,Shi 等 (2024) (https://arxiv.org/html/2609.00491#bib.bib23) 已证明,LLM 主要反映以西方为中心的视角,使得非西方受众难以充分理解蕴含文化背景的内容。为解决此问题,越来越多的研究(Shi 等,2024 (https://arxiv.org/html/2609.00491#bib.bib23); Zhao 等,2024 (https://arxiv.org/html/2609.00491#bib.bib21); Li 等,2024 (https://arxiv.org/html/2609.00491#bib.bib18))探讨了将文化理解融入 LLM 的各个方面,旨在弥合沟通鸿沟并促进有效的跨文化交流。例如,Nguyen 等 (2023) (https://arxiv.org/html/2609.00491#bib.bib17) 提出了 Candle,一种从网络语料库中大规模提取文化常识知识的端到端方法。尽管这些研究提供了宝贵的信息,但其中许多关注的是基于文本信息的机器翻译。最近,图像跨文化改编(transcreation)的概念承认了需要调整视觉内容以使其符合文化适宜性(Khanuja 等,2024 (https://arxiv.org/html/2609.00491#bib.bib19)),代表了弥合视觉语言理解与文化解读之间鸿沟的重要一步。

使用多模态 LLM 进行跨文化理解。最近一些关于多模态 LLM 的工作强调了在多样化语言和文化背景下调整多模态推理的挑战。一个主要焦点是多模态任务中的文化适应性,研究人员探索模型如何在不同文化中解读视觉和文本信息,强调了需要反映这种多样性的数据集(Liu 等,2021 (https://arxiv.org/html/2609.00491#bib.bib30); Li and Zhang, 2023 (https://arxiv.org/html/2609.00491#bib.bib31))。另一个关键领域是文化影响的语言推理,研究文化规范如何塑造推理,特别是在自然语言推理和比喻语言理解等任务中(Huang and Yang, 2023 (https://arxiv.org/html/2609.00491#bib.bib32); Kabra 等,2023 (https://arxiv.org/html/2609.00491#bib.bib33))。此外,关于幽默、讽刺和有害内容检测的工作表明了文化感知 AI 的必要性,因为幽默和仇恨言论往往依赖于细微的文化背景(Nandy 等,2024 (https://arxiv.org/html/2609.00491#bib.bib12); Bui 等,2024 (https://arxiv.org/html/2609.00491#bib.bib22))。总的来说,这些研究强调了将文化意识融入视觉语言模型的重要性,以增强其在全球应用中的鲁棒性和公平性。这些研究启发我们去探究表情包的跨文化理解——这种在线社区中流传的动态且非正式的媒体。

表情包的跨文化理解与评估。已收集了多个数据集以促进对表情包的理解。例如,Zannettou 等 (2018) (https://arxiv.org/html/2609.00491#bib.bib8) 收集并分析了来自四个主要在线社区(即 Twitter、Reddit、4chan 的 /pol/ 和 Gab)的 1.6 亿张图片,建立了一个用于跨平台表情包追踪和分析的方法论框架。FigMemes(Liu 等,2022 (https://arxiv.org/html/2609.00491#bib.bib14))专注于政治表情包中比喻语言的识别。MCC(Sharma 等,2023 (https://arxiv.org/html/2609.00491#bib.bib13))包含 3,400 个表情包及其背景,专注于检测表情包的解释性证据。MemeCap(Hwang and Shwartz, 2023 (https://arxiv.org/html/2609.00491#bib.bib16))可评估视觉语言模型在表情包标题生成任务中的表现。SemanticMemes(Zhou 等,2024 (https://arxiv.org/html/2609.00491#bib.bib15))强调了语义聚类。MemeMQA(Agarwal 等,2024 (https://arxiv.org/html/2609.00491#bib.bib11))提供了一个多模态问答框架,以实现对表情包更好的语义解释。Multi3hate(Bui 等,2024 (https://arxiv.org/html/2609.00491#bib.bib22))专为特定任务设计,如背景理解和仇恨言论检测。这些研究增强了对表情包的理解和解读,但未能充分从跨文化视角解决其理解问题。我们的工作通过众包收集数据,并要求参与者提供每个表情包的解释和可能的误解,以及情感和情绪标签。此外,我们通过提示 LLM 扮演不同文化背景的人,提出了一种新颖的跨文化评估设计,从而能够更直接和定量地评估跨文化理解。

相似文章

ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试

arXiv cs.CL

本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。