大型语言模型中的比喻与文化知识:通过微调研究跨领域迁移

arXiv cs.CL 论文

摘要

本研究探讨了在大型语言模型上微调文化数据是否能提升比喻语言的理解能力,反之亦然。研究发现,虽然诗歌微调能增强成语理解,但文化微调可能会降低谚语准确率,突显了两者之间关系的非直接性。

arXiv:2608.18361v1 公告类型:新 摘要:比喻语言深植于文化之中;流利使用不仅需要语言能力,还需要文化沉浸。我们探究大型语言模型是否能学习这种联系:在文化数据上微调是否能提升比喻语言的理解能力,反之亦然?我们对四个模型(ALLaM-7B、Fanar-1-9B、Qwen3-8B、Llama-3.1-8B)和六个涵盖文化常识、谚语和诗歌的阿拉伯语数据集进行了系统研究,这些数据集来自不同方言和地区。诗歌微调提高了成语理解(+2.33%,p<0.05),这一提升在我们的阿拉伯语MMLU对照实验中未重复出现,表明其源于比喻内容而非阿拉伯语适应性,并指向对非字面意义的敏感性可跨比喻类型迁移。相比之下,文化微调降低了两个以阿拉伯语为中心的模型的谚语解释准确率。两个领域之间的迁移与噪声无显著差异,阿拉伯语模型在微调后经常退步,表明相关知识先前已饱和,而多语言模型显示出更大的适应空间。错误分析进一步表明,微调强化了体验性文化知识,同时破坏了基于历史的事实知识。我们的研究结果表明,文化与比喻语言之间的关系,虽然概念上自然,但仅通过微调无法直接捕捉。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:09

# 大语言模型中的隐喻与文化知识:通过微调研究跨领域迁移
来源:https://arxiv.org/html/2608.18361
Mona Diab单位:MBZUAI,卡内基梅隆大学\{mena\.attia, thamar\.solorio\}@mbzuai\.ac\.ae Thamar Solorio

###### 摘要

隐喻性语言深深植根于文化之中;熟练运用不仅需要语言能力,更需文化浸润。我们探究大语言模型是否能习得这种关联:在文化数据上微调能否提升隐喻性语言理解能力,反之亦然?我们系统性地研究了四种模型(ALLaM\-7B、Fanar\-1\-9B、Qwen3\-8B、Llama\-3\.1\-8B)和六个涵盖文化常识、谚语与诗歌的阿拉伯语数据集(涵盖多方言和多地区)。在诗歌数据上微调可提升习语理解能力(\+2\.33%,p<0\.05),而阿拉伯语版多任务语言理解基准的对照实验并未复现此提升,表明该进步源于隐喻内容而非阿拉伯语适应性调整,这指向模型对非字面意义的敏感性可跨隐喻类型迁移。相反,文化数据微调会降低阿拉伯中心模型在谚语解释上的准确率。除上述情况外,两个领域间的迁移效应与噪声无法区分,阿拉伯语模型在微调后常出现性能下降,表明相关知识已趋于饱和;而多语言模型则显示出更大的适应空间。误差分析进一步揭示,微调会强化体验性文化知识,但会动摇基于历史的事实性知识。我们的发现表明,文化与隐喻语言的关系虽在概念上自然存在,但仅通过微调难以直接捕捉。

## 1 引言

参见说明 图1:埃及电视剧《内莉与谢里汉》中的场景。隐喻性语言深深植根于文化。谚语、习语和诗歌不仅传达非字面意义,还编码了共享价值观、社会规范与历史经验,因此理解它们需依赖对产生这些语言形式的社群的熟悉度,而非仅凭语言能力。这一前提在自然语言处理(NLP)领域外已得到充分证实。认知语言学记录了隐喻意义广泛存在的跨文化差异:即使是基于共同身体体验的概念隐喻,在不同言语社群中也被差异化地阐释与常规化(Kovecses2005),而文化概念通过语言编码与再生产(sharifian2017cultural)。常规隐喻语言理论同样将习语视为需结合文化特有内涵解读的单元,因此一个习语在结构上可能透明,对局外人却难以理解(Dobrovolskij1756694);谚语研究也提出相同观点:谚语的力量源于社群共享的经验储备,而非组合意义(mieder2004proverbs;mieder1993proverbs)。认知科学亦趋同此观点:隐喻解读直接调用概念与背景知识,而非延伸字面解码(gibbs1994poetics)。综合来看,这些文献促使我们将隐喻能力与文化知识视为相互关联而非独立的能力。

2016年埃及电视剧《内莉与谢里汉》提供了一个具体实例。内莉富有且西化,她多次尝试使用埃及谚语却误用,引发纠正后以“无所谓”回应,而她的工薪阶层表亲却能熟练运用这些表达(图1)。其喜剧效果之所以成立,是因为观众已共享“误用谚语意味着文化疏离”的规范,这本身就证明了二者的关联性。

然而在NLP领域,二者被分别研究。文化基准测试评估事实知识、常识推理、社会实践与地区差异;隐喻性语言基准测试则评估谚语、习语、诗歌和隐喻的解读能力。这两种形式的知识在大语言模型中是否相互支持尚未得到验证:我们不知道以文化为基础的监督能否改善隐喻解读,也不清楚隐喻监督能否构建更普遍的文化知识。

我们通过阿拉伯语受控微调实验,研究文化知识与隐喻语言理解的跨领域迁移,以填补这一空白。我们探讨两个迁移方向:其一,文化数据微调能否提升阿拉伯语习语和谚语的解读能力;其二,隐喻语言数据微调能否提升基于文化的问题回答表现。此外,我们研究跨隐喻形式的迁移,探究谚语或诗歌的监督能否提升对未见过的习语和谚语的理解。第三,由于两种监督都涉及阿拉伯语接触,我们还探讨所观察到的迁移究竟反映训练数据内容还是仅源于阿拉伯语适应性。这些实验使我们能够区分文化与隐喻语言间的迁移,以及可能跨非字面形式泛化的跨形式隐喻迁移。

我们的贡献如下:(1)提出一个受控框架,研究阿拉伯语文化知识与隐喻语言理解的双向迁移;(2)提供模型、方言和主题层面的分析,表明微调效应有限、分布不均,且同时依赖模型家族与知识类型;(3)确定诗歌微调是唯一可靠的正向隐喻迁移来源,支持跨形式隐喻迁移的可能性(不局限于单一非字面类别)。

总体而言,我们的结果表明文化知识与隐喻语言的关系难以通过微调直接捕捉。迁移效应通常微小、不一致且高度依赖模型。

## 2 相关工作

### 2.1 隐喻语言与文化的基准测试

全球隐喻基准测试。在英语中,Fig\-QAliu\-etal\-2022\-testing将隐喻解读构建为多项选择问答任务,而FLUTEchakrabarty\-etal\-2022\-flute为习语及其他隐喻类别提供人类撰写的解释。多语言覆盖较薄。MABLkabra\-etal\-2023\-multi在八种语言中评估隐喻理解,MAPSliu\-etal\-2024\-multilingual在多种语言中评估谚语理解,ProverbEvalazime\-etal\-2025\-proverbeval覆盖埃塞俄比亚语言和英语中的文化谚语,MIDIalmheiri\-etal\-2026\-multilingual涵盖18种语言的习语。AdMIRe 2共享任务arslan\-etal\-2026\-mwe挑战模型在多语言中解读习语表达。

阿拉伯语隐喻基准测试。近期三个基准测试针对阿拉伯语:Jawahermagdy\-etal\-2025\-jawaher(多方言的大规模谚语集合)、Kinayatattia\-etal\-2026\-beyond(埃及阿拉伯语习语基准)和FannOrFlopalghallabi2025fannflopmultigenremultiera(跨越多体裁和时代的诗歌解读基准)。我们从这些资源中获取训练和评估数据(第3.1节)。

全球文化基准测试。BLEnDmyung2025blendbenchmarkllmseveryday涵盖16个地区和13种语言的52.6K问答对,CulturalBenchchiu\-etal\-etal\-2025\-culturalbench通过人类-AI红队测试覆盖45个地区,但两者都强调事实性文化知识。ALM\-Benchvayani2025languagesmatterevaluatinglmms和CVQAromero2024cvqaculturallydiversemultilingualvisual分别将覆盖扩展至100种和31种语言,但目标均为视觉和常识知识而非隐喻解读。

阿拉伯语文化基准测试。AraDiCEmousi2024aradicebenchmarksdialectalcultural、CAMEL\-Benchghaboura2024camelbenchcomprehensivearabiclmm和CIDARalyafeai\-etal\-2024\-cidar涵盖方言差异、文化知识和推理,但聚焦于事实性或任务导向理解。隐喻语言仅在其他场合零星出现:ArabCulturesadallah2025commonsensereasoningarabculture覆盖13个国家和12个主题,但每国仅分配五个习语样本;Palmalwajih\-etal\-2025\-palmt将谚语作为22个国家20个主题之一,未深入评估。在阿拉伯语和全球基准测试中,隐喻语言始终处于边缘地位,这推动了针对文化基础隐喻理解的专用评估框架的需求。

### 2.2 提升隐喻解读

先前工作主要分为两个方向:任务特定微调和结构化提示。监督微调仍占主导:yayavaram\-etal\-2024\-bert训练基于BERT的模型,目标为捕获词汇凝聚力和跨语言翻译,在习语检测上取得提升;pragmatic\_sarcasm表明微调后的编码器模型在多语言讽刺检测上优于仅解码器的大语言模型,凸显了仅通过预训练捕捉隐含文化意义的难度。第二条路线在无参数更新情况下引发隐喻推理:prystawski2023psychologicallyinformedchainofthoughtpromptsmetaphor使用心理学启发的思维链提示进行隐喻解读,lee\-etal\-2025\-pragmaticpropose提出务实元认知提示,为隐含意义和字面-意图差异的推理提供脚手架。此外,少量工作注入显式知识或人类启发策略:chakrabarty\-etal\-2022\-rocketmodel为叙事中的习语和明喻解释建模情境推理和组合推理,表明仅靠预训练表示远不及人类表现。

### 2.3 文化适应与跨领域迁移

平行文献致力于使模型适应特定文化,通常通过微调文化基础数据li2024culturellm;pham\-etal\-2025\-cultureinstructor,或为每种文化训练独立适配器adilazuarda\-etal\-2025\-surveys。对于阿拉伯语,PalmX共享任务alwajih\-etal\-2025\-palmx推动了一系列文化微调系统,almheiri\-etal\-2025\-crossshow表明文化常识可在轻量级对齐下跨阿拉伯国家迁移。

在上述所有研究中,适应目标是文化知识本身,正如隐喻基准测试独立评估隐喻能力。我们研究的是任一领域的监督能否迁移到另一领域,以及是否跨隐喻形式迁移(如从诗歌到谚语和习语)。

## 3 实验设置

为探究大语言模型中文化与隐喻语言的关联,我们设计了一个受控的微调与评估框架,以隔离两个领域间的迁移方向。我们设计三个互补实验,研究阿拉伯语大语言模型中文化知识与隐喻语言理解的双向迁移:

1. 1\. 文化微调的影响:我们在阿拉伯语文化数据集上微调,评估其对习语和谚语理解的影响。
2. 2\. 隐喻语言微调的影响:我们在阿拉伯语诗歌和谚语上微调,评估其对习语和谚语理解的影响。
3. 3\. 语言内容的贡献(对照组):我们在通用阿拉伯语数据上微调,并在同一基准上评估,以检验迁移是否特指文化内容,还是泛指阿拉伯语接触。

数据集描述规模覆盖范围用途AraDiCE\-Culturemousi2024aradicebenchmarksdialectalcultural多项选择文化常识推理基准测试1806个阿拉伯国家测试ArabCulturesadallah2025commonsensereasoningarabculture阿拉伯世界的文化知识和实践3,48213个阿拉伯国家训练Palmalwajih\-etal\-2025\-palm阿拉伯语文化常识和社会推理15\.5k(训练),1\.93k(测试)22个阿拉伯国家训练FannOrFlopalghallabi2025fannflopmultigenremultiera诗歌-解释对,涵盖14种体裁、12个时代的诗歌偏好和审美判断6,984阿拉伯诗歌训练Jawahermagdy\-etal\-2025\-jawaher阿拉伯谚语理解和解释800(训练),198(测试)20种阿拉伯变体训练、测试Kinayatattia\-etal\-2026\-beyond埃及阿拉伯语习语-解释对150埃及阿拉伯语测试ArabicMMLUkoto\-etal\-2024\-arabicmmlu阿拉伯语言和语法多项选择题(对照)980现代标准阿拉伯语训练表1:用于训练和评估的数据集,涵盖阿拉伯语变体和地区的隐喻语言与文化知识。文化数据集(AraDiCE\-Culture、ArabCulture、Palm)和隐喻语言数据集(FannOrFlop、Jawaher、Kinayat)在视觉上区分;ArabicMMLU用作对照。### 3.1 数据集

#### 训练与评估数据。

表1总结了使用的所有资源;均为公开数据。隐喻监督来自Jawahermagdy\-etal\-2025\-jawaher训练集和FannOrFlopalghallabi2025fannflopmultigenremultiera,文化监督来自ArabCulturesadallah2025commonsensereasoningarabculture和Palmalwajih\-etal\-2025\-palm训练集。我们使用AraDiCEmousi2024aradicebenchmarksdialectalcultural评估文化理解,使用Jawaher测试集和Kinayatattia\-etal\-2026\-beyond评估隐喻理解。

#### 设计选择。

首先,由于Palm包含谚语主题类别,我们移除所有谚语主题项目,确保文化条件均不包含隐喻监督。其次,每个条件使用1,000样本子集训练,Jawaher因仅含800训练样本而例外。FannOrFlop和ArabCulture的全语料库训练作为消融研究见附录D。第三,由于每个微调条件都涉及阿拉伯语文本接触,任何基准上的提升可能反映语言适应而非训练数据内容。因此我们增加对照组,使用ArabicMMLUkoto\-etal\-2024\-arabicmmlu的阿拉伯语(通用)和阿拉伯语(语法)子集训练,共980个示例。

#### 数据准备。

所有训练数据均转化为开放式生成格式。对于多项选择数据集,问题作为输入,正确答案作为目标,丢弃错误选项;对于生成式数据集,输入表达式作为输入,其解释或解读作为目标。提示模板见附录A。对于Jawaher评估,我们使用attia\-etal\-2026\-beyond的干扰项;Kinayat和AraDiCE使用原始发布版本。Jawaher和Kinayat每项两个选项(50%机会基线),AraDiCE三个选项(33\.3%)。

### 3.2 模型与评估

我们同时使用多语言和阿拉伯语中心的指令微调模型。所有模型均使用参数高效的低秩适配(LoRA)hu2021loralowrankadaptationlarge进行微调。微调设置见附录B。多语言模型为LLaMA 3\.1–8B Instructgrattafiori2024llama3herdmodels和Qwen 3–8Byang2025qwen3technicalreport。阿拉伯中心模型为Fanar\-1\-9B–Instructfanarteam2025fanararabiccentricmultimodalgenerative和ALLaM–7B–Instructbari2025allam。所有模型均在相同训练和推理条件下评估以确保可比性。

相似文章

迈向超越英语中心化开发的大语言模型

arXiv cs.CL

本文证明了大语言模型严重偏向英语,并表明持续预训练在将模型适配到其他语言(尤其是文化理解方面)时,并不比从头训练更具成本优势。

跨语言引导的比喻语言生成

arXiv cs.CL

本文探讨了多语言大语言模型中内部表示的跨语言迁移,用于比喻语言生成,表明在一种语言中学习到的激活方向可以有效引导其他语言的生成。

当英语改写本地知识:大语言模型中的全球叙事主导

arXiv cs.CL

本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。