CAMMAR:文化感知的Matryoshka隐喻阿拉伯语表示
摘要
CAMMAR引入了一个表示学习框架,通过分阶段的语义课程将阿拉伯语隐喻意义组织成嵌套的词汇、文化和隐喻子空间,在一个新的跨度标注数据集上实现了强大的隐喻检测(AUC高达0.84)。
arXiv:2607.15847v1 公告类型:新
摘要:阿拉伯语中的隐喻是一种根植于文化的意义构建机制,编码了塑造解释的文化知识。然而,当前阿拉伯语语言模型通常将词汇、文化和隐喻信息压缩到一个单一的表示空间中,我们称这种现象为“语义混叠”。我们提出了CAMMAR(面向隐喻性阿拉伯语表示的文化感知Matryoshka),这是一个表示学习框架,通过分阶段的语义课程将意义组织成嵌套的词汇、文化和隐喻嵌入子空间。该设计实现了Al-Jurjani的nazum理论的组成原则,将比喻意义建模为组成性地基于先前的语义关系,并产生了一种基于词汇表示与隐喻表示之间距离的无需训练的隐喻性几何度量。
在一个新的跨度标注阿拉伯语隐喻集(单词匹配的比喻/字面对)上进行评估,当层间几何由配对监督塑造时,几何读出的隐喻检测显著高于随机水平(AUC高达0.84;同一单词的比喻性表示在82.6%的配对中优于其字面对应),但在无监督领域对比下仅处于随机水平,这清晰区分了监督下可读状态与非涌现状态。受控消融实验表明,将词汇层基于词根会带来微小但一致的提升,这种效果在直接探测中不存在,反映了该层作为测量锚点的质量。我们将在论文接受后发布数据集、文化概念清单和代码。
查看缓存全文
缓存时间: 2026/07/20 09:35
# CAMMAR: 面向阿拉伯隐喻表征的文化感知套娃式表示 来源:https://arxiv.org/html/2607.15847 Suzan Awinat 马德里自治大学(UAM)计算机工程系 IE大学科学与技术学院 西班牙马德里 [email protected] & Alfonso Ortega de la Puente 奥维耶多大学计算机科学系 西班牙阿斯图里亚斯 ###### 摘要 阿拉伯语中的隐喻是根植于文化的一种意义构建机制,它编码了塑造理解方式的文化知识。然而,当前的阿拉伯语语言模型通常将词汇、文化和隐喻信息压缩到单一的表征空间中,我们将此现象称为“语义涂抹”(semantic smearing)。我们提出 CAMMAR(面向阿拉伯隐喻表征的文化感知套娃式表示),这是一种表征学习框架,通过分阶段语义课程将意义组织为嵌套的词汇、文化和隐喻嵌入子空间。该设计实现了 Al-Jurjānī 的*naẓm*()理论的组合原则,将比喻意义建模为基于先前语义关系的组合性基础,并产生了一种无训练的几何隐喻度量,基于词汇表征与隐喻表征之间的距离。 在一个新构建的、以单词匹配的比喻/字面配对形式进行跨度标注的阿拉伯隐喻测试集上,当层间几何形状受到配对监督塑造时,该几何读出方法能够显著高于随机水平地检测隐喻(AUC 最高达 0.84;对于同一单词,比喻用法在 82.6% 的配对中得分超过其字面用法),但在仅使用无监督领域对比时表现与随机无异——这清晰地区分了“在监督下可解读”与“不可涌现”两种状态。一项受控消融实验表明,将词汇层基于词根进行 grounding 能带来微小但一致的收益,而直接探针分析未观察到该效应,这表明该层作为测量锚点的特性。我们将在论文接收后发布数据集、文化概念清单和代码。 CAMMAR:面向阿拉伯隐喻表征的文化感知套娃式表示 Suzan Awinat††thanks:通讯作者。 马德里自治大学(UAM)计算机工程系 IE大学科学与技术学院 西班牙马德里 [email protected] Alfonso Ortega de la Puente 奥维耶多大学计算机科学系 西班牙阿斯图里亚斯 ## 1 引言 隐喻是自然语言处理中最持久的挑战之一。尽管大语言模型(LLMs)在大多数生成和判别基准上取得了近期进展,但多项评估表明,比喻语言理解能力仍远低于人类水平,尤其是在文化密集或修辞复杂的上下文中(Zhang et al., 2025b (https://arxiv.org/html/2607.15847#bib.bib16); Sanchez-Bayona and Agerri, 2025 (https://arxiv.org/html/2607.15847#bib.bib17); Mangiaterra et al., 2026 (https://arxiv.org/html/2607.15847#bib.bib19))。这个问题在阿拉伯语中尤为突出。近期专门针对阿拉伯语比喻语言设计的基准测试报告了通用模型和阿拉伯语专用模型均存在系统性失败。*Fann or Flop*(Al Ghallabi et al., 2025 (https://arxiv.org/html/2607.15847#bib.bib20))表明,最先进的 LLMs 无法可靠地捕捉古典阿拉伯诗歌在不同历史时期的解读深度。Attia 等人(2026 (https://arxiv.org/html/2607.15847#bib.bib22))记录了当 22 个 LLMs 在理解具有文化基础的阿拉伯习语的*语用用法*时,与同一表达的多项选择理解相比,准确率下降了超过 14 个百分点。这些发现表明,差距不在于模型规模,而在于隐喻意义在内部的表征方式。 我们假设一个重要的结构性原因如下:标准密集嵌入将词汇意义、文化象征意义和隐喻抽象意义压缩到单一共享空间——我们称之为*语义涂抹*。这对阿拉伯语尤为严重,因为一个三辅音词根既能生成具体的词汇项,也能生成惯用的隐喻扩展:例如, – 既产生 *asad*(狮子,动物),也产生其勇敢和领导力的比喻含义。 阿拉伯修辞传统(*al-Balāgha*,)在一千多年前就已区分字面意义(*ḥaqīqa*)和隐喻意义(*majāz*)。其奠基人物 Al-Jurjani (1078 (https://arxiv.org/html/2607.15847#bib.bib1)) 认为,意义并非存在于单个词汇项中,而是存在于它们之间的关系中:他的*naẓm*()概念认为意义产生于结构化组合,而他关于隐喻的论述 (Al-Jurjani, 1954 (https://arxiv.org/html/2607.15847#bib.bib2)) 将比喻性解读建立在与其字面锚点之间的关系(*’alāqa*)之上,这一观点由 Al-Zamakhshari (1882 (https://arxiv.org/html/2607.15847#bib.bib3)) 和 Al-Sakkaki (1983 (https://arxiv.org/html/2607.15847#bib.bib4)) 进一步阐述,并与现代将隐喻视为跨域映射的观点 (Lakoff and Johnson, 1980 (https://arxiv.org/html/2607.15847#bib.bib30)) 相呼应。我们在表征学习框架中实现了这种组合的、关系性的观点。 我们提出 CAMMAR(面向阿拉伯隐喻表征的文化感知套娃式表示),它将阿拉伯语比喻意义组织成三个维度递减的嵌套嵌入子空间:外层为词汇层,中间层为文化层,内层为隐喻层,共享同一阿拉伯语骨干网络,并通过一个三阶段课程进行训练,该课程在构建后续抽象层的同时保护早期结构。与标准套娃式表征学习 (Kusupati et al., 2024 (https://arxiv.org/html/2607.15847#bib.bib7))(对所有前缀进行相同监督)不同,CAMMAR 为逐渐内层的前缀分配逐渐抽象的目标。基于此结构,我们推导出一个连续的*隐喻权重* $W_{\text{met}}$,在推理时通过外层与内层之间的几何发散度读出,从而提供每个单词可解释的隐喻性估计,无需监督分类器。 我们在一个由作者验证的、跨度标注的阿拉伯隐喻测试集上评估 CAMMAR。我们的实验探究了隐喻性是否可以在层间几何形状中可读,以及在何种监督条件下可读,以及将词汇层基于形态词根进行 grounding 是否有助于改善读出结果。 我们的贡献如下: - • CAMMAR,一个顺序嵌套监督框架,沿单个阿拉伯编码器的嵌套前缀施加一个语义目标逐渐抽象的课程。 - • 对比喻语言嵌入中*语义涂抹*的形式化定义,以及一种通过跨训练阶段受控冻结来缓解该问题的层次正则化策略。 - • 一个几何*隐喻权重* $W_{\text{met}}$,通过前缀发散度估计每个单词的隐喻性,无需在训练时使用示例级别的隐喻标注。 - • 一个规模虽小但精心构建的、由作者验证的阿拉伯隐喻目标词级别评估集,将与模型一同发布。 ## 2 相关工作 CAMMAR 处于计算隐喻处理、阿拉伯文化语义建模和嵌套表征学习的交叉点。 #### 计算隐喻处理。 神经隐喻处理 (Shutova and Ekaterina, 2010 (https://arxiv.org/html/2607.15847#bib.bib11)) 已从特征工程转向上下文表征 (Do Dinh and Gurevych, 2016 (https://arxiv.org/html/2607.15847#bib.bib12); Choi et al., 2021 (https://arxiv.org/html/2607.15847#bib.bib13)),近期工作将隐喻性处理为单词字面意义与其上下文之间的上下文敏感差异 (He et al., 2024 (https://arxiv.org/html/2607.15847#bib.bib14); Jia and Li, 2024 (https://arxiv.org/html/2607.15847#bib.bib15))。CAMMAR 共享这一直觉,但将其内在化于*单一*嵌套嵌入之中,而非跨越两个模型。该框架的动机源于评估结果:模型规模本身并不能解决隐喻问题——LLMs 依赖表面启发式 (Sanchez-Bayona and Agerri, 2025 (https://arxiv.org/html/2607.15847#bib.bib17)),检测 F1 值低 (Boisson et al., 2024 (https://arxiv.org/html/2607.15847#bib.bib18)),且对新颖隐喻判断错误 (Mangiaterra et al., 2026 (https://arxiv.org/html/2607.15847#bib.bib19))。 #### 阿拉伯语比喻语言与文化差距。 在阿拉伯语中,隐喻与形态学和继承而来的象征意义纠缠在一起。基准测试表明,最先进的模型在古典阿拉伯诗歌 (Al Ghallabi et al., 2025 (https://arxiv.org/html/2607.15847#bib.bib20)) 以及具有文化基础的习语和谚语 (Magdy et al., 2025 (https://arxiv.org/html/2607.15847#bib.bib21); Attia et al., 2026 (https://arxiv.org/html/2607.15847#bib.bib22); Zibin et al., 2025 (https://arxiv.org/html/2607.15847#bib.bib23)) 上均会失败。先前关于阿拉伯语隐喻的工作大多是针对小数据集的监督二分类,或者是将比喻视为下游应用的符号资源 (Banou et al., 2025 (https://arxiv.org/html/2607.15847#bib.bib24))。据我们所知,没有先前工作通过*层次化学习表征*来建模阿拉伯语比喻意义,从而在一个几何空间内分离词汇、文化和比喻内容。跨语言研究进一步证实,比喻意义依赖于特定语言的文化基础,而非表面迁移 (Sanchez-Bayona and Agerri, 2026 (https://arxiv.org/html/2607.15847#bib.bib25); Tourajmehr et al., 2025 (https://arxiv.org/html/2607.15847#bib.bib26))。 #### 嵌套表征学习。 套娃式表征学习 (Kusupati et al., 2024 (https://arxiv.org/html/2607.15847#bib.bib7)) 在同一个目标下嵌套嵌入,促进紧凑性而非专门化;Lai 等人 (2026 (https://arxiv.org/html/2607.15847#bib.bib9)) 表明,相同监督下的前缀仅在梯度幅度上有差异,没有方向性分化。扩展工作增加了顺序训练和自适应维度选择 (Zhang et al., 2025a (https://arxiv.org/html/2607.15847#bib.bib8)) 以及强大的阿拉伯语嵌套嵌入 (Nacar and Koubaa, 2024 (https://arxiv.org/html/2607.15847#bib.bib6)),但它们的课程是针对*压缩率*而言的;CAMMAR 的课程则针对*语义抽象*,为不同前缀分配不同目标。在精神上最接近的是 CAMEL (Zhang et al., 2024 (https://arxiv.org/html/2607.15847#bib.bib10)),它*跨*两个编码器并借助跨域注意力来解耦字面和隐喻意义,而 CAMMAR 则将其组织于*一个*嵌套嵌入内部;我们在第三阶段采用了 CAMEL 的自定步调对比温度调度。 ## 3 方法 ### 3.1 概述 我们提出 CAMMAR,它将比喻意义组织成三个维度递减的嵌套嵌入子空间:外层 $z_{\text{lex}}$ 偏向于词汇表面形式,中间层 $z_{\text{cult}}$ 偏向于文化条件化的意义,内层 $z_{\text{met}}$ 偏向于比喻抽象。它们通过单个阿拉伯语骨干网络共享参数,并通过一个三阶段课程进行训练,该课程在构建后续抽象层的同时保护早期结构(图 1 (https://arxiv.org/html/2607.15847#S3.F1))。这实现了 Al-Jurjani (https://arxiv.org/html/2607.15847#bib.bib1) (1078 (https://arxiv.org/html/2607.15847#bib.bib1)) 的 *naẓm* 理论:隐喻层仅通过其对构成它的文化和词汇层的依赖来获取内容,而跨阶段受控冻结反映了 Al-Jurjānī 的坚持——比喻性解读仍然基于先前的语义关系,而非取而代之。这些层是生成式嵌套的:$z_{\text{met}}$ 由 $z_{\text{cult}}$ 计算得到,$z_{\text{cult}}$ 由 $z_{\text{lex}}$ 计算得到,因此比喻性解读通过文化意义(例如,海市蜃楼→欺骗性承诺→虚假希望)传递,而非直接从词汇形式读取。我们添加了一个非 Jurjānīan 的元素:一个显式的文化基底层,用于建模古典阿拉伯语解读所预设的共享知识。 一个关键特性是,投影头在*token 级别*运作,为每个 token 生成一个嵌套嵌入,这使得能够针对跨度标注的金标准集进行每个目标词的隐喻性估计。相同的投影头也可以应用于池化后的表征以进行句子级别分析,但本工作中的所有训练目标和评估都是 token 级别的。我们在 §3.2 (https://arxiv.org/html/2607.15847#S3.SS2) 中描述架构,在 §3.3 (https://arxiv.org/html/2607.15847#S3.SS3)-§3.4 (https://arxiv.org/html/2607.15847#S3.SS4) 中描述课程和目标,在 §3.5 (https://arxiv.org/html/2607.15847#S3.SS5) 中描述隐喻权重,在 §3.6 (https://arxiv.org/html/2607.15847#S3.SS6) 中描述评估协议。 参考图注 图 1:端到端 CAMMAR 流水线:配对的比喻/字面输入由共享的 NeoAraBERT 骨干网络编码,投影到嵌套的词汇($z_{\text{lex}}$)、文化($z_{\text{cult}}$)和隐喻($z_{\text{met}}$)子空间中,通过带受控冻结的三阶段课程进行训练,并在匹配对上通过几何方式进行跨度级别评估读出。架构完全是 token 级别的;目标词表征聚合已标注跨度上的 token 嵌入。 ### 3.2 架构 #### 骨干网络。 我们使用 NeoAraBERT-MSA (Abou Chakra et al., 2026 (https://arxiv.org/html/2607.15847#bib.bib5)) 作为共享编码器,这是一个 28 层 Transformer($d=768$),带有 65k 的 SentencePiece 词表,在现代标准阿拉伯语上预训练,并且对当代和古典阿拉伯语都有良好的覆盖——这对于我们的隐喻语料库(跨越两种语体)很重要。 我们将输入序列 $x=(x_1,\dots,x_L)$ 的编码器输出表示为 token 级别的隐藏状态 $h_t \in \mathbb{R}^d$,$t=1,\dots,L$。 #### 嵌套投影头。 每个 token 状态被投影到三个维度递减的嵌套语义子空间: $$ \begin{aligned} z_{\text{lex}}(t) &= W_{\text{lex}}(h_t) \in \mathbb{R}^{768}, \\ z_{\text{cult}}(t) &= W_{\text{cult}}(z_{\text{lex}}(t)) \in \mathbb{R}^{384}, \\ z_{\text{met}}(t) &= W_{\text{met}}(z_{\text{cult}}(t)) \in \mathbb{R}^{192}. \end{aligned} $$ 组合 $z_{\text{met}} = W_{\text{met}} \circ W_{\text{cult}} \circ W_{\text{lex}}$ 强制实现了语义嵌套:信息在到达隐喻层之前必须经过词汇和文化层。每个投影头是线性的,后接 GELU 和层归一化,保持浅层结构以保留可处理的几何解释。所有目标和评估都在这些 token 级别嵌入上进行;投影头也可以应用于池化后的表征以进行句子级别分析。在我们的约定中,外层(维度最大)最具体,内层通过压缩逐渐更抽象——这与其他一些 MRL 工作中维度作为特异性指标的习惯相反(例如,Lai et al., 2026 (https://arxiv.org/html/2607.15847#bib.bib9))。 由于三个层位于不同的坐标系中,读出器无法直接比较 $z_{\text{lex}}$ 和 $z_{\text{met}}$。我们引入一个*读出投影器* $g_{m \to l}: \mathbb{R}^{192} \to \mathbb{R}^{768}$,
相似文章
MetaphorVU:面向隐喻视频理解
本文介绍了MetaphorVU-Bench,这是首个针对隐喻视频理解的系统化基准,并提出了MetaphorBoost,一种推理时增强框架,可改善多模态大语言模型中的跨域映射。
C-Mining:通过几何错位无监督发现文化数据合成的种子
C-Mining提出了一个无监督框架,通过利用嵌入空间中的跨语言几何错位来发现LLM训练数据中的文化种子,实现可扩展的合成数据生成以支持文化对齐,无需手动或LLM监督。
基于 MIPVU 框架的 Token 级中文隐喻识别多架构可复现基线
本文利用 MIPVU 框架和 PSU 中文隐喻语料库,建立了用于 Token 级中文隐喻识别的可复现多架构基线。研究比较了 RoBERTa 和 MelBERT 等编码器模型与 Qwen3.5-9B 生成式模型的性能,并开源代码和数据以推动后续研究。
超越玩笑:多角度推理用于检测和解释模因中的有害幽默
本文介绍了MAR-12,一个利用视觉语言模型和多角度推理来检测和解释模因中有害幽默的框架,在PrideMM和Memotion数据集上达到了最先进的准确率。
超越选择题:带有方言变体的开放式阿拉伯文化问答基准
本文介绍了首个跨越现代标准阿拉伯语和多种方言的平行阿拉伯文化问答基准,将选择题转换为开放式问题,并利用思维链推理评估大语言模型,以解决文化知识和方言特定知识的缺陷。