跨语言习语表达的概念网络:一种基于特征的图方法

arXiv cs.CL 论文

摘要

本文提出了一种可解释的基于网络的框架,使用二进制概念特征表示八种语言的习语表达。社区检测显示,习语按概念图式而非语言聚类,该框架在习语检测和跨语言迁移方面优于基于嵌入的基线方法。

arXiv:2607.09576v1 公告类型:新 摘要:我们提出了一种可解释的基于网络的框架,用于表示八种类型多样的语言中的习语和比喻意义,共涉及160个常规表达,其中绝大多数是习语。每个表达都用源自认知语言学的二进制概念特征(包含、隐藏、情感、社交等)进行标注,并使用成对的Jaccard相似度定义加权图。社区检测显示,习语按概念图式而非语言聚类,产生的结构符合认知语言学的预测。该概念网络捕获了分布嵌入中不存在的独特语义信息,可通过LLM自动标注进行扩展,改进了下游习语检测,并在加入语料库频率后仍然稳健。跨语言迁移实验表明,仅凭概念接近度就可以识别跨五个语系的可接受翻译等价物,且效果显著优于基于嵌入的基线方法。消融研究表明,所有三个特征维度——图式、角色和效价——对网络的组织属性和习语检测性能都有非冗余贡献,并且特定的图派生信号(社区成员身份、邻居相似性)尤其具有信息量。该框架提供了一种可解释、跨语言稳定的习语意义表示,结合了理论基础和实际效用。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:59

# 跨语言习语表达的概念网络:基于特征的图方法
来源:https://arxiv.org/html/2607.09576
Kiran Pala东芬兰大学,芬兰kiran\.pala@uef\.fi Punam SiluLixun Yu印度理工学院罗巴尔校区,印度东芬兰大学,芬兰punam\.24hsz0007@iitrpr\.ac\.inluxinyu@uef\.fi

###### 摘要

我们提出了一种可解释的基于网络的框架,用于表示八种类型学多样的语言(共160个常规表达,其中绝大多数是习语)中的习语和比喻意义。每个表达都根据认知语言学理论标注了二元概念特征(包含、隐藏、情感、社会等),而两两之间的Jaccard相似度定义了一个加权图。社区检测显示,习语按概念模式而非语言进行聚类,这种结构与认知语言学的预测一致。概念网络捕捉了分布嵌入中不存在的独特语义信息,可通过使用LLM自动标注进行扩展,改进下游习语检测,并在加入语料库频率后保持稳健。跨语言迁移实验表明,仅凭概念邻近性就能在五个语系中识别出可接受的翻译等价物,且显著优于基于嵌入的基线方法。消融研究表明,所有三个特征维度——模式、角色和效价——对网络的组织属性和习语检测性能都有非冗余贡献,而特定的图导出信号(社区成员、邻居相似度)尤为信息丰富。该框架提供了一种可解释、跨语言稳定的习语意义表示,将理论基础与实际应用相结合。

跨语言习语表达的概念网络:基于特征的图方法

Kiran Pala††感谢通讯作者。东芬兰大学,芬兰kiran\.pala@uef\.fiPunam SiluLixun Yu印度理工学院罗巴尔校区,印度东芬兰大学,芬兰punam\.24hsz0007@iitrpr\.ac\.inluxinyu@uef\.fi

## 1 引言

诸如“spill the beans”或“kick the bucket”等习语对语义表示提出了根本性挑战,因为它们的比喻意义无法可靠地从字面成分推导出来。认知语言学表明,许多习语是由一小类意象图式(如包含、隐藏)所驱动的,这些图式在类型学多样的语言中反复出现(Kövecses 2005 (https://arxiv.org/html/2607.09576#bib.bib10))。然而,习语之间的概念重叠程度是渐进的而非全有或全无,建模这种渐进结构既有助于深化理论理解,也能改进需要处理非字面语言的自然语言处理应用。对于模型决策必须被理解和信任的NLP任务,可解释的表示尤为宝贵。通过将表示建立在认知理论之上,我们的框架提供了可解释性和跨语言稳定性,是对黑箱嵌入模型的补充。

大多数习语的计算模型依赖通过分布语义或上下文嵌入的表面词汇形式(Fazly et al. 2009 (https://arxiv.org/html/2607.09576#bib.bib6))。尽管这些方法很强大,但往往忽略了跨语言习语性背后的深层概念结构,并且对习语的语义组织提供甚少洞见。此外,现有研究主要集中于少数资源丰富的语言,忽视了可能揭示习语组织普遍性的类型学多样性。大型语言模型偶尔能识别习语,但它们并未提供一个结构化的概念空间,以便跨语言系统比较习语意义。

我们引入了一个基于网络的模型,涵盖来自八个语言(代表五个语系)的160个习语:印欧语系(英语、印地语、巴格里语、西班牙语)、乌拉尔语系(芬兰语)、日本语系(日语)、汉藏语系(汉语)和达罗毗荼语系(马拉雅拉姆语)。这一选择涵盖了黏着型、屈折型和孤立型形态;SVO和SOV语序;以及五种不同的书写系统。巴格里语和马拉雅拉姆语的加入为习语研究增添了罕见的关键数据。该模型通过一小类基于认知语言学理论的二元概念特征表示每个习语,并以Jaccard系数作为边权重构建加权图。我们证明了该网络按概念模式而非语言组织习语,并通过以下互补分析评估其属性:(1) 社区结构与多语言分布嵌入对比,(2) 下游习语检测任务评估,(3) 特征维度的消融分析,(4) 通过LLM自动特征提取,(5) 加入语料库频率的动态丰富,以及(6) 跨语言迁移。这些分析共同表明,概念网络是一种稳健、可解释且实用的习语意义表示。

## 2 相关工作

**认知语言学与习语。** 概念隐喻理论(Lakoff and Johnson 2008 (https://arxiv.org/html/2607.09576#bib.bib11))提出,人类思维由相对小的一类意象图式构成,这些图式在语言中得到实现。Gibbs (1992 (https://arxiv.org/html/2607.09576#bib.bib7)) 表明,说话者对习语的心理意象高度一致,反映了底层概念隐喻。跨语言研究(Piirainen 2012 (https://arxiv.org/html/2607.09576#bib.bib16))发现,许多习语在欧洲和亚洲语言中共享相同的概念结构,这表明许多习语表达具有普遍基础。这些见解启发了我们的标注方案,该方案同时捕捉了普遍图式和语言特定角色。

**习语的计算模型。** 在NLP中,习语一直通过分布向量进行建模(Fazly et al. 2009 (https://arxiv.org/html/2607.09576#bib.bib6)),通常聚焦于检测表达是被字面使用还是比喻使用。然而,这类模型依赖于表面共现统计,可能无法捕捉跨语言的深层概念相似性。基于图的语义模型(Steyvers and Tenenbaum 2005 (https://arxiv.org/html/2607.09576#bib.bib18))揭示了小世界结构和认知相关性,但很少应用于习语。我们的框架通过从理论驱动的特征构建概念网络来弥合这一差距。现有的习语表达资源严重偏向英语和少数欧洲语言;我们的多语言语料库(包含低资源语言的数据集)解决了这种不平衡。

## 3 方法

### 3.1 习语选择与语料验证

我们从英语、印地语、巴格里语、芬兰语、日语、西班牙语、汉语和马拉雅拉姆语中各收集了20个常规比喻表达(以下简称习语),共160条。广义上受认知驱动的术语“习语”不仅涵盖核心短语习语,还包括谚语、常规隐喻和其他含义不完全组合的固定表达;所有这些表达的共同特点是作为文化固化的比喻单位,这也是我们关注的现象。所有表达均由至少两名母语者验证,并在适当的参考语料库中检查频率:COCA (Davies 2008 (https://arxiv.org/html/2607.09576#bib.bib5))(英语),EMILLE (Baker et al. 2002 (https://arxiv.org/html/2607.09576#bib.bib1))(印地语),使用了定制巴格里语启发集(因巴格里语[一种拉贾斯坦印度-雅利安语变体]没有标准化书面语料库,这些比喻表达由三名母语者确认[所有收集均获得知情同意并匿名化]),Suomi24 (Bartis 2015 (https://arxiv.org/html/2607.09576#bib.bib2))(芬兰语),BCCWJ (Maekawa et al. 2008 (https://arxiv.org/html/2607.09576#bib.bib13))(日语),CREA (Real Academia Española 2008 (https://arxiv.org/html/2607.09576#bib.bib17))(西班牙语),BCC/CCL (Xun et al. 2016 (https://arxiv.org/html/2607.09576#bib.bib20))(汉语),以及马拉雅拉姆语网络语料库 (Kilgarriff et al. 2010 (https://arxiv.org/html/2607.09576#bib.bib8))。本研究收集的习语涵盖了常见的概念域,如沟通、情感、秘密和社会互动。它们既包括跨语言共享的隐喻模式,也包括特定语言和文化背景的习语表达。完整数据集将在发表时发布。

### 3.2 特征标注方案

每个习语根据三个独立的概念维度进行二元特征的人工标注,如图1 (https://arxiv.org/html/2607.09576#S3.F1) 所示。这些维度基于认知语言学理论,旨在捕捉区分习语意义的核心概念和功能属性。

- **概念图式**:包含、隐藏\_S、情感、社会。这些意象图式结构源于反复出现的身体体验模式,已被广泛记录为隐喻思维的概念构建块(Lakoff and Johnson 2008 (https://arxiv.org/html/2607.09576#bib.bib11))。“包含”反映了有界区域图式(一个具有内部和外部的容器),“隐藏\_S”表示隐藏或遮盖的图式,“情感”将内部情感状态映射到身体感觉,“社会”表示人际互动和群体归属的图式。如果习语的比喻意义涉及将某物保持在一个有界空间内(例如,“bottle up your feelings”),则标注为包含;如果表示故意隐藏(例如,“sweep it under the rug”),则标注为隐藏;如果直接表达或描述情感状态(例如,“wear your heart on your sleeve”),则标注为情感;如果内在涉及人际动态(例如,“blow the whistle”),则标注为社会。
- **功能角色**:沟通、隐藏\_R、情感\_状态。该维度捕捉习语在话语中通常发挥的语用功能,基于许多习语不仅仅是描述性的,而是执行特定交际行为(Gibbs 1992 (https://arxiv.org/html/2607.09576#bib.bib7))。“沟通”适用于习语的主要功能是传达或引发信息(例如,“spill the beans”),“隐藏\_R”适用于描述隐藏信息或意图的行为(例如,“keep it under your hat”),“情感\_状态”适用于将特定情绪归因于体验者(例如,“down in the dumps”)。一个习语可以同时发挥多种功能;例如,“bite your tongue”既描述言语隐藏,也表明一种克制的情感状态。
- **情感效价**:正面、负面。该维度反映习语比喻意义的评价极性。当习语表示一个可取、愉快或社会认可的结果时(例如,“get it off your chest”、“bury the hatchet”),分配正面效价;负面效价表示一个不可取、不愉快或社会不认可的情况(例如,“skeleton in the closet”、“sweep it under the rug”)。效价评估独立于词语的字面解读;例如,“swallow your pride”被标记为负面,尽管“pride”本身可以是正面的,因为整体比喻行为描述了一种不愉快的自我压抑。

这些维度并非互斥;一个习语可以与多个特征相关联。例如,“spill the beans”被标记为{沟通,社会,负面},因为它描述了在社会语境中揭露破坏性秘密的行为;而“keep it under your hat”被标记为{包含,隐藏\_R,沟通,社会},因为它结合了有盖容器的图像与秘密保留的交际行为。标注方案设计了明确的诊断标准(为每个特征提供了包含典型和边界例子的决策树),并由三位在语义学方面有专长的训练有素的语言学家应用。标注者间一致性高(所有维度的 Fleiss’ κ > 0.78),所有分歧通过共识讨论解决。表1 (https://arxiv.org/html/2607.09576#S3.T1) 展示了涵盖所有八种语言的代表性样本。

| 习语 | spill the beans |
|------|-----------------|
| 图式 | 包含,隐藏\_S,情感,社会 |
| 角色 | 沟通,隐藏\_R,情感\_状态 |
| 效价 | 正面,负面 |
| 特征空间 | 特征集 S(vi) {沟通,社会,负面} |

图 1:特征标注示意图。一个习语被分解为三个概念维度。

表 1:具有概念特征的示例习语。

### 3.3 网络构建

对于每对习语 \((v_i, v_j)\),边权重为 Jaccard 系数:

\[
w_{ij} = \frac{|S(v_i) \cap S(v_j)|}{|S(v_i) \cup S(v_j)|}.
\]

Jaccard 直接量化了比例重叠,具有有界、对称和计算量最小的特点——这是一种符合相似性模型(Tversky 1977 (https://arxiv.org/html/2607.09576#bib.bib19);Lieder and Griffiths 2020 (https://arxiv.org/html/2607.09576#bib.bib12))的资源理性选择。160×160 矩阵 \(\mathbf{W} = [w_{ij}]\) 定义了一个加权图 \(G = (V, E)\);保留 \(w_{ij} > 0\) 的边(密度 0.37)。

## 4 结果

### 4.1 社区结构与拓扑性质

该网络(图2 (https://arxiv.org/html/2607.09576#S4.F2))分为两个主要聚类:包含/隐藏/情感 和 沟通/社会。Louvain 社区检测(Blondel et al. 2008 (https://arxiv.org/html/2607.09576#bib.bib3))产生了 5 个社区,模块度 \(Q = 0.61\)。与语言标签(8 组)的 NMI 仅为 0.10,而与主要图式分区的 NMI 为 0.76(\(ARI_{\text{lang}} = 0.05\),\(ARI_{\text{schema}} = 0.69\))。这证实了驱动网络组织的是概念特征,而非语言。

除了社区结构,概念图还表现出组织良好的语义网络的几个特征性质。度分布遵循带有指数截断的幂律(平均度 \(\langle k \rangle = 23.1\),聚类系数 \(C = 0.70\))。中介中心性最高的是桥梁习语(表2 (https://arxiv.org/html/2607.09576#S4.T2));“spill the beans”达到 0.15,确认了其在连接两个主要聚类中的作用。该网络表现出小世界组织,小世界指数 \(\sigma = 2.0\)(相比之下,同等大小和密度的随机图 \(\sigma = 1.0\))。在随机移除 20% 的节点后,全局效率仍保持在 88%,表明高度韧性。这些性质与从自由联想和特征规范中观察到的人类衍生语义网络(Steyvers and Tenenbaum 2005 (https://arxiv.org/html/2607.09576#bib.bib18);Collins and Loftus 1975 (https://arxiv.org/html/2607.09576#bib.bib4))一致,支持了概念图表示的有效性。

表 2:按中介中心性排序的前 5 个桥梁习语。

### 4.2 与多语言嵌入的对比

我们使用 XLM-Rbase 提取了所有 160 个习语的短语嵌入,并构建了一个图(基于余弦相似度)。将此图与我们的概念图进行比较:概念图的社区与语言无关(NMI 0.10),而嵌入图的社区与语言高度相关(NMI 0.72,\(ARI = 0.68\)),反映了训练统计中的单语偏向。此外,嵌入图缺乏概念图的一个关键性质:概念图在核心比喻模式(如包含与情感)之间具有高模块度(\(Q = 0.61\)),而嵌入图仅达到 \(Q = 0.31\),表明其概念结构较弱。这一模式在所有语言子集上都是稳健的,即使在控制英语为主导语料后也是如此。结论:概念表示捕获了分布嵌入中不可用的语义信息,并且更接近认知组织。

相似文章

IdioLink:在习语与字面表达间检索超越字词的意义

arXiv cs.CL

介绍了IdioLink,一个包含10,700篇文档和2,140个查询的检索基准,覆盖107个习语,测试模型是否能够将习语表达与概念上等价的字面或释义含义联系起来。评估显示,当前的嵌入模型在此任务上表现不佳,突显了习语感知语义检索方面的空白。

跨语言探索参数化知识

arXiv cs.CL

本文探索了跨语言提示策略,以改进对大语言模型中参数化知识的访问,并在涵盖17种语言的多语言基准测试中展示了知识迁移和事实召回方面的显著提升。