利用多语言LLM嵌入发现词汇空缺
摘要
本文提出了一种数据驱动的框架,利用多语言LLM的嵌入来检测语言间的词汇空缺,在韩语-英语对中实现了高准确率。
arXiv:2605.24310v1 Announce Type: new
摘要:词汇空缺是指在某些语言中不存在的词语。它们对构建多语言词汇资源、机器翻译以及跨语言迁移提出了挑战。现有的词汇空缺检测依赖于人工判断或固定的概念分类体系。我们提出了一种数据驱动的框架来识别跨语言词汇空缺。我们从韩语-英语双语LLM中提取上下文嵌入,用于韩语到英语和英语到韩语的翻译对。通过结合不同的LLM、嵌入类型、维度和正交变换,在100次训练-测试划分中,每个源语言产生了4000个不同的嵌入空间。在每个空间中,我们计算了每个源词与其目标语言中最近邻之间的语义相似度,并比较了空缺词与非空缺词的分布。在94%(韩语到英语)和97%(英语到韩语)的嵌入空间中,空缺词的跨语言语义对齐程度弱于非空缺词。基于非对齐嵌入空间训练的逻辑回归分类器能够可靠地区分空缺词和非空缺词,AUC分别达到0.81(韩语到英语)和0.76(英语到韩语),并检索出18/19个韩语空缺词和26/27个英语空缺词。该方法提供了一种语言无关且无需分类体系的可扩展词汇空缺识别方法。
查看缓存全文
缓存时间: 2026/05/26 09:01
# 使用多语言大语言模型嵌入发现词汇空缺
来源:https://arxiv.org/html/2605.24310
Yoonwon Jung, Aaron S. Cohen, Benjamin K. Bergen
加州大学圣地亚哥分校认知科学系 \{y5jung, aac011, bkbergen\}@ucsd.edu
###### 摘要
词汇空缺是指某些语言中不存在的词语。它们给构建多语言词汇资源、机器翻译以及跨语言迁移带来了挑战。现有的词汇空缺检测依赖于人工判断或固定的概念分类体系。我们提出了一个数据驱动的框架,用于识别跨语言词汇空缺。我们从韩英双语大语言模型中提取上下文嵌入,用于韩语到英语和英语到韩语的翻译对。在100个训练-测试分割中,LLM、嵌入类型、维度以及正交变换的组合在每个源语言中产生了4000个不同的嵌入空间。在每个空间中,我们计算每个源词与其在目标语言中最近邻之间的语义相似度,并比较了空缺词与非空缺词的分布。在94%(韩语到英语)和97%(英语到韩语)的嵌入空间中,空缺词显示出比非空缺词更弱的跨语言语义对齐。在未对齐的嵌入空间上训练的逻辑分类器可以可靠地分离空缺词和非空缺词,在韩语到英语和英语到韩语方向上分别达到0.81和0.76的AUC,并检索到18/19个韩语空缺词和26/27个英语空缺词。这种方法提供了一种语言无关且无需分类体系的词汇空缺识别方法,具有可扩展性。
发现词汇空缺:使用多语言大语言模型嵌入
Yoonwon Jung, Aaron S. Cohen, Benjamin K. Bergen
加州大学圣地亚哥分校认知科学系
\{y5jung, aac011, bkbergen\}@ucsd.edu
## 1 引言
人类语言以多种方式表达概念:作为单个词语、搭配或临时的词语组合。使用一个约定俗成的词语来表达概念提供了一种高效的沟通方式,能以最少的努力实现清晰度(Lupyan, 2012;Rissman等,2023;Zipf, 2016)。然而,词汇化在不同语言之间存在差异,导致偶尔但显著的**词汇空缺**,即一种语言中用单个词汇项编码的概念在另一种语言中没有单个词语的对应词。著名的例子包括德语的*Schadenfreude*(对他人的不幸感到快乐)或日语的*komorebi*(从树叶间透过的阳光)。
词汇空缺为了解不同语言社区如何划分概念空间提供了一个窗口。先前的研究表明,跨语言的词汇化模式揭示了人类思考和体验世界方式的差异性(Lomas, 2018;Lupyan, 2012;Rissman等,2023;Winawer等,2007)。因此,识别词汇空缺就是发现跨文化概念差异(Wierzbicka, 1999)。
识别词汇空缺也很有用,因为它们给机器翻译(MT)带来了实际挑战。包含文化特定术语或表达(在其他语言中没有直译)的句子,其翻译准确性会系统地受到影响(Bentivogli等,2000;Khishigsuren等,2022;Yao等,2024)。它们还会影响多语言大语言模型(MLLM)的下游性能,在自然语言理解和问答等任务上降低性能(Ebrahimi and von der Wense, 2024)。这对于文化适应性尤其成问题,因为许多词汇空缺表示模型无法捕捉的文化特定概念。简而言之,准确识别词汇空缺不仅对比较语言学和心理学研究至关重要,而且对提高多语言大语言模型的性能也很重要。
尽管词汇空缺很重要,但它们的识别仍然不足。大多数现有的多语言词汇资源并没有明确标记词汇空缺,因为特定语言的词汇经常被省略或映射到近似的翻译(例如,Bond and Foster, 2013;Navigli and Ponzetto, 2012)。此外,词汇空缺很难识别。检测词汇空缺通常需要训练有素的母语双语者进行大量的人工标注(Bentivogli等,2000;Janssen, 2004)。
最近解决这个问题的方法采用了自上而下的方法,依赖固定的概念分类体系来检测词汇空缺。尽管这种方法在亲属关系领域效果很好(Khalilia等,2023;Khishigsuren等,2022),但它预设目标领域的概念层级是定义明确且被公认的,并且词汇量对于基于概念分类体系的手动分类来说是可控的。这些假设限制了该方法在情感、认知或价值观等领域的适用性,这些领域词汇量更大且概念层级不明确。
我们提出一种数据驱动的、自下而上的方法来识别跨语言词汇空缺,该方法不依赖于预定义的概念分类体系。它直接操作现有的词汇列表,并使用来自双语LLM嵌入的分布语义度量来量化单个词在一对语言之间的“空缺度”。我们在情感领域评估了该方法,利用了一个高质量、手工构建的韩语和英语情感词数据集,该数据集明确识别了词汇空缺(EVOKE; Jung等,2026)。我们证明,该方法成功地区分了空缺词(在另一种语言中没有单个词翻译的词)和非空缺词,并量化了空缺程度。此外,对齐方式的比较分析表明,来自MLLM的嵌入可以在没有额外跨语言对齐的情况下使用。这种方法为缩小大型多语言资源中词汇空缺的搜索空间提供了一种原则性方法,减少了对母语专家的依赖,并能够为语言研究和多语言模型评估进行词汇空缺的系统性分析。
## 2 相关工作
### 2.1 词汇空缺的定义
“词汇空缺”这个术语广义上指的是自然语言中描述某个概念的词汇单元的缺失(参见Ivir, 1977)。虽然有些空缺出现在形态句法层面(例如Bentivogli等,2000),但我们使用该术语来指代跨语言语义空缺,因为语义层面的词汇空缺揭示了某一语言约定俗成编码但其他语言缺失的独特经验维度(Ivir, 1977;Lomas, 2018;Wierzbicka, 1999)。
更具体地说,我们将词汇空缺定义为一个概念在目标语言中缺乏单个词语的对应词,即使它可以通过搭配或临时的词语组合来表达(Janssen, 2004;Li等,2024;Wierzbicka, 1997)。尽管一些先前的工作采用了更宽泛的定义(例如Bentivogli等,2000;Khishigsuren等,2022),包括约定俗成的多词搭配,但我们采用更严格的定义。这种更窄、以词为中心的定义避免了对哪些多词短语是约定俗成的进行主观判断,并有助于在不同语言之间进行更具可比性的评估。
### 2.2 词汇空缺与MLLM性能
越来越多的研究表明,词汇空缺给多语言NLP系统带来了挑战。在机器翻译的背景下,Khishigsuren等人(2022)表明,机器翻译系统会误译跨语言存在词汇空缺的亲属关系术语:包含亲属关系空缺(例如英语中的*b-o-t-h-e-r*,在许多语言中缺乏直接对应词)的句子,在五种目标语言(俄语、韩语、日语、匈牙利语和蒙古语)中产生的语义差异显著大于没有词汇空缺的句子。
词汇空缺也会影响机器翻译之外的下游任务性能。Ebrahimi和von der Wense(2024)表明,词汇空缺对多语言问答(QA)有负面影响。将包含英语词汇空缺的QA任务通过机器翻译成多种语言(加泰罗尼亚语、德语、波斯语、印地语和越南语)会导致比使用Oracle翻译时更差的性能。当任务涉及英语词汇空缺时,目标语言的零样本问答性能比使用Oracle翻译将任务翻译成英语时要差。这些趋势随着类型学距离的增加而增加。此外,词汇空缺可能会破坏MLLM生成的共情性回应的文化适应性。Lee等人(2025)表明,以英语为中心的MLLM在回应涉及在英语中没有词汇对应词的情感词的韩语场景时,难以做出恰当回应。
总之,词汇空缺仍然是MLLM系统性错误和性能下降的一个来源,尤其是在与英语类型学距离较远的语言中,词汇空缺不仅会破坏语义准确性,还会影响生成文化上恰当和共情性的MLLM回应。这强调了需要原则性的方法来识别词汇空缺,以改进模型训练和评估。
### 2.3 现有的词汇空缺资源
词汇空缺长期以来被认为是构建多语言词汇资源的一个挑战(Bentivogli等,2000;Bond等,2020;Khishigsuren等,2022;Ordan and Wintner, 2007)。很少有现有资源明确识别它们,因为特定语言词义经常被排除在数据集之外,或者被映射到不太精确的对应词,就像在多语言WordNet Open(Bond and Foster, 2013)和BabelNet(Navigli and Ponzetto, 2012)中那样。虽然这种近似有助于实现广泛覆盖,但它们掩盖了不存在真正的单词语义对应词的情况。
为了解决这个局限性,已经采用了多种方法。MultiWordNet(MWN)的扩展(Pianta等,2002)通过利用双语编码器的手动分类和决策树来索引词汇空缺(例如希伯来语和意大利语中的空缺)(Bentivogli等,2000;Ordan and Wintner, 2007)。然而,这些方法依赖于构建决策树的语言特定规则以及母语双语者的手动分类工作。最近,几项研究通过半自动化方法在亲属关系领域整理了一个词汇空缺数据集。这些研究利用了现有理论形式化的亲属关系概念层级以及下位词关系(Khalilia等,2023;Khishigsuren等,2022;Li等,2024)。虽然有效,但这些方法缺乏对其他概念领域(如情感)的泛化能力,在这些领域中不存在这样的客观概念层级,或者对于给定语言,该领域的词汇量更大。
### 2.4 情感词汇中的词汇空缺
情感语义领域为这些挑战提供了一个特别引人注目的测试案例。与亲属关系不同,情感概念不属于一个广泛认可、理论中性的概念层级。相互竞争的理论在情感是否可以组织成一阶和高阶类别、哪些情感算作基本情感、以及这类区分是否在文化上普遍存在等问题上存在分歧(Barrett, 2006;Ekman, 1992;Johnson-Laird and Oatley, 1989;Plutchik, 2001;Reisenzein, 1995;Russell and Fehr, 1994;Smith and Schneider, 2009)。1¹例如,虽然表达诸如“姑妈”和“姨妈”这类概念的亲属关系术语可以直截了当地组织在更高阶概念“阿姨”下,但情感概念的分层远不那么清晰。诸如*depressed*(抑郁的)或*devastated*(崩溃的)这类情感是否应被视为*sad*(悲伤的)的子类,或者*sad*本身是否构成基本情感,在理论上仍存在争议。因此,依赖固定概念分类体系的自上而下方法,很难以一种原则性和可扩展的方式跨语言应用于情感领域,就像其他领域一样。
此外,情感词汇表现出显著的跨语言差异。情感词义在不同语言之间的对齐程度低于其他领域的词汇(Jackson等,2019;Thompson等,2020),并且各种研究报道了无法翻译成其他语言的语言特定情感词汇(Mesquita等,2016;Schmidt-Atzert and Park, 1999;Wierzbicka, 1992, 1999)。
在下文中,我们开发并测试一种自动检测词汇空缺的方法,以情感领域为例。这需要一个高质量、手工策划的双语情感词数据集,该数据集明确识别词汇空缺,提供覆盖范围、注释质量和明确空缺标记的结合。我们使用EVOKE数据集,聚焦于英语和韩语(Jung等,2026)。该数据集使得检查类型学上不同语言间的词汇空缺成为可能。我们展示了一种可扩展且领域通用的词汇空缺检测方法,使用类型学上不同语言中的词汇,并应用于一个语义上具有挑战性的领域。
## 3 材料与方法
见图注
图1:实验流程概览。
我们通过检查嵌入空间中的跨语言语义邻居来搜索词汇空缺。相似文章
通过令牌剪枝优化韩语中心的大语言模型
本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。
知识超越语言:弥合多语言机器遗忘评估中的鸿沟
本文提出了两个新指标——知识可分性得分(KSS)和知识持久性得分(KPS)——用于评估大语言模型在多语言机器遗忘中的跨语言信息删除,弥补了以往单语言评估协议的不足。
面向语言集成可靠性审计的多语言句子嵌入
本文评估了多语言句子嵌入能否在教育评估中替代翻译进行跨语言的语言集成可靠性审计,发现母语嵌入能紧密复现基于翻译的可靠性估计。
ALEE: 通过以英语为中心的极小对进行嵌入的任意语言评估
介绍ALEE,一个使用抽象意义表示生成具有受控语义偏移的英语极小对的框架,并将其翻译用于评估275+种语言的文本嵌入,揭示了跨语言语义表示中持续存在的差距。
基于双重语义嵌入的大语言模型鲁棒文本水印
本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。