ALEE: 通过以英语为中心的极小对进行嵌入的任意语言评估

arXiv cs.CL 论文

摘要

介绍ALEE,一个使用抽象意义表示生成具有受控语义偏移的英语极小对的框架,并将其翻译用于评估275+种语言的文本嵌入,揭示了跨语言语义表示中持续存在的差距。

arXiv:2607.00171v1 Announce Type: new 摘要:文本嵌入是语义相似性任务的标准方法,但其评估仍然是一个开放挑战。当前的基准是静态的,仅覆盖有限的语言,通常具有领域特异性,容易过拟合,且对低资源语言的代表性较差。为了解决这些限制,我们引入了ALEE,一个将Sentence Smith (Li et al., 2025)扩展到跨语言和段落级别的框架。ALEE使用抽象意义表示(AMR)生成具有受控、细粒度语义偏移的英语极小对,并与目标语言的翻译配对。这种方法能够对任何拥有英语平行数据的语言的模型进行有针对性的诊断。我们在涵盖三个平行数据集的多种嵌入模型和275+种语言上进行了大规模实证研究。在ALEE上,性能在不同语言、文本长度和语言现象之间差异很大,暴露了跨语言语义表示中持续存在的差距,这些差距与训练资源和子词分词中的语言普遍性相关。我们将ALEE发布在 https://github.com/Andrian0s/any-lang-embed-eval
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:36

# ALEE:通过以英语为中心的最小对实现任意语言嵌入评估
来源:https://arxiv.org/abs/2607.00171
查看PDF (https://arxiv.org/pdf/2607.00171)

> 摘要:文本嵌入是语义相似性任务的标准工具,但其评估仍是一个开放挑战。现有基准是静态的,仅覆盖有限的语言种类,往往局限于特定领域,容易过拟合,并且对低资源语言的代表性不足。为解决这些局限,我们提出了ALEE,这是一个将Sentence Smith(Li等,2025)扩展到跨语言和段落层面的框架。ALEE使用抽象意义表示(AMR)来生成具有可控细粒度语义偏移的英语最小对,并将这些最小对与目标语言的翻译配对。这种方法能够对任何拥有英语平行数据的语言中的模型进行有针对性的诊断。我们跨越三个平行数据集,对多种嵌入模型和275种以上语言进行了大规模实证研究。在ALEE上,不同语言、文本长度和语言现象之间的性能差异显著,揭示了跨语言语义表示中持续存在的差距,这些差距与训练资源中的语言普及程度及子词分词密切相关。我们已在以下网址发布ALEE:https://github.com/Andrian0s/any-lang-embed-eval

## 提交历史

来自:Andrianos Michail [查看电子邮件](https://arxiv.org/show-email/c8a3d487/2607.00171) **[v1]** 2026年6月30日星期二 20:45:17 UTC (2,903 KB)

相似文章

利用多语言LLM嵌入发现词汇空缺

arXiv cs.CL

本文提出了一种数据驱动的框架,利用多语言LLM的嵌入来检测语言间的词汇空缺,在韩语-英语对中实现了高准确率。