当相似意味着不同:评估LLM在阿拉伯语-希伯来语同源词上的表现

arXiv cs.CL 论文

摘要

本文介绍了SemCog Bench,这是一个精心整理的基准测试,包含1,858个阿拉伯语-希伯来语词对,并带有句子级别的注释,用于评估LLM区分真同源词、假同源词和借词的能力。结果显示,模型在真同源词上准确率很高,但在假同源词上准确率大幅下降,突显了跨语言语义推理中的一个关键局限性。

arXiv:2606.13218v1 Announce Type: new 摘要:阿拉伯语和希伯来语作为密切相关的闪米特语言,共享大量真同源词、具有误导性的假同源词以及现代借词。这种重叠给大型语言模型(LLM)的跨语言语义理解带来了挑战。为了评估这一能力,我们引入了SemCog Bench,这是一个精心整理的基准测试,包含1,858个阿拉伯语-希伯来语词对,并带有句子级别的注释,用于同源词识别和语义消歧。我们评估了开源和商业LLM在多种输入表示(原始、带变音符号、罗马化以及音标)下的表现,揭示了跨语言推理中的一个关键差距。虽然模型在真同源词上达到高准确率,但在假同源词和借词上表现急剧下降,反映出对表面形式相似性的强烈依赖。此外,句子级上下文只带来微小的改进,表明仅靠上下文线索不足以克服误导性的形式信号。这些发现揭示了当前LLM在解决跨语言形式-意义冲突方面的根本局限性,并将SemCog Bench确立为多语言语义推理的严格基准。我们的代码和数据已公开提供。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:52

# 当相似意味着不同:评估LLM在阿拉伯语-希伯来语同源词上的表现
来源:https://arxiv.org/abs/2606.13218
查看PDF (https://arxiv.org/pdf/2606.13218)

> 摘要:阿拉伯语和希伯来语作为密切相关的闪米特语言,共享大量真同源词、误导性的假朋友以及现代借词。这种重叠给大语言模型(LLMs)的跨语言语义理解带来了挑战。为了评估这一能力,我们引入了SemCog Bench,这是一个精心策划的基准测试集,包含1,858对阿拉伯语-希伯来语单词对,并附带句子级别的注释,用于同源词识别和语义消歧。我们评估了开源和商业LLMs在多种输入表示(原始、带变音符号、罗马化、音标)下的表现,揭示了跨语言推理中的一个关键差距。虽然模型在真同源词上取得了高准确率,但在假朋友和借词上的表现急剧下降,反映出对表面形式相似性的强烈依赖。此外,句子级别的上下文仅带来有限改进,表明上下文线索本身不足以克服误导性的形式信号。这些发现揭示了当前LLMs在解决跨语言形式-意义冲突方面的根本局限性,并将SemCog Bench确立为多语言语义推理的严格基准。我们的代码和数据已公开可用。

## 提交历史

来自:Bashar Alhafni \[查看电子邮件 (https://arxiv.org/show-email/263cd545/2606.13218)\] **\[v1\]** 2026年6月11日星期四 11:33:09 UTC (3,835 KB)

相似文章