当相似意味着不同:评估LLM在阿拉伯语-希伯来语同源词上的表现
摘要
本文介绍了SemCog Bench,这是一个精心整理的基准测试,包含1,858个阿拉伯语-希伯来语词对,并带有句子级别的注释,用于评估LLM区分真同源词、假同源词和借词的能力。结果显示,模型在真同源词上准确率很高,但在假同源词上准确率大幅下降,突显了跨语言语义推理中的一个关键局限性。
查看缓存全文
缓存时间: 2026/06/12 08:52
# 当相似意味着不同:评估LLM在阿拉伯语-希伯来语同源词上的表现 来源:https://arxiv.org/abs/2606.13218 查看PDF (https://arxiv.org/pdf/2606.13218) > 摘要:阿拉伯语和希伯来语作为密切相关的闪米特语言,共享大量真同源词、误导性的假朋友以及现代借词。这种重叠给大语言模型(LLMs)的跨语言语义理解带来了挑战。为了评估这一能力,我们引入了SemCog Bench,这是一个精心策划的基准测试集,包含1,858对阿拉伯语-希伯来语单词对,并附带句子级别的注释,用于同源词识别和语义消歧。我们评估了开源和商业LLMs在多种输入表示(原始、带变音符号、罗马化、音标)下的表现,揭示了跨语言推理中的一个关键差距。虽然模型在真同源词上取得了高准确率,但在假朋友和借词上的表现急剧下降,反映出对表面形式相似性的强烈依赖。此外,句子级别的上下文仅带来有限改进,表明上下文线索本身不足以克服误导性的形式信号。这些发现揭示了当前LLMs在解决跨语言形式-意义冲突方面的根本局限性,并将SemCog Bench确立为多语言语义推理的严格基准。我们的代码和数据已公开可用。 ## 提交历史 来自:Bashar Alhafni \[查看电子邮件 (https://arxiv.org/show-email/263cd545/2606.13218)\] **\[v1\]** 2026年6月11日星期四 11:33:09 UTC (3,835 KB)
相似文章
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。
当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。
同一位患者,不同的表述,不同的诊断?评估临床大语言模型的语义稳定性
本文提出了一种基于自然语言推理(NLI)的语义验证框架,用于评估临床大语言模型对保留语义的提示变化的敏感性,并引入了MVS、ΔC和WCI等度量指标。结果表明,领域专业化并不能持续提高鲁棒性,领域专用模型和通用模型的表现均参差不齐。
文档草垛中的语义针:LLM-as-a-Judge 相似度评分的敏感性测试
PNNL 与华盛顿大学的研究人员提出一套系统化框架,测试五种大语言模型在文档中捕捉细微语义变化的能力,揭示位置偏差、上下文连贯效应及模型特有的评分“指纹”。
连接科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与大语言模型基准
本文提出了一个阿拉伯语-俄语科学翻译的基准,包括一个包含27,000个句对的混合平行语料库,以及使用LoRA微调的多语言模型(mT5、NLLB、Qwen)。最佳模型达到了BLEU分数23.15,该工作旨在降低阿拉伯语和俄语研究人员之间科学知识交流的语言障碍。