大型语言模型对孟加拉语习语的理解程度如何?

arXiv cs.CL 论文

摘要

本文介绍了一个针对孟加拉语习语的基准数据集,并评估了近期大型语言模型在习语相关任务上的表现,揭示了不同模型在性能上存在显著差异。

arXiv:2609.03410v1 宣布类型:新 摘要:习语表达是自然语言的重要组成部分,反映了文化细微差别,并对计算模型构成了独特挑战,尤其是在资源匮乏的语言中。本文中,我们提出了首个大规模的孟加拉语习语基准数据集,并辅以一个合成的多选题(MCQ)数据集,用于习语意义识别。我们对近期的大型语言模型(LLMs)在三个习语相关任务上进行了全面评估:释义、习语跨度检测和意义识别,利用零样本和少样本提示策略。我们的结果显示模型性能存在显著差异,没有单一的LLM在所有任务上持续优于其他模型。值得注意的是,Phi-4-mini-instruct在释义方面表现优异,Kimi-K2-32b-instruct在跨度检测方面突出,而Gemini-2.5-flash在意义识别方面领先。我们相信,我们的数据集和分析将为未来研究提供宝贵资源,以改进LLM对习语表达的理解,特别是在孟加拉语和其他资源匮乏的语言中。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:59

# 大型语言模型对孟加拉语习语的理解程度如何?
来源:https://arxiv.org/abs/2609.03410
查看PDF (https://arxiv.org/pdf/2609.03410)

> 摘要:习语表达是自然语言不可分割的一部分,反映了文化细微差别,并为计算模型带来了独特挑战,尤其是在低资源语言中。本文提出了首个大规模孟加拉语习语基准数据集,并辅以用于习语含义识别的合成多项选择题(MCQ)数据集。我们利用零样本和少样本提示策略,对近期大型语言模型在三个习语相关任务(释义、习语片段检测和含义识别)上的表现进行了全面评估。结果揭示模型性能存在显著差异,没有任何一个大型语言模型能在所有任务中始终保持领先。值得注意的是,Phi-4-mini-instruct在释义任务上表现突出,Kimi-K2-32b-instruct在片段检测上表现优异,而Gemini-2.5-flash则在含义识别上领先。我们相信,这些数据集和分析将为未来研究提供宝贵资源,以指导改进大型语言模型对习语表达的理解,尤其是在孟加拉语和其他低资源语言中。

## 提交历史

来自:Mousumi Akter \[查看邮件 (https://arxiv.org/show-email/819e642f/2609.03410)\] **\[v1\]**2026年9月3日 周四 06:15:15 UTC \(552 KB\)

相似文章

当英语改写本地知识:大语言模型中的全球叙事主导

arXiv cs.CL

本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。

孟加拉地区方言的多方言神经机器翻译系统

arXiv cs.CL

本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。