大型语言模型对孟加拉语习语的理解程度如何?
摘要
本文介绍了一个针对孟加拉语习语的基准数据集,并评估了近期大型语言模型在习语相关任务上的表现,揭示了不同模型在性能上存在显著差异。
arXiv:2609.03410v1 宣布类型:新
摘要:习语表达是自然语言的重要组成部分,反映了文化细微差别,并对计算模型构成了独特挑战,尤其是在资源匮乏的语言中。本文中,我们提出了首个大规模的孟加拉语习语基准数据集,并辅以一个合成的多选题(MCQ)数据集,用于习语意义识别。我们对近期的大型语言模型(LLMs)在三个习语相关任务上进行了全面评估:释义、习语跨度检测和意义识别,利用零样本和少样本提示策略。我们的结果显示模型性能存在显著差异,没有单一的LLM在所有任务上持续优于其他模型。值得注意的是,Phi-4-mini-instruct在释义方面表现优异,Kimi-K2-32b-instruct在跨度检测方面突出,而Gemini-2.5-flash在意义识别方面领先。我们相信,我们的数据集和分析将为未来研究提供宝贵资源,以改进LLM对习语表达的理解,特别是在孟加拉语和其他资源匮乏的语言中。
查看缓存全文
缓存时间: 2026/09/04 05:59
# 大型语言模型对孟加拉语习语的理解程度如何? 来源:https://arxiv.org/abs/2609.03410 查看PDF (https://arxiv.org/pdf/2609.03410) > 摘要:习语表达是自然语言不可分割的一部分,反映了文化细微差别,并为计算模型带来了独特挑战,尤其是在低资源语言中。本文提出了首个大规模孟加拉语习语基准数据集,并辅以用于习语含义识别的合成多项选择题(MCQ)数据集。我们利用零样本和少样本提示策略,对近期大型语言模型在三个习语相关任务(释义、习语片段检测和含义识别)上的表现进行了全面评估。结果揭示模型性能存在显著差异,没有任何一个大型语言模型能在所有任务中始终保持领先。值得注意的是,Phi-4-mini-instruct在释义任务上表现突出,Kimi-K2-32b-instruct在片段检测上表现优异,而Gemini-2.5-flash则在含义识别上领先。我们相信,这些数据集和分析将为未来研究提供宝贵资源,以指导改进大型语言模型对习语表达的理解,尤其是在孟加拉语和其他低资源语言中。 ## 提交历史 来自:Mousumi Akter \[查看邮件 (https://arxiv.org/show-email/819e642f/2609.03410)\] **\[v1\]**2026年9月3日 周四 06:15:15 UTC \(552 KB\)
相似文章
IdiomX: 一个用于习语理解、检索和释义的多语言基准
IdiomX是一个大规模多语言基准数据集,用于习语理解、检索和释义,包含英语、阿拉伯语和法语超过19万个示例,设有四项任务来评估语言模型对习语表达的处理能力。
当英语改写本地知识:大语言模型中的全球叙事主导
本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。
VIVID:一个植根于文化的基准,揭示越南语自然语言处理中的比喻语言差距
本文介绍了VIVID,这是首个系统评估越南语中植根于文化的比喻语言理解的基准,包含1,636条习语和谚语。对八个最先进模型的评估揭示了显著差距:越南语专用模型的表现远逊于多语言系统,即使顶尖模型平均正确率也不到50%。
我们能理解大语言模型是如何推理的吗?
本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。
孟加拉地区方言的多方言神经机器翻译系统
本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。