当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理
摘要
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。
arXiv:2607.17828v1 公告类型:新
摘要:许多孟加拉语词汇既是人名又是具有文化含义的普通名词,例如"Maya"既是女孩的名字,也表示深情与同情。选择正确的解读需要文化知识,而现代语言模型的预训练数据中此类知识十分稀缺。我们提出了文化纠缠同形词(CEH)消解任务,并构建了一个包含1,516条经专家验证的孟加拉语句子(共3,032个带标签的实例)的基准数据集,其中同一个词出现两次并有两种不同的解读,每个解读都带有文化类别标签及推理说明。在开源和闭源模型上,我们发现了一种系统性的主导意义偏见:模型默认选择普通名词含义而忽略名字。一个专门针对孟加拉语的模型在我们测试的所有提示策略下均失败,这表明仅靠特定语言的预训练并不能赋予文化基础。我们进一步表明,对比思维链提示可以在无需训练的情况下显著减少这种偏见,而蒸馏文化解释则教会小模型(1-3B参数)推理出正确解读而非记忆标签,从而将主导意义偏见从高达100%降至5%以下,并将失败的孟加拉语专用模型转化为我们最强的系统。数据集和代码可在 https://github.com/ashuvo25/BanglaCEH 获取。
查看缓存全文
缓存时间: 2026/07/21 06:46
# 当名字不再是名字:低资源大语言模型中文化缠结的孟加拉语同形异义词基准数据集与蒸馏推理 来源:https://arxiv.org/html/2607.17828 Md. Asaduzzaman Shuvo 孟加拉国际大学,孟加拉国 邮箱:[email protected] ###### 摘要 许多孟加拉语词汇同时既是人名又是承载文化内涵的普通名词:মায়া (Maya) 既是一个女孩的名字,也代表深情的 compassion。选择正确的解读需要文化知识,而现代语言模型的预训练数据中这类知识十分匮乏。我们提出了**文化缠结同形异义词 (Culturally Entangled Homograph, CEH)** 消歧任务,并构建了一个包含 1,516 条专家验证句子(3,032 个标注实例)的孟加拉语基准数据集。在这些句子中,一个词出现两次,具有两种不同的解读,每个实例都标注了文化类别及背后的推理解释。在开源和闭源模型上,我们发现了一种系统性的**主导含义偏差**:模型默认选择普通名词义项,而忽略人名义项。一个孟加拉语专用模型在我们测试的所有提示策略下均告失败,这表明仅靠语言专用预训练无法赋予文化根基。我们进一步证明,对比思维链提示可以在不训练的情况下显著减少这种偏差,而蒸馏文化解释可以教会小模型(1–3B 参数)进行推理以得出正确解读,而非记忆标签。这使主导含义偏差从高达 100% 降至 5% 以下,并将失败的孟加拉语专用模型转变为我们最强的系统。我们已发布代码和数据集。 数据集和代码可在以下地址获取:https://github.com/ashuvo25/BanglaCEH (https://github.com/ashuvo25/BanglaCEH)。 # 当名字不再是名字:低资源大语言模型中文化缠结的孟加拉语同形异义词基准数据集与蒸馏推理 Md. Asaduzzaman Shuvo 孟加拉国际大学,孟加拉国 邮箱:[email protected] ## 1 引言 词义歧义是自然语言处理中一个长期存在的挑战,但其中一个特别困难且研究不足的变体是:同一个词同时作为人名和承载文化内涵的普通名词。在孟加拉语中,这种现象十分普遍:父母经常用表示珍贵情感、美德或精神状态的词来为孩子命名,因此同一个表面形式同时承载着个体化(人名)解读和抽象(概念)解读。 图 1:文化缠结同形异义词(CEH)任务。মায়া (Maya) 在一个孟加拉语句子中出现两次:第一次是作为**人名**,第二次是作为该名字所源自的**情感**,模型必须仅凭文化知识来区分这两种用法。 单词 মায়া (Maya) 既是一个常见的女孩名字,也代表深情的 compassion;আরিফ (Arif) 既是一个男孩的名字,在苏菲派神学中也指拥有直觉神圣知识的人。解决正确的解读需要超越表面词汇统计的文化和语用知识。我们将此现象称为**文化缠结同形异义词 (CEH)**,并认为它是检测真正文化根基的严格指标。与传统的词义消歧不同,CEH 无法通过频率或分布线索来解决:两种解读共存于同一文化空间中,消歧的关键在于识别何时一个形式**命名**一个人,何时**唤起**其所源自的概念——这使得 CEH 对训练于高资源、西方中心语料库的模型尤其具有挑战性。 已知大语言模型存在西方主导偏差,并且在低资源文化相关任务上表现不佳 (Belay et al., 2025; Yu et al., 2025);语言专用能力并不能保证文化能力,仅使用语言提示也无法提供文化背景 (Belay et al., 2025)。对于孟加拉语,近期工作已产出一些有能力的模型和基准 (Nahin et al., 2025; Raihan and Zampieri, 2025; Joy and Shatabda, 2026),但评估主要集中在知识、推理和分类上,日常词汇使用中的文化根基问题在很大程度上未被考察。相关研究表明,流畅的孟加拉语输出可能掩盖系统性的语域失败 (Shuvo et al., 2026) 和持续的幻觉 (Adib et al., 2026)——这些是浅层而非深层理解的症状。 我们提出了 CEH 任务,并构建了一个孟加拉语句子基准数据集。在这些句子中,一个词出现两次,具有两种不同的解读,每个解读都标注了六个文化类别之一以及背后的文化推理解释。通过评估开源和闭源模型,我们揭示了一种系统性的**主导含义偏差**:模型默认选择普通名词义项,而忽略人名义项(图 1)。一个孟加拉语专用模型在我们测试的所有策略下均告失败,这证实了仅靠语言专用预训练无法赋予文化根基。我们进一步证明,对比思维链提示可以在不训练的情况下显著减少这种偏差,但其效果高度依赖模型;并且将文化推理蒸馏到小模型中,可以教会它们进行推理以得出正确解读,而非记忆标签。 **贡献:** (i) 我们形式化了 CEH 消歧任务,该任务将文化根基与低资源语言中的表层词汇能力分离开来。 (ii) 我们发布了一个孟加拉语 CEH 基准,包含词元级别的文化类别和文化推理解释。 (iii) 我们在零样本、少样本、对比思维链和知识蒸馏等多种策略下评估了开源和闭源模型,揭示了一致的主导含义偏差,以及孟加拉语专用模型在所有设置下的失败。 (iv) 我们展示了对比推理和蒸馏监督能够缓解这种偏差,并分析了它们成功或失败的条件和原因。 ## 2 相关工作 词义消歧(WSD)是一个长期存在的自然语言处理问题 (Navigli and Ponzetto, 2010; Raganato et al., 2017),并且在形态丰富、低资源语言中尤其困难,因为这些语言的标注语料库稀少 (Habtamu and Gizachew, 2024; Masethe et al., 2024);近期工作通过混合语义标注 (Goworek et al., 2025) 和专门的阿拉伯语及乌尔都语资源 (Khalilia et al., 2024; Saeed et al., 2019) 将 WSD 评估扩展到资源匮乏的场景。同时,探究大语言模型是否真正理解词义的研究报告指出,表面流利性往往掩盖了浅层的词汇理解 (Meconi et al., 2025; Ortega-Martín et al., 2023)。 我们的 CEH 任务与经典 WSD 的区别在于,竞争的解读——即一个人名与其所源自的文化负载概念——不是词汇上不同的义项,而是文化上缠结的义项,需要语用和文化知识而非词典义项清单。这与关于 LLM 文化能力的快速增长的文献相关联,这些文献发现模型编码了西方主导偏差,在低资源文化的价值观和日常知识上表现不佳 (Belay et al., 2025; Yu et al., 2025),并且语言专用能力不能保证文化根基 (Belay et al., 2025)。 对于孟加拉语,近期努力已经产生了专门的模型和知识基准 (Nahin et al., 2025; Raihan and Zampieri, 2025; Joy and Shatabda, 2026),但日常词汇使用中的文化根基仍未得到充分探索,流利的孟加拉语生成仍然可能隐藏系统性的语域和事实性失败 (Shuvo et al., 2026; Adib et al., 2026)。 最后,我们的缓解策略建立在思维链提示 (Wei et al., 2022) 和将推理知识蒸馏到小模型 (Magister et al., 2023; Hsieh et al., 2023) 的基础上;与以往针对数学或常识推理的蒸馏工作不同,我们蒸馏的是**文化**推理,教小模型证明为什么某个出现是人名或概念,而不仅仅是复现标签。 ## 3 数据集构建 **任务形式化。** 我们基准中的每个实例都是一个孟加拉语句子,其中一个词形式出现**两次**,具有两种不同的解读。给定句子和目标词,模型必须为每个出现分配六个文化类别之一:人名、概念、情感、情感状态、集体状态和灵性,并论证每个分配。关键在于,两种解读不是任意的词汇义项,而是**文化缠结**的:同一个形式一次充当人名,一次充当该名字传统上所源自的情感、概念或灵性状态。 **词语选择。** 我们不依赖固定的名字注册表或词汇数据库。相反,一位母语为孟加拉语的专家手动挑选了诸如 মায়া (Maya)、আশা (Asha) 和 গগন (Gagan) 等词语,这些词既是常见的孟加拉语名字,也是承载文化内涵的普通名词。这种专家驱动的选择刻意针对具有真正双重解读的形式,这是一般名字列表无法做到的,但代价是覆盖范围仅反映单个标注者的命名知识(见局限性部分)。 **多模型生成。** 对于每个选定的词语,我们使用三个最先进的模型作为互补生成器来生成句子和配套的文化解释:Claude Fable 5、Kimi K3 和 Gemini 3.5 Flash,分别产生 690、480 和 344 个实例。多个生成器减少了单一教师的风格和分布偏差,并产生了更大的词汇和结构多样性。 **词** গগন (Gagan) **类别** 人名 ↔ 概念 **句子** সমুদ্রসৈকতে সূর্যাস্ত দেখতে দেখতে গগন-র মনে হলো, প্রাচীন শ্লোকে ’গগন’ দিয়ে ঠিক এই আকাশ; নভোমণ্ডল-কেই বোঝানো হতো। **英译** Watching the sunset, it struck Gagan that ancient verse used ‘Gagan’ for exactly this the celestial firmament. **出现1** 人名(一个人,语法主语) **出现2** 概念(天空、天穹) **文化注释** 孟加拉语命名传统将自然、神祇和美德的词汇转化为个人名字;গগন 因此一次是活的个体身份,一次是文化概念。 表1:一个 CEH 实例示例。同一个形式 গগন (Gagan) 出现两次,分别具有人名解读和概念解读。完整的双语模式见附录 C。 **跨模型与人工验证。** 我们采用了两个阶段的验证协议。首先,输出由不同模型以循环方式交叉检查(Claude 由 Kimi 验证,Kimi 由 Gemini 验证,Gemini 由 Claude 验证),标记不一致的标签或解释,而无需任何模型自我审查其输出。其次,每个实例由两名母语为孟加拉语的人员进行人工审核(个人简介见附录 A),他们修正了标签、解释以及文化上不准确的推理。人工验证是最终权威;跨模型阶段仅用于为审核员呈现候选错误。 表2:CEH 统计——缠结类别(左)和词元级标签分布(右)。 **标注。** 每个验证后的实例包含两个出现的词元级标签、一个关于每个出现为何带有其标签的自然语言解释,以及一个简洁的文化缠结注释,描述连接两种解读的命名惯例。这些解释构成了我们知识蒸馏实验的监督信号(第 4 节)。图 2 展示了我们的方法总览,涵盖数据集创建、基于提示的评估(零样本、少样本、C-CoT)、使用 LoRA 的知识蒸馏微调,以及在保留的 CEH 句子上的评估(使用自动、人工和基于 LLM 的评分器)。 一个示例实例展示在表 1 中;完整的字段模式和一个原始 JSON 记录见附录 C。 图 2:我们的方法总览,涵盖数据集创建、基于提示的评估(零样本、少样本、C-CoT)、使用 LoRA 的知识蒸馏微调,以及在保留的 CEH 句子上的评估(使用自动、人工和基于 LLM 的评分器)。
相似文章
表面礼貌,实际错误:用于修复多语言孟加拉语生成中敬语失误的精选数据集
本文介绍BLADE,一个文化对齐的指令微调数据集,包含4,196个交互对,用于修复多语言孟加拉语生成中的敬语失误和语用差距。在此数据集上微调DeepSeek-8B和LLaMA-3.2-3B等模型,在结构保真度和敬语对齐方面取得了显著改进。
当英语改写本地知识:大语言模型中的全球叙事主导
本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。
当相似意味着不同:评估LLM在阿拉伯语-希伯来语同源词上的表现
本文介绍了SemCog Bench,这是一个精心整理的基准测试,包含1,858个阿拉伯语-希伯来语词对,并带有句子级别的注释,用于评估LLM区分真同源词、假同源词和借词的能力。结果显示,模型在真同源词上准确率很高,但在假同源词上准确率大幅下降,突显了跨语言语义推理中的一个关键局限性。
MultiSoc-4D:用于诊断孟加拉语社交媒体封闭集大语言模型标注中指令诱导标签崩溃的基准
本文介绍了 MultiSoc-4D,这是一个用于诊断大语言模型在标注孟加拉语社交媒体数据时出现的指令诱导标签崩溃问题的基准测试。研究揭示,大语言模型系统性地倾向于使用默认标签,导致对仇恨言论和讽刺等少数类别的检测不足。
BenSyc:孟加拉语境下LLM对话谄媚与人类对齐的基准评估
研究人员推出了BenSyc,这是首个在孟加拉社会语境中评估对话谄媚的基准,发现大语言模型难以区分共情支持与验证及升级行为,仅达到约61%的Macro-F1。