从词汇到AI:面向低资源语言专业对话系统的结构化数据流水线

arXiv cs.CL 论文

摘要

提出了一种系统方法论,将印地语WordNet转换为125万条指令-响应对,并利用LoRA对12B参数语言模型进行微调,展示了在低资源语言专业对话系统中教学效果的显著提升。

arXiv:2606.26112v1 公告类型:新 摘要:低资源语言在AI开发中面临一个关键挑战:在缺乏大规模训练语料的情况下构建专业对话系统。我们提出了一种系统方法论,将结构化的语言资源转化为专业AI系统,证明了专家策展的词汇数据库可以成为对话式AI开发的有效基础。我们的方法将印地语WordNet转换为125万个多样化的指令-响应对,并使用资源高效的LoRA结合4位量化技术对12B参数语言模型进行微调。通过印地语学习聊天机器人的评估表明,基于结构化知识的系统在教学效果(91.0,而通用模型为79.4-83.6)上表现出显著优势,同时在语义性能和一致性上保持竞争力。该完整流水线以印地语为例,验证了一种适用于任何拥有WordNet资源的语言的专业AI系统开发方法。本研究弥合了低资源语言在AI可及性方面的关键差距,为依赖大规模语料的方法提供了一种实用替代方案,并有望推动拥有WordNet资源的数百种语言的专业AI开发。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:14

# 从词汇库到AI:面向低资源语言中专用对话系统的结构化数据管道
来源:https://arxiv.org/html/2606.26112
\[ Path = \./, Extension = \.ttf, UprightFont = \*\-Regular, BoldFont = \*\-Bold, ItalicFont = \*\-Italic, BoldItalicFont = \*\-BoldItalic \]\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English

Siddhant Hitesh Mantri NMIMS, Mumbai \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=Englishsiddhant\.mantri22@nmims\.in &Dhara Gorasiya CFILT, IIT Bombay \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=Englishdharagorasiya@gmail\.com Malhar Kulkarni CFILT, IIT Bombay \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=Englishmalhar@hss\.iitb\.ac\.in &Pushpak Bhattacharya CFILT, IIT Bombay \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=Englishpb@cse\.iitb\.ac\.in

###### 摘要

低资源语言在人工智能开发中面临一个关键挑战:构建专用对话系统却无法获取大规模训练语料。我们提出了一种系统化方法,将结构化语言资源转化为专用AI系统,证明经过专家精心策划的词汇数据库能够作为对话式AI开发的有效基础。我们的方法将印地语WordNet转换为125万个多样化的指令-响应对,并利用资源高效的LoRA(4位量化)对120亿参数的语言模型进行微调。通过印地语学习聊天机器人进行的评估表明,基于结构化知识的系统在教育性对话场景中能提升教学效果(与通用模型79.4-83.6相比,达到91.0),同时保持具有竞争力的语义表现和高一致性。完整的管道展示了利用印地语为任何拥有WordNet资源的语言开发专用AI系统的概念验证方法。这项工作填补了低资源语言在AI可及性方面的关键空白,提供了一种实际可行的替代方案,无需大量语料,并可能为数百种已有WordNet资源的语言开启专用AI开发之路。

## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English1 引言

人工智能的民主化越来越依赖于开发能够有效服务于不同语言社区的专用系统。尽管大型语言模型的最新进展展现了强大能力(Hagos等人,2024(https://arxiv.org/html/2606.26112#bib.bib16)),但这些系统主要擅长于数字内容丰富的资源充足语言,导致数十亿使用低资源语言的用户得不到充分服务(Zhong等人,2024(https://arxiv.org/html/2606.26112#bib.bib35);Hasan等人,2024(https://arxiv.org/html/2606.26112#bib.bib17))。在诸如教育等专业领域,这一差距尤为明显,因为文化和语言对齐的AI系统对于有效的学习成果至关重要(Li等人,2024(https://arxiv.org/html/2606.26112#bib.bib20))。

在此类场景中开发对话式AI的一个关键瓶颈在于对大规模训练语料的依赖,而全世界2500多种语言中的大多数都缺乏这种语料(UNESCO,2010(https://arxiv.org/html/2606.26112#bib.bib32);濒危语言项目,(https://arxiv.org/html/2606.26112#bib.bib11))。现有的微调范式假定存在大规模文本数据(Cryst等人,2025(https://arxiv.org/html/2606.26112#bib.bib7)),例如GPT-3(Brown等人,2020(https://arxiv.org/html/2606.26112#bib.bib5))和Common Crawl(Baack,2024(https://arxiv.org/html/2606.26112#bib.bib2))所使用的数据集。然而,挑战不仅在于数据数量,更在于缺乏高质量、领域特定的指令数据。即使是像印地语这样拥有大量网络存在的语言,在具有教学意义的实例方面仍然属于“资源匮乏”,限制了其在专用AI系统中的应用。

为了解决这一限制,我们利用了经过编码、由专家精选的结构化语言资源。WordNet是分层级的词汇数据库,记录了语义关系,已有超过200种语言的版本(全球WordNet协会,(https://arxiv.org/html/2606.26112#bib.bib15)),而BabelNet则大规模整合了多语言WordNet(Navigli和Ponzetto,2010(https://arxiv.org/html/2606.26112#bib.bib23))。尽管这些资源很丰富,但它们通常被用作静态参考,而不是作为训练对话系统的基石,这在多语言背景下推进AI可及性方面是一个错失的机会。

我们提出了一种系统化的方法,将结构化语言资源转化为专用的对话式AI系统,为需要大量语料的方法提供了实际可行的替代方案。以印地语WordNet(Bhattacharyya,2010(https://arxiv.org/html/2606.26112#bib.bib3);Bhattacharyya等人,2008(https://arxiv.org/html/2606.26112#bib.bib4))为例,我们构建了一个语言学习系统,并在语义准确性和教学效果方面进行了评估。

除了这个具体实现之外,我们的方法还提出了一条潜在可扩展的路径,使得能够利用已有结构化资源的语言进行AI开发。印地语WordNet包含105,460个词和40,466个同义词集(印度理工学院孟买分校印度语言技术中心,2025(https://arxiv.org/html/2606.26112#bib.bib6)),同时也为其他印度语言WordNet奠定了基础。这使得该方法对于资源受限环境中的教育应用特别相关,因为在这类环境中,计算能力的限制和适当内容的缺乏都阻碍了采用(Redkar等人,2018(https://arxiv.org/html/2606.26112#bib.bib30))。

我们的主要贡献是:(1)一种将结构化词汇数据库转换为多样化对话训练数据同时保留语义关系的系统方法;(2)一种资源高效的微调框架的演示,使其能够部署在典型的教育环境中;(3)证明在特定领域性能上优于通用模型的实验证据。这些结果共同为在低资源语言中构建专用AI系统建立了一个可复现的管道。

## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2 相关工作

### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.1 AI 在教育中不断演变的作用

大规模调查一致报告了AI干预带来的积极学习成效,同时也警告说,其影响往往只在单一维度上衡量,而非综合的教学、技术和人为因素。一项涵盖2010-2020年的全面综述建议采用“多维评估模型”,将技术指标与教学设计、领域对齐和学习者情感结合起来(Zhai等人,2021(https://arxiv.org/html/2606.26112#bib.bib34))。一项概念性综述将AI的功能分为三类:新主题、直接中介和辅助助手,展示了每种角色如何重塑课堂动态(Xu和Ouyang,2022(https://arxiv.org/html/2606.26112#bib.bib33))。当AI扮演“新主题”角色(例如辅导代理)时,它可以个性化教学,但必须解决社交存在感和反思问题,以避免仅仅自动化机械练习(Xu和Ouyang,2022(https://arxiv.org/html/2606.26112#bib.bib33))。这些见解将我们的方法定位为保持学习者和结构化知识之间的联系,而不是取代专家指导。

### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.2 用于语言学习的聊天机器人

系统性证据证实了语言学习聊天机器人的三种反复出现的功能:及时性、易用性和个性化,其教学用途包括模拟、帮助热线和推荐(Huang等人,2022(https://arxiv.org/html/2606.26112#bib.bib19))。社交存在感分析表明,机器人的自我表露能鼓励更长的学习者话语并减少练习焦虑(Huang等人,2022(https://arxiv.org/html/2606.26112#bib.bib19))。CLIL(内容与语言整合学习)现场研究表明高参与度(91%的内容掌握一致性,93%认为对话引人入胜),但仅有48%的人感受到语言技能提升,凸显了内容与语言目标之间的紧张关系(Mageira等人,2022(https://arxiv.org/html/2606.26112#bib.bib22))。这些发现促使我们采用自适应输出级别,平衡词汇复杂性与课程内容,并通过响应后增强来维持参与度,超越新奇效应。

### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.3 低资源语言中的对话式AI

低资源环境给AI开发挑战增加了数据稀缺、文化差异和部署限制。愿景论文认为,像直接偏好优化(DPO)这样的技术可以降低对文化敏感型AI伴侣的监督要求(Ding等人,2024(https://arxiv.org/html/2606.26112#bib.bib10))。实证工作探索了轻量级架构:一个孟加拉语客服机器人使用N-gram词干提取和CNN分类器,在没有深度语言资源的情况下达到了超过90%的准确率,但缺乏结构化知识整合和级别自适应(Paul等人,2019(https://arxiv.org/html/2606.26112#bib.bib28))。知识增强的FAQ聊天机器人通过迁移学习改进了意图分类,但依赖于检索而非生成,限制了对话深度(Perdana等人,2022(https://arxiv.org/html/2606.26112#bib.bib29))。最近的方法试图通过利用大型基础模型的跨语言迁移能力来绕过数据稀缺问题。(Nguyen等人,2024(https://arxiv.org/html/2606.26112#bib.bib24))引入了语言多样性提示(LDP),这是一种通过使用高资源“姊妹语言”或英语中介的合成示例来激发低资源语言生成能力的技术。虽然这种方法表明,英语主导的模型可以在没有监督数据的情况下被诱导执行翻译和摘要任务,但它根本上依赖于模型潜在的预训练知识。因此,这种提示策略仍然容易受到基础模型固有的幻觉和事实不一致性的影响,特别是在专业领域,模型对低资源语言的内部表示稀疏或零散。这一局限性强调了将生成过程锚定于明确的结构化专家知识,而不仅仅是依赖跨语言迁移的必要性。这些研究证明了可行性,同时也指出了以下差距:(1)自动生成多样化的指令-响应对;(2)资源高效的微调;(3)结构化词汇资源的耦合(Oyewole等人,2024(https://arxiv.org/html/2606.26112#bib.bib26))。

印地语WordNet已被改编为印地语Shabdamitra,这是一个面向K-12学习者的五个级别的数字辅助工具,提供词汇简化并逐步呈现更丰富的语义关系。课堂试点表明,当学习者探索联想网络而不是平坦的词典条目时,概念记忆有所提高(Redkar等人,2018(https://arxiv.org/html/2606.26112#bib.bib30))。WordNet的认知基础——将意义表示为概念网络——与语义网络词汇习得理论相一致。尽管有这种潜力,现有的对话系统很少在初始训练之外利用这种结构。我们的方法弥合了这一差距,将同义词集转换为训练样本,通过生成后增强维持知识联系,并实现从对话到结构化知识的灵活转换。

### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English2.4 研究空白与机遇

低资源语言应用仍然存在关键空白:(1)结构化知识连续性——聊天机器人很少维持学习者与训练资源的联系(Huang等人,2022(https://arxiv.org/html/2606.26112#bib.bib19);Oyewole等人,2024(https://arxiv.org/html/2606.26112#bib.bib26));(2)级别自适应生成——很少有系统在不同熟练水平上系统地改变词汇、句法和解释深度(Paul等人,2019(https://arxiv.org/html/2606.26112#bib.bib28));(3)资源高效部署——方法通常假设云规模硬件(Ding等人,2024(https://arxiv.org/html/2606.26112#bib.bib10));(4)集成支架——研究报告了新奇效应和有限的长期收益,表明需要动态学习支持(Mageira等人,2022(https://arxiv.org/html/2606.26112#bib.bib22);Huang等人,2022(https://arxiv.org/html/2606.26112#bib.bib19))。我们的方法通过将结构化语言资源与参数高效微调及实时知识增强相结合,应对了每个空白。

## \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3 方法:结构化数据到AI的管道

我们的系统化方法通过四个集成阶段将结构化语言数据库转化为专用对话式AI系统:系统化数据集生成、资源高效模型微调、领域自适应响应生成以及智能知识整合。该管道表明,经过专家策划的词汇资源可以作为专用AI开发的有用基础,为低资源语言提供了一种无需大量语料的实际可行替代方案。

### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3.1 数据集创建管道

#### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3.1.1 结构化知识处理

我们系统地将印地语WordNet的结构化语义数据转换为多样化的对话训练样本。该资源包含56,928个词,具有丰富的语义关系,包括上位词、下位词、部分整体关系、反义关系和本体层级。我们的自动化管道生成四种互补类型的指令-响应对,旨在保留结构化知识的同时创建自然的对话交互(详见附录\\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=EnglishB(https://arxiv.org/html/2606.26112#A2)中的示例):

- \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English•基本指令对:为核心语言概念建立基本问答模式。
- \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English•复杂多维度对:在单个响应中整合多种语义关系,在完整的语言上下文中教授综合的词汇理解,包括定义、同义词、示例和语法类别。
- \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English•本体层级对:利用WordNet的分类结构教授类别关系。
- \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English•消歧对:通过语境区分明确教授多义词的多种含义,对于像印地语这样形态丰富的语言至关重要。

#### \\fontspec\_if\_language:nTFENG\\addfontfeatureLanguage=English3.1.2 关系覆盖与质量保证

印地语WordNet的23种语义关系类型(Bhattacharyya,2010(https://arxiv.org/html/2606.26112#bib.bib3))通过专家语言学咨询被映射到教育术语上。为防止信息过载同时确保完整覆盖,我们对密集语义关系实现了动态分块算法。

相似文章

卡在独特的NLP难题上[D]

Reddit r/MachineLearning

开发者寻求在不依赖大模型的情况下对英-印混写文本进行分类的建议,因为句子变换器在处理罗马化印地语时完全失效。