Mwando:利用AI保存和教授shiKomori
摘要
Mwando是一个虚拟教育助手,利用AI保存和教授科摩罗语shiKomori,采用多智能体架构,结合向量搜索、知识图谱和网络回退。
arXiv:2607.23481v1 公告类型:新论文
摘要:本文介绍了Mwando,一个旨在支持shiKomori(科摩罗群岛语言)教学和保存的虚拟教育助手。该系统通过由短语、谚语、词典和语法课程构建的知识库,覆盖四种主要方言变体(shiNgazidja、shiMwali、shiNdzuani和shiMaore)。结合向量搜索、知识图谱和网络搜索回退的多智能体架构能够提供准确且上下文相关的响应。对500个查询的评估显示其在词汇查询和语法解释方面表现强劲,而定性案例研究则展示了能力与当前局限性。这项工作是为shiKomori提供计算支持的初步步骤,并为开发面向其他低资源语言的AI教育工具提供了蓝图。
查看缓存全文
缓存时间: 2026/07/28 06:29
# Mwando:利用人工智能保护与教授 shiKomori
来源:https://arxiv.org/html/2607.23481
Naira Abdou Mohamed¹, Haidar Nassur Said Ali², Mohamed Hazra³, Naoufal Mohamed Soibira¹,⁴, Roushnaty Ali Yamani³
¹科摩罗,莫罗尼,Rifai
²摩洛哥,卡萨布兰卡,哈桑二世大学,CP2BM 实验室
³摩洛哥,盖尼特拉,伊本·托法伊大学
⁴法国,格勒诺布尔,格勒诺布尔政治学院
###### 摘要
本文介绍 **Mwando**,一个旨在支持 shiKomori(科摩罗群岛语言)教学与保护的虚拟教育助手。该系统通过由短语、谚语、词典和语法课程构建的知识库,涵盖四种主要方言变体(shiNgazidja、shiMwali、shiNdzuani 和 shiMaore)。系统采用多智能体架构,结合向量搜索、知识图谱和网络搜索后备机制,能够提供准确且具有上下文意识的回答。在 500 个查询上的评估显示,系统在词汇查找和语法解释方面表现强劲,而定性案例研究则展示了其能力与现有局限性。这项工作是为 shiKomori 提供计算支持的第一步,也为开发面向其他低资源语言的 AI 驱动教育工具提供了蓝图。
Mwando:利用人工智能保护与教授 shiKomori
## 1 引言
语言保护是联合国开发计划署(UNDP)等国际组织的核心关切。UNDP 强调非洲语言是推动非洲大陆发展的关键动力 United Nations Development Programme and Ministry of Enterprises and Made in Italy (2024 (https://arxiv.org/html/2607.23481#bib.bib28))。然而,这种潜力在很大程度上仍未实现,因为目前支持这些语言的技术解决方案极少 Wild (2025 (https://arxiv.org/html/2607.23481#bib.bib29))。这种情况令人担忧,因为语言和文化是发展的主要驱动力 Rotondo (2016 (https://arxiv.org/html/2607.23481#bib.bib32)),并且在非洲社会的日常生活中扮演着核心角色。不过,语言处理技术,特别是生成式 AI 系统的进步,带来了充满希望的机会:只要适当适应文化和语言特点,这些模型可以成为保护文化遗产的有效载体 Colace et al. (2025 (https://arxiv.org/html/2607.23481#bib.bib30)); Koc (2025 (https://arxiv.org/html/2607.23481#bib.bib31))。
在这项工作中,我们旨在为 shiKomori(科摩罗群岛使用的语言)自然语言处理(NLP)技术的初步发展做出贡献。在我们之前关于科摩罗语及其方言变体基础 NLP 资源的工作 Naira et al. (2024 (https://arxiv.org/html/2607.23481#bib.bib27), 2025 (https://arxiv.org/html/2607.23481#bib.bib22)) 的基础上,我们将重点转向应用教育场景。
具体而言,我们介绍 Mwando,一个专为教授 shiKomori 设计的虚拟助手,旨在支持科摩罗文化的传承与保护。Mwando(在 shiKomori 中意为“开始”)旨在向 Sheikh Ahmed Kamar-Eddine 在科摩罗语言记录与书写标准化方面的开创性工作致敬 Lafon (2007 (https://arxiv.org/html/2607.23481#bib.bib21)); Naira et al. (2025 (https://arxiv.org/html/2607.23481#bib.bib22))。我们的贡献有三方面:
- • 我们整理并组织了一个 shiKomori 多源语料库,涵盖短语、谚语、词典和语法课程,并将这些数据公开可用,以支持未来的研究。
- • 我们为教育目的开发了一个虚拟助手,能够用 shiKomori 与学习者互动。
- • 我们评估了该助手支持语言学习和文化保护的潜力,为面向极低资源语言的 NLP 资源进一步开发提供了见解。
## 2 动机
生成式 AI 的出现已成为教育领域的重大变革者 Team et al. (2025 (https://arxiv.org/html/2607.23481#bib.bib6)),并迅速被学生和语言教师采用 Zaim et al. (2025 (https://arxiv.org/html/2607.23481#bib.bib13))。这种快速采用的原因之一在于,学生可以通过虚拟教师获得快速反馈,而教师则能根据不同的情况快速有效地定制课程 Galaczi and Luckin (2024 (https://arxiv.org/html/2607.23481#bib.bib14))。正是基于这一点,塞内加尔在初等教育中开展了一个项目,以支持法语教师在由文化和语言多样性显著的学生组成的课堂中更好地教学 Agence Française de Développement (2025 (https://arxiv.org/html/2607.23481#bib.bib12))。
在科摩罗,尽管 AI 和信息技术在教育中的应用记录非常稀少 Roukiyat (2026 (https://arxiv.org/html/2607.23481#bib.bib9)),但已有先前研究强调了将 shiKomori 纳入教学以提高教学效果的重要性 DANIEL (2024 (https://arxiv.org/html/2607.23481#bib.bib11))。当地倡议如 Maecha 协会,则致力于为成年人口提供科摩罗语扫盲,而该群体中约有 49.7% 的人为文盲 Chauvet (2015 (https://arxiv.org/html/2607.23481#bib.bib10))。
因此,考虑采用现代方法学习 shiKomori 至关重要。这类倡议不仅能使其他人群和部门受益,例如改善游客在群岛的体验,还将对国家的可持续发展发挥重要作用 Roukiyat (2026 (https://arxiv.org/html/2607.23481#bib.bib9))。此外,它们对于科摩罗侨民后代(尤其是法国的侨民群体,其人口估计超过 30 万人 Le Monde (2024 (https://arxiv.org/html/2607.23481#bib.bib7)),且为群岛发展做出了显著贡献 Abdillahi (2012 (https://arxiv.org/html/2607.23481#bib.bib8)))的融入也具有强大潜力。
## 3 语言资源
本研究面临的最大挑战之一是获取数据。我们的方法是查阅所有可能获取的资源,以建立知识库。然而,为确保数据集的可靠性,在每个处理阶段都需要进行人工检查。因此,本节我们将描述所用到的所有语料库,从原始数据到为本次工作转换后的数据。
### 3.1 语言概述
shiKomori 仅在科摩罗群岛使用,是一种班图语,与斯瓦希里语 Ahmed Chamanga (2022 (https://arxiv.org/html/2607.23481#bib.bib25)) 以及萨巴基语族 Serva and Pasquini (2021 (https://arxiv.org/html/2607.23481#bib.bib24)) 关系密切。它包含四种方言变体,每种主要与一个岛屿相关联,但使用者和不同变体之间具有高度的互通性 Ahmed Chamanga (2022 (https://arxiv.org/html/2607.23481#bib.bib25)); Naira et al. (2024 (https://arxiv.org/html/2607.23481#bib.bib27))。shiKomori 在该群岛拥有国家语言地位,而法语和阿拉伯语是官方语言。在实际使用中,shiKomori 主要用于日常交流和非正式媒体的口头沟通,法语主导行政和正规教育领域,阿拉伯语则主要用于宗教语境 Chauvet (2015 (https://arxiv.org/html/2607.23481#bib.bib10))。
在书写形式上,shiKomori 可以使用拉丁字母或阿拉伯字母转写 Lafon (2007 (https://arxiv.org/html/2607.23481#bib.bib21)); Naira et al. (2025 (https://arxiv.org/html/2607.23481#bib.bib22))。然而,其书面使用仍然有限,并存在拼写标准化缺失的问题。尽管近期有倡议旨在改善非洲语言在 NLP 中的代表性 Adebara et al. (2025 (https://arxiv.org/html/2607.23481#bib.bib23)),但 shiKomori 在该领域仍然严重缺乏代表性,仅有少数先前工作涉及 Naira et al. (2024 (https://arxiv.org/html/2607.23481#bib.bib27), 2025 (https://arxiv.org/html/2607.23481#bib.bib22)); Abdourahamane et al. (2016 (https://arxiv.org/html/2607.23481#bib.bib26))。
### 3.2 数据来源
本研究依赖六个主要数据来源,如图 1 所示。这些来源分为四类主要数据:
- • 常用短语:包括 shiKomori 中常用短语,不区分方言变体。这些短语附有英文翻译,涵盖广泛的主题,从简单的问候到市场、旅行和日常互动等常见表达。数据来自一个收集科摩罗群岛相关资源的 Google Drive 仓库¹¹¹https://drive.google.com/drive/folders/17C_03qCMm2rGDhgGqi_8PKJfR30V_S96。
- • 谚语:谚语通过 Apify 爬取工具从 Instagram 页面 *ProverbesComoriens*²²²https://www.instagram.com/proverbescomoriens/ 收集。每条帖子都包含 shiKomori 谚语及其法语和英语翻译。但帖子以图片形式发布。为提取文本内容,我们使用了 DeepSeek-OCR Wei et al. (2025 (https://arxiv.org/html/2607.23481#bib.bib20))。这种基于 OCR 的提取偶尔会引入微小错误,特别是关于变音符和特殊字符,在数据清洗阶段已进行人工修正。
- • 词典:使用了两种词典。第一种专注于 shiNgazidja,由 Bahari 基金会³³³https://fr.scribd.com/document/619345660/ShiNgazidja-English-Dictionary 制作,提供 shiNgazidja 词语和表达的英文翻译,并明确标注名词和语法类别。第二种词典来自上述同一 Google Drive 仓库,包含 shiMwali 词语的英文翻译及语法类别标注。
- • 语法教材:从同一 Google Drive 仓库获取,包含两份教材。第一份关于 shiMaore,第二份关于 shiNdzuani。两份教材均包含课程和练习,并附有英文翻译。由于这些文档主要采用表格形式呈现,因此需要特定的预处理步骤以改善文本提取质量。
最后,本研究中使用的所有数据源均为在线公开资源。对于 Instagram 数据,我们仅收集了公开可访问的帖子,并遵守了平台的服务条款。词典和语法手册由其各自出版商或托管平台免费分发。我们在开放许可下发布处理后的数据集,以促进科摩罗语处理的未来研究(见表 1)。
图 1:数据准备流程。
表 1:本工作中使用的数据集概览。
### 3.3 知识库构建
需要对数据进行进一步的结构化处理。例如,在收集到的数据中,语法课程的部分数据以表格形式呈现,如图 1 所示。尽管大语言模型(LLM)在理解文本数据方面很有效,但在处理混合了表格内容的文本时表现出局限性 Liu et al. (2024 (https://arxiv.org/html/2607.23481#bib.bib19))。这个问题主要出现在数据分词阶段。为缓解这一问题,我们首先应用了文档结构化步骤,使用 Word2md 平台⁶⁶⁶https://word2md.com/ 将文档转换为 Markdown 格式。
随后,将 Markdown 内容输入 ChatGPT API,以将数据重构为更易利用的知识库。此过程包括提取章节内容、涵盖的概念、表格、定义及相关内容,并将其组织成 JSON 文件。具体的结构化策略根据数据类型而有所不同。在所有情况下,都进行了人工验证步骤,以审查和修正 ChatGPT 生成的输出。
## 4 聊天机器人工作流程
近年来,多智能体方法的使用显著提升了虚拟助手的推理能力,特别是在需要从多个来源检索信息的情况下 Salve et al. (2024 (https://arxiv.org/html/2607.23481#bib.bib5))。在我们需要处理多种方言变体和多种数据集的背景下,采用多智能体方法成为自然选择。图 2 展示了概括我们推理与信息检索核心的整体流程。
图 2:RAG 流程。为应对多科摩罗方言和异构数据源的挑战,我们设计了一个多智能体系统,该系统协调专门智能体,每个智能体负责特定类型的查询或知识领域。该架构如图 2 所示,通过结合向量搜索、知识图谱和外部网络资源,实现灵活且稳健的信息检索。
### 4.1 整体流程
系统运行如下:当用户提交查询时,首先由一个中心检索智能体处理。该智能体充当协调者:分析查询,并确定应调用哪个专门智能体来提供最准确和最全面的答案。然后,LLM 基于检索到的信息生成响应,并返回给用户。
### 4.2 核心组件与专门智能体
系统包含五个主要专门智能体,每个利用不同的工具和知识库:
- • 检索智能体:作为所有查询的入口,负责查询理解与动态路由。它决定是将请求转发给单个专家,还是组合多个智能体的结果。它依赖 LLM 进行意图分类,并依赖向量搜索引擎从预先计算的、涵盖所有方言变体的嵌入数据库中检索相关段落。
- • 翻译/谚语智能体:负责两个紧密相关的任务。对于翻译查询,访问双语词典(shiNgazidja-英语,shiMwali-英语)和短语集合。对于与谚语相关的查询,使用一个专门的图数据库,存储谚语及其含义、文化背景和翻译。图结构允许进行语义导航(例如,查找与特定主题相关的谚语)。
- • 教师智能体:专注于教学需求,提供语法解释、动词变位表和语言学习资源。它利用语法手册(shiMaore 和 shiNdzuani),并能生成结构化的课程或练习。它还维护着一个常见学习者错误与误解的数据库。
- • 文化智能体:对于超出其他智能体范围或需要专门知识库未覆盖的通用信息的查询,执行实时网络搜索。它作为后备机制,确保即使内部资源不足,系统也能提供相关答案。
### 4.3 技术实现
系统围绕若干关键技术构建。对于嵌入与向量搜索,包括词典、谚语、短语集合和语法课程在内的所有文本资源,均使用 Qwen3 Embedding Zhang et al. (2025 (https://arxiv.org/html/2607.23481#bib.bib4))(一个多语句子变换器)进行嵌入。选择该模型有两个主要原因。首先,它是近期基准测试中表现最佳的嵌入模型之一,能在多种语言上提供高质量的语义表示。其次,其参数仅为 20 亿,足够轻量,可在资源受限的环境下运行,使其相似文章
Adesua: 面向西非科学学习的AI WhatsApp机器人的开发与可行性研究
本文介绍了 Adesua,一个基于 WhatsApp 的 AI 教学助手,用于西非的科学教育,它结合了检索增强生成与精选教科书和考试题目。在加纳进行的一项为期 6 个月的可行性研究显示,感知有用性较高(93.75% 的帮助率),但样本量较小。
@GoogleDeepMind:在塞拉利昂,激增的学生人数正超出可用教师的数量。我们最新的研究探讨了AI如何……
Google DeepMind的最新研究探讨了AI如何在塞拉利昂支持教育工作者,那里日益增长的学生人数超过了可用的教师数量,旨在扩展教师的影响力而不取代他们的专业知识。
WebMCP:让您的网站与AI代理对话
WebMCP是由Google和Microsoft提出的一项网络标准,它允许网站声明结构化工具供AI代理直接调用,从而用稳定的接口替代脆弱的屏幕抓取技术。
@hwchase17: https://x.com/hwchase17/status/2071963622298050997
文章讨论了AI代理中新兴的'wiki记忆'模式,其中原始源数据被智能压缩成一个持久、结构化的知识层,代理可以高效地使用它。文章将其与基础RAG进行了比较,并给出了DeepWiki和LLM Wiki等例子。
@rohanpaul_ai: AI代理可以在不重新训练代理本身的情况下,通过使用一个独立的小模型来清理并...
AdaCoM是一个独立的大语言模型,用于管理冻结AI代理的上下文,在不重新训练的情况下提升长任务性能。在测试中,它使平均网络搜索性能提高了39%。