标签
提出了一种用于东干语的双方言有限状态形态分析器,并通过多体裁评估来衡量词形变化、歧义和词汇覆盖情况。
Mwando是一个虚拟教育助手,利用AI保存和教授科摩罗语shiKomori,采用多智能体架构,结合向量搜索、知识图谱和网络回退。
介绍了PatiGonit22K,这是一个扩展后的孟加拉语数学应用题数据集,包含22,441个问题,包括复杂的多步运算问题,旨在推动低资源语言数学推理研究的发展。
本文介绍了KyrgyzLLM-Bench,这是一个用于评估吉尔吉斯语大语言模型的基准测试套件,包含原生创作和翻译数据集,并对26个模型进行了系统评估。
提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。
本文介绍了BanglaMemeEvidence,这是一个包含2,917个孟加拉语模因的多模态数据集,这些模因经过注释用于解释性证据检测,并提出了BengaliMemeEvidenceNet,一个混合框架,实现了0.74的F1分数。
本文探讨了使用文本转语音(TTS)为低资源语言卢森堡语的语音问答生成合成训练数据,并评估了采用参数高效型SLAM架构的多源TTS配置。
介绍了一个用于评估班巴拉语儿童阅读的开源ASR系统,包括现场数据收集、基准构建、模型适配和课堂验证,实现了显著的词错误率降低。
本文介绍了一个包含噪声文本(ASR、拼写错误)的孟加拉语事件检测基准,并评估了仅编码器和仅解码器的大语言模型,发现解码器模型对噪声的鲁棒性更强。
Riazi-8B是一个针对数学推理微调的乌尔都语大语言模型,通过在乌尔都语思维链数据上持续预训练和监督微调,在MGSM-Urdu上实现了性能提升。
本文介绍了首个公开的多模态数据集,包含100个土耳其诈骗和良性电话通话,评估了七种大语言模型在原始音频、ASR转录和人工纠正转录下的表现。结果表明,基于转录的输入优于直接音频,凸显了在低资源语言中进行包容性AI安全研究的必要性。
本文提出了一种面向低资源阿尔及利亚方言社交媒体内容的端到端混合谣言检测框架,通过结合Transformer嵌入和经典分类器,达到了0.84的F1分数。
UrduMMLU是一个新基准测试,包含来自本土教育材料的26,431道多项选择题,涵盖26个学科,用于评估大语言模型在乌尔都语理解上的表现。对30个大语言模型的评估显示,Gemini-3.5-Flash表现最佳,而开源模型和区域特定学科仍构成重大挑战。
本文评估了四种用于高棉语农业文档检索增强生成(RAG)的文本分块策略,发现基于字符的递归分块(300字符)在检索和相关性方面表现最佳。
本文提出使用基于语义奖励的强化学习(通过GRPO)来将LLM扩展到低资源语言,避免了典型的灾难性遗忘对齐代价,展示了相比监督微调更好的语义质量和迁移性。
研究者开发KokborokMT,一款面向低资源语言Kokborok的神经机器翻译系统,通过在36k句对平行语料上微调NLLB-200,在en→trp方向取得17.30 BLEU分,trp→en方向达38.56。
VLegal-Bench 是一个认知基础基准测试,用于评估大语言模型在越南法律推理任务中的表现,包含 10,450 个专家标注样本,旨在填补民法系统法律基准的空白。该基准通过问答、多步推理和场景问题解决来评估多个层次的法律理解,为在非英文、成文法律背景下评估大语言模型提供了一个可复现的框架。