标签
AraGenre 2026 是一个旨在改进低资源语言标注数据的层次化定义引导阿拉伯语体裁分类共享任务。结果表明,其在宽泛体裁识别方面表现强劲,但在细粒度分类上存在差距。
本文介绍了MudawanSn,一个用于沃洛夫语-阿拉伯语机器翻译的高质量平行语料库,并展示了在该语料库上进行微调可以显著提高两个语言方向的翻译质量。
NepKANUN 是一款基于RAG的面向尼泊尔的法律助手,利用RAG和微调后的LLaMA 3.2 3B模型为法律查询提供准确答案,并经专家评审验证。
本文提出了一种端到端的序列到序列方法,用于上下文泰米尔语拼写和语法纠正,使用在合成数据上渐进微调的mT5和mBART模型,在诊断集上实现了69.3%的精确匹配准确率。
本文研究了在低资源语言中进行推理的监督微调和强化学习,揭示了准确率基准存在噪声,而监督微调构建了特定语言的推理能力,强化学习修复了格式和泄漏问题。
本论文探讨了微调MoE模型使其用希腊语推理的过程,发现准确率指标存在噪声,而监督微调(SFT)和强化学习(RL)提升了特定语言的推理能力并修复了行为缺陷,并提出了评估工具。
BengaliMCQ是一个结构感知的RAG框架,利用图神经网络建模孟加拉语文本教材的层次化文档结构,实现学术多项选择题的自动化生成与答案预测,并在性能上优于基线方法。
介绍了BavGround,一个用于评估大语言模型在英语、德语和巴伐利亚语中的地区文化接地与方言能力的基准,发现模型在方言化和本地化的文化知识方面表现不佳。
提出了一种用于东干语的双方言有限状态形态分析器,并通过多体裁评估来衡量词形变化、歧义和词汇覆盖情况。
Mwando是一个虚拟教育助手,利用AI保存和教授科摩罗语shiKomori,采用多智能体架构,结合向量搜索、知识图谱和网络回退。
介绍了PatiGonit22K,这是一个扩展后的孟加拉语数学应用题数据集,包含22,441个问题,包括复杂的多步运算问题,旨在推动低资源语言数学推理研究的发展。
本文介绍了KyrgyzLLM-Bench,这是一个用于评估吉尔吉斯语大语言模型的基准测试套件,包含原生创作和翻译数据集,并对26个模型进行了系统评估。
提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。
本文介绍了BanglaMemeEvidence,这是一个包含2,917个孟加拉语模因的多模态数据集,这些模因经过注释用于解释性证据检测,并提出了BengaliMemeEvidenceNet,一个混合框架,实现了0.74的F1分数。
本文探讨了使用文本转语音(TTS)为低资源语言卢森堡语的语音问答生成合成训练数据,并评估了采用参数高效型SLAM架构的多源TTS配置。
介绍了一个用于评估班巴拉语儿童阅读的开源ASR系统,包括现场数据收集、基准构建、模型适配和课堂验证,实现了显著的词错误率降低。
本文介绍了一个包含噪声文本(ASR、拼写错误)的孟加拉语事件检测基准,并评估了仅编码器和仅解码器的大语言模型,发现解码器模型对噪声的鲁棒性更强。
Riazi-8B是一个针对数学推理微调的乌尔都语大语言模型,通过在乌尔都语思维链数据上持续预训练和监督微调,在MGSM-Urdu上实现了性能提升。
本文介绍了首个公开的多模态数据集,包含100个土耳其诈骗和良性电话通话,评估了七种大语言模型在原始音频、ASR转录和人工纠正转录下的表现。结果表明,基于转录的输入优于直接音频,凸显了在低资源语言中进行包容性AI安全研究的必要性。
本文提出了一种面向低资源阿尔及利亚方言社交媒体内容的端到端混合谣言检测框架,通过结合Transformer嵌入和经典分类器,达到了0.84的F1分数。