low-resource-language

标签

Cards List
#low-resource-language

AraGenre 2026:一个层次化定义引导的阿拉伯语体裁分类共享任务

arXiv cs.CL ↗ · 2026-09-24 缓存

AraGenre 2026 是一个旨在改进低资源语言标注数据的层次化定义引导阿拉伯语体裁分类共享任务。结果表明,其在宽泛体裁识别方面表现强劲,但在细粒度分类上存在差距。

0 人收藏 0 人点赞
#low-resource-language

MudawanSn:用于机器翻译的沃洛夫语-阿拉伯语高质量平行语料库

arXiv cs.CL ↗ · 2026-09-17 缓存

本文介绍了MudawanSn,一个用于沃洛夫语-阿拉伯语机器翻译的高质量平行语料库,并展示了在该语料库上进行微调可以显著提高两个语言方向的翻译质量。

0 人收藏 0 人点赞
#low-resource-language

NepKANUN:基于RAG的尼泊尔法律助手

arXiv cs.CL ↗ · 2026-09-16 缓存

NepKANUN 是一款基于RAG的面向尼泊尔的法律助手,利用RAG和微调后的LLaMA 3.2 3B模型为法律查询提供准确答案,并经专家评审验证。

0 人收藏 0 人点赞
#low-resource-language

使用渐进微调序列到序列Transformer的上下文泰米尔语拼写和语法纠正

arXiv cs.CL ↗ · 2026-09-04 缓存

本文提出了一种端到端的序列到序列方法,用于上下文泰米尔语拼写和语法纠正,使用在合成数据上渐进微调的mT5和mBART模型,在诊断集上实现了69.3%的精确匹配准确率。

0 人收藏 0 人点赞
#low-resource-language

在低资源语言中思考:监督微调构建了什么,强化学习修复了什么,准确率无法看到什么

arXiv cs.CL ↗ · 2026-08-19 缓存

本文研究了在低资源语言中进行推理的监督微调和强化学习,揭示了准确率基准存在噪声,而监督微调构建了特定语言的推理能力,强化学习修复了格式和泄漏问题。

0 人收藏 0 人点赞
#low-resource-language

在低资源语言中的思考:SFT构建了什么,RL修复了什么,准确率看不见什么

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

本论文探讨了微调MoE模型使其用希腊语推理的过程,发现准确率指标存在噪声,而监督微调(SFT)和强化学习(RL)提升了特定语言的推理能力并修复了行为缺陷,并提出了评估工具。

0 人收藏 0 人点赞
#low-resource-language

BengaliMCQ:低资源语言中学术多项选择题的自动化生成与答案预测

arXiv cs.CL ↗ · 2026-08-18 缓存

BengaliMCQ是一个结构感知的RAG框架,利用图神经网络建模孟加拉语文本教材的层次化文档结构,实现学术多项选择题的自动化生成与答案预测,并在性能上优于基线方法。

0 人收藏 0 人点赞
#low-resource-language

BavGround:巴伐利亚地区文化接地与方言能力的基准

arXiv cs.CL ↗ · 2026-08-14 缓存

介绍了BavGround,一个用于评估大语言模型在英语、德语和巴伐利亚语中的地区文化接地与方言能力的基准,发现模型在方言化和本地化的文化知识方面表现不佳。

0 人收藏 0 人点赞
#low-resource-language

东干语的形态核心:双方言有限状态模型与多体裁评估

arXiv cs.CL ↗ · 2026-08-03 缓存

提出了一种用于东干语的双方言有限状态形态分析器,并通过多体裁评估来衡量词形变化、歧义和词汇覆盖情况。

0 人收藏 0 人点赞
#low-resource-language

Mwando:利用AI保存和教授shiKomori

arXiv cs.CL ↗ · 2026-07-28 缓存

Mwando是一个虚拟教育助手,利用AI保存和教授科摩罗语shiKomori,采用多智能体架构,结合向量搜索、知识图谱和网络回退。

0 人收藏 0 人点赞
#low-resource-language

PatiGonit22K:用于解决复杂孟加拉语数学应用题的综合数据集

arXiv cs.CL ↗ · 2026-07-28 缓存

介绍了PatiGonit22K,这是一个扩展后的孟加拉语数学应用题数据集,包含22,441个问题,包括复杂的多步运算问题,旨在推动低资源语言数学推理研究的发展。

0 人收藏 0 人点赞
#low-resource-language

KyrgyzLLM-Bench: 吉尔吉斯语言理解基准测试

arXiv cs.CL ↗ · 2026-07-21 缓存

本文介绍了KyrgyzLLM-Bench,这是一个用于评估吉尔吉斯语大语言模型的基准测试套件,包含原生创作和翻译数据集,并对26个模型进行了系统评估。

0 人收藏 0 人点赞
#low-resource-language

BaFCo:针对复杂孟加拉语表单理解的文档理解基准

arXiv cs.CL ↗ · 2026-07-08 缓存

提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。

0 人收藏 0 人点赞
#low-resource-language

BanglaMemeEvidence:用于孟加拉语模因的解释性证据检测的多模态基准数据集

arXiv cs.CL ↗ · 2026-07-07 缓存

本文介绍了BanglaMemeEvidence,这是一个包含2,917个孟加拉语模因的多模态数据集,这些模因经过注释用于解释性证据检测,并提出了BengaliMemeEvidenceNet,一个混合框架,实现了0.74的F1分数。

0 人收藏 0 人点赞
#low-resource-language

LuxSQA: 用卢森堡语问我——基于TTS增强的语音问答

arXiv cs.CL ↗ · 2026-07-07 缓存

本文探讨了使用文本转语音(TTS)为低资源语言卢森堡语的语音问答生成合成训练数据,并评估了采用参数高效型SLAM架构的多源TTS配置。

0 人收藏 0 人点赞
#low-resource-language

构建用于儿童阅读训练与评估的ASR解决方案

arXiv cs.CL ↗ · 2026-07-01 缓存

介绍了一个用于评估班巴拉语儿童阅读的开源ASR系统,包括现场数据收集、基准构建、模型适配和课堂验证,实现了显著的词错误率降低。

0 人收藏 0 人点赞
#low-resource-language

超越干净文本:在噪声文本中评估编码器和解码器对孟加拉语事件检测的鲁棒性

arXiv cs.CL ↗ · 2026-07-01 缓存

本文介绍了一个包含噪声文本(ASR、拼写错误)的孟加拉语事件检测基准,并评估了仅编码器和仅解码器的大语言模型,发现解码器模型对噪声的鲁棒性更强。

0 人收藏 0 人点赞
#low-resource-language

Riazi-8B:一个用于数学推理的乌尔都语大语言模型

arXiv cs.CL ↗ · 2026-06-25 缓存

Riazi-8B是一个针对数学推理微调的乌尔都语大语言模型,通过在乌尔都语思维链数据上持续预训练和监督微调,在MGSM-Urdu上实现了性能提升。

0 人收藏 0 人点赞
#low-resource-language

海报:探索基于音频检测土耳其电话诈骗的极限

arXiv cs.CL ↗ · 2026-06-24 缓存

本文介绍了首个公开的多模态数据集,包含100个土耳其诈骗和良性电话通话,评估了七种大语言模型在原始音频、ASR转录和人工纠正转录下的表现。结果表明,基于转录的输入优于直接音频,凸显了在低资源语言中进行包容性AI安全研究的必要性。

0 人收藏 0 人点赞
#low-resource-language

面向低资源阿尔及利亚方言的端到端混合谣言检测框架

arXiv cs.CL ↗ · 2026-06-12 缓存

本文提出了一种面向低资源阿尔及利亚方言社交媒体内容的端到端混合谣言检测框架,通过结合Transformer嵌入和经典分类器,达到了0.84的F1分数。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈