low-resource-nlp

标签

Cards List
#low-resource-nlp

极端资源稀缺下的西夏文分词:整合传统词典与无标注文本

arXiv cs.CL · 昨天 缓存

本文首次系统研究了已灭绝的西夏语的分词问题,结合传统词典、无标注文本和预训练字符编码器,尽管资源极端稀缺,仍实现了高性能。

0 人收藏 0 人点赞
#low-resource-nlp

TRACE-BN: 将孟加拉语-英语辅导行为迁移到低于10亿参数的离线语言模型

arXiv cs.CL · 3天前 缓存

TRACE-BN 介绍了一个课程引导的数据集,用于结构化的孟加拉语-英语辅导,并展示了如何使用 LoRA 将此行为迁移到低于10亿参数的语言模型中,在资源受限的离线环境中显著提高了辅导质量。

0 人收藏 0 人点赞
#low-resource-nlp

越南北部高地、三角洲及海岸的回响:面向占语、高棉语和岱侬语的多语种语料库

arXiv cs.CL · 2026-07-10 缓存

介绍了首个面向占语、高棉语和岱侬语的多语种语料库及基准 CKTN,通过一种文字感知的适配方案来解决多语种编码器中的碎片化问题。

0 人收藏 0 人点赞
#low-resource-nlp

开放但不兼容:低资源非洲语言语料库的许可证兼容性分析

arXiv cs.CL · 2026-06-30 缓存

本文审计了二十多个非洲自然语言处理语料库家族的许可证来源,识别了兼容性故障,如JW300违规和隐藏的NoDerivs条款,并提供了合法清洁数据集创建的尽职调查清单。

0 人收藏 0 人点赞
#low-resource-nlp

非洲语言NLI评估的样本量缩放

arXiv cs.CL · 2026-06-03 缓存

本文利用AfriXNLI基准测试,研究标注数据大小对16种非洲语言自然语言推理性能的影响。结果表明,缩放行为对语言敏感且通常非单调,挑战了常见的单调改进假设,并强调了需要为特定语言创建数据集以及更强的多语言策略。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈