low-resource

标签

Cards List
#low-resource

构建与评估基于合成语音的固定语音泰语TTS系统

arXiv cs.CL · 2天前 缓存

本文提出了一种方法,使用更大模型的合成语音构建紧凑的固定语音泰语TTS系统,评估其性能,并介绍了一个用于设备端部署的82M参数模型。

0 人收藏 0 人点赞
#low-resource

SpeakPay:面向低资源尼泊尔语金融语音识别的领域自适应LoRA微调Whisper

arXiv cs.CL · 3天前 缓存

本文介绍了SpeakPay和一个尼泊尔语金融语音数据集,表明对Whisper进行LoRA微调可以将词错误率降低67.2%,并提高低资源语言的交易成功率。

0 人收藏 0 人点赞
#low-resource

基于全局上下文的多任务图预训练任务特定提示

arXiv cs.LG · 4天前 缓存

论文介绍了TPGC,一种用于多任务图预训练的双先验提示初始化方法,该方法结合任务和结构先验以提高对齐性和可迁移性,在小样本场景中实现了优越的性能。

0 人收藏 0 人点赞
#low-resource

面向汉语语言的跨语言罗马字生态系统:普通话与粤语配对案例研究

arXiv cs.CL · 5天前 缓存

本文提出了一种针对汉语语言的跨语言罗马字生态系统,为普通话和粤语开发了具体方案,并在语音到罗马字任务中显示出比基线方法更优的性能。

0 人收藏 0 人点赞
#low-resource

基于零数据自举的对话推荐系统实证研究

Hugging Face Daily Papers · 2026-08-28 缓存

本文实证研究了使用非对话信号生成的合成数据自举对话推荐系统,证明了在低资源环境下,其性能优于零样本和稀缺真实数据方法。

0 人收藏 0 人点赞
#low-resource

L'etzCross: 一个针对卢森堡语文档的多模态检索跨语言页面级基准

arXiv cs.CL · 2026-08-25 缓存

LëtzCross 是一个用于卢森堡语PDF文档跨语言页面级检索的基准,比较了在低资源设置下纯文本和多模态检索器。

0 人收藏 0 人点赞
#low-resource

用于米佐语自动语音识别的语音语料库:Whisper 和 SraVaani 1.0 的形态感知评估微调

arXiv cs.CL · 2026-08-21 缓存

本研究通过微调Whisper和SraVaani 1.0模型,开发了一个用于米佐语(一种低资源语言)的自动语音识别系统,其中Whisper-large-v3实现了7.22%的形态感知词错误率。

0 人收藏 0 人点赞
#low-resource

TranslatePsy-AfriSLM:面向低资源机器翻译的高质量数据扩展

arXiv cs.CL · 2026-08-20 缓存

本文介绍了TranslatePsy-AfriSLM,这是一个针对19种撒哈拉以南非洲语言的开源机器翻译资源集合,表明通过过滤合成数据微调的小型语言模型在性能上超越了如TranslateGemma-27B和Qwen3.5-122B-A10B等更大规模的模型。

0 人收藏 0 人点赞
#low-resource

HybridRAG-BN:一种用于孟加拉语KBQA的检索增强框架与微调验证

arXiv cs.CL · 2026-08-14 缓存

本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。

0 人收藏 0 人点赞
#low-resource

孟加拉地区方言的多方言神经机器翻译系统

arXiv cs.CL · 2026-08-13 缓存

本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。

0 人收藏 0 人点赞
#low-resource

当知识库成为金标准:衡量实体级机器翻译中资源共享的评估循环

arXiv cs.CL · 2026-08-13 缓存

本文衡量了在低资源历史领域中,当知识库被用作实体级机器翻译的金标准时所产生的自指性评估循环,表明知识库注入带来的提升仅限于重叠片段,并不能反映真实的翻译质量。

0 人收藏 0 人点赞
#low-resource

先有种子,后有目标:重新思考低资源Garhwali语音识别的评估

arXiv cs.CL · 2026-08-12 缓存

本文认为,低资源自动语音识别中的单次运行评估不可靠,并通过一个新的多种子Garhwali语音识别基准证明,许多已报告的提升在种子级测试下消失,而使用w2v-BERT 2.0的标准CTC仍然是最稳健的方法。

0 人收藏 0 人点赞
#low-resource

北非缺失的框架:阿尔及利亚的NLP驱动精神医疗及其对低资源环境的启示

arXiv cs.CL · 2026-08-11 缓存

本文提出了一个概念框架,利用NLP应对阿尔及利亚及其他低资源、多语言环境中的精神医疗障碍,并提出了研究与政策路线图。

0 人收藏 0 人点赞
#low-resource

DialectS2S:面向低资源中文方言的端到端语音对话建模

arXiv cs.CL · 2026-08-11 缓存

DialectS2S是一个面向低资源中文方言的端到端语音对话模型,引入了可扩展的数据合成流程和一种带有自对齐语音监督的两阶段后训练策略。实验表明,在方言一致性、响应质量和可懂度方面均有提升,并且模型、数据和代码全部开源。

0 人收藏 0 人点赞
#low-resource

评估针对达罗毗荼语的专用单语模型与联合多语言因果模型

arXiv cs.CL · 2026-08-11 缓存

本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。

0 人收藏 0 人点赞
#low-resource

MameLoshnLM:意第绪语语言模型与评估基准

arXiv cs.CL · 2026-08-07 缓存

本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。

0 人收藏 0 人点赞
#low-resource

基于资源感知的语音编码器混合体打破多对多语音到文本翻译中的多语言诅咒

arXiv cs.CL · 2026-08-06 缓存

本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。

0 人收藏 0 人点赞
#low-resource

HomoEnsNER:语言对齐在古吉拉特语命名实体识别中是否优于架构复杂性?

arXiv cs.CL · 2026-08-05 缓存

本文提出了HomoEnsNER,一个由五个GujaratiBERT模型组成的同质集成,用于古吉拉特语命名实体识别,并表明它优于依赖架构多样性的异构替代方案,在Naamapadam测试集上取得了最先进的F1分数。

0 人收藏 0 人点赞
#low-resource

低资源东南亚语言中的原生多语言思维链推理

arXiv cs.CL · 2026-08-04 缓存

介绍了OSCD,一种后训练算法,用于改进低资源东南亚语言中的原生多语言思维链推理,在数学基准上实现了高达3.2倍的提升。

0 人收藏 0 人点赞
#low-resource

突厥语族语言机器翻译的跨语言迁移

arXiv cs.CL · 2026-08-03 缓存

本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈