标签
本文提出了一种方法,使用更大模型的合成语音构建紧凑的固定语音泰语TTS系统,评估其性能,并介绍了一个用于设备端部署的82M参数模型。
本文介绍了SpeakPay和一个尼泊尔语金融语音数据集,表明对Whisper进行LoRA微调可以将词错误率降低67.2%,并提高低资源语言的交易成功率。
论文介绍了TPGC,一种用于多任务图预训练的双先验提示初始化方法,该方法结合任务和结构先验以提高对齐性和可迁移性,在小样本场景中实现了优越的性能。
本文提出了一种针对汉语语言的跨语言罗马字生态系统,为普通话和粤语开发了具体方案,并在语音到罗马字任务中显示出比基线方法更优的性能。
本文实证研究了使用非对话信号生成的合成数据自举对话推荐系统,证明了在低资源环境下,其性能优于零样本和稀缺真实数据方法。
LëtzCross 是一个用于卢森堡语PDF文档跨语言页面级检索的基准,比较了在低资源设置下纯文本和多模态检索器。
本研究通过微调Whisper和SraVaani 1.0模型,开发了一个用于米佐语(一种低资源语言)的自动语音识别系统,其中Whisper-large-v3实现了7.22%的形态感知词错误率。
本文介绍了TranslatePsy-AfriSLM,这是一个针对19种撒哈拉以南非洲语言的开源机器翻译资源集合,表明通过过滤合成数据微调的小型语言模型在性能上超越了如TranslateGemma-27B和Qwen3.5-122B-A10B等更大规模的模型。
本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。
本文提出了一个统一的用于12种孟加拉地区方言的多方言神经机器翻译系统,引入了迄今最大的多方言平行语料库,并通过使用DoRA微调的BanglaT5模型取得了最先进的BLEU分数。
本文衡量了在低资源历史领域中,当知识库被用作实体级机器翻译的金标准时所产生的自指性评估循环,表明知识库注入带来的提升仅限于重叠片段,并不能反映真实的翻译质量。
本文认为,低资源自动语音识别中的单次运行评估不可靠,并通过一个新的多种子Garhwali语音识别基准证明,许多已报告的提升在种子级测试下消失,而使用w2v-BERT 2.0的标准CTC仍然是最稳健的方法。
本文提出了一个概念框架,利用NLP应对阿尔及利亚及其他低资源、多语言环境中的精神医疗障碍,并提出了研究与政策路线图。
DialectS2S是一个面向低资源中文方言的端到端语音对话模型,引入了可扩展的数据合成流程和一种带有自对齐语音监督的两阶段后训练策略。实验表明,在方言一致性、响应质量和可懂度方面均有提升,并且模型、数据和代码全部开源。
本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。
本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。
本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。
本文提出了HomoEnsNER,一个由五个GujaratiBERT模型组成的同质集成,用于古吉拉特语命名实体识别,并表明它优于依赖架构多样性的异构替代方案,在Naamapadam测试集上取得了最先进的F1分数。
介绍了OSCD,一种后训练算法,用于改进低资源东南亚语言中的原生多语言思维链推理,在数学基准上实现了高达3.2倍的提升。
本文利用mT5和成对迁移矩阵,研究了五种突厥语族语言之间的机器翻译跨语言迁移,发现迁移在紧密相关的语言对之间最强,并且在文字不匹配的设置中,拉丁化有所帮助。