low-resource

标签

Cards List
#low-resource

LLMs-as-a-Judge在多语言环境和低资源语言中的挑战与建议

arXiv cs.CL · 2026-07-03 缓存

本文分析了LLM-as-a-Judge在多语言和低资源场景下的应用,发现评估结果不一致且过度信任LLM判断,并提出了改进实践的建议。

0 人收藏 0 人点赞
#low-resource

SPARCLE:基于对比语言嵌入的说话者感知对齐表示

arXiv cs.CL · 2026-07-03 缓存

SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。

0 人收藏 0 人点赞
#low-resource

使用大语言模型的跨语言关系抽取:零样本、少样本和微调在罗马尼亚语上的评估

arXiv cs.CL · 2026-07-01 缓存

本文通过翻译SemEval-2010 Task 8基准数据集,并在零样本、少样本和QLoRA微调条件下评估Gemma 4,与更小的编码器基线进行比较,研究针对罗马尼亚语的跨语言关系抽取。

0 人收藏 0 人点赞
#low-resource

基于音调条件的课程学习用于低资源班图语语音识别

arXiv cs.CL · 2026-07-01 缓存

本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。

0 人收藏 0 人点赞
#low-resource

跨时间僧伽罗语OCR:页面级自适应与历时分析

arXiv cs.CL · 2026-06-30 缓存

本文介绍了 sinhala-ocr-lk-acts-1010,这是首个公开可用的真实场景页面级僧伽罗语OCR数据集,并使用QLoRA对三种视觉语言模型(DeepSeek-OCR V1、DeepSeek-OCR V2、LightOnOCR-2-1B)进行了微调。LightOnOCR-2-1B实现了1.05%的字符错误率(CER),优于开源和商业OCR模型,并在不同时期的退化文档中保持了稳定的性能。

0 人收藏 0 人点赞
#low-resource

如何利用合成语音构建基于LLM的ASR系统?

arXiv cs.CL · 2026-06-30 缓存

本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。

0 人收藏 0 人点赞
#low-resource

DysLexLens:一种用于分析在线论坛中阅读障碍学习者见解的低资源LLM框架

arXiv cs.CL · 2026-06-29 缓存

本文提出DysLexLens,一种低资源LLM框架,利用在线论坛数据分析阅读障碍学习者使用AI工具的体验,具有词典驱动过滤、知识图谱推理和评估指标等功能。

0 人收藏 0 人点赞
#low-resource

缩小低资源文本转语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调

arXiv cs.CL · 2026-06-26 缓存

本文研究了VoxCPM2 TTS模型的LoRA微调,以改善低资源语言(如高棉语)的质量,同时显示对于基础模型已处理良好的韩语没有提升。该适配器在极少的参数训练下,显著提高了高棉语的MOS评分。

0 人收藏 0 人点赞
#low-resource

低资源多模态翻译:将尼泊尔口语词语转化为情感条件手语虚拟形象

arXiv cs.CL · 2026-06-26 缓存

本文提出了NEST-V1,一个用于从语音输入生成情感条件尼泊尔手语虚拟形象的概念验证多模态框架,在包含50名说话者600个音频样本的数据集上实现了81.1%的ASR准确率和79.21%的情感识别准确率。

0 人收藏 0 人点赞
#low-resource

Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统

arXiv cs.CL · 2026-06-25 缓存

本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。

0 人收藏 0 人点赞
#low-resource

低资源Tangkhul-英语神经机器翻译

arXiv cs.CL · 2026-06-25 缓存

介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。

0 人收藏 0 人点赞
#low-resource

基于迁移学习与数据增强的低资源汉语方言辨识

arXiv cs.CL · 2026-06-18 缓存

本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。

0 人收藏 0 人点赞
#low-resource

利用双语微调与语言识别改进低资源ASR:一项跨语言评估

arXiv cs.CL · 2026-06-17 缓存

本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。

0 人收藏 0 人点赞
#low-resource

将示例提炼为任务指令:面向真实B2B对话的增强型上下文学习

arXiv cs.CL · 2026-06-16 缓存

本文介绍了用于分类真实B2B对话的Call Playbook数据集,并提出将示例提炼为紧凑、可解释的任务指令的方法,相比传统上下文学习实现了99%的Token压缩和高达7%的AUC提升。

0 人收藏 0 人点赞
#low-resource

AmchiBias:基于英语和孔卡尼语最小配对数据集测量果阿身份群体的刻板偏见

arXiv cs.CL · 2026-06-16 缓存

AmchiBias 引入了首个用于衡量果阿身份群体中社会文化刻板偏见的基准,覆盖英语和孔卡尼语中跨八个社会人口维度的313对最小配对。对多语言编码模型的评估显示,在孔卡尼语上的表现接近随机,且对果阿文化的能力有限。

0 人收藏 0 人点赞
#low-resource

ArogyaSutra:面向印度语言中多模态医学推理的多智能体框架

Hugging Face Daily Papers · 2026-06-11 缓存

ArogyaBodha数据集和ArogyaSutra框架通过多样化数据集成和actor-critic多智能体推理,增强了低资源环境下的多语言医学推理能力。

0 人收藏 0 人点赞
#low-resource

小数据,大噪声:面向鲁棒参数高效微调的对抗训练

arXiv cs.CL · 2026-06-10 缓存

本文提出SDBN,一种将对抗训练与参数高效微调相结合的框架,旨在提升基础模型在噪声和有限数据下的鲁棒性,并在低资源场景中展现出显著改进。

0 人收藏 0 人点赞
#low-resource

Lius:基于持续指令调优的库邦马来语教学语言学翻译模型

Hugging Face Daily Papers · 2026-06-10 缓存

本文介绍了Lius,这是一个使用持续指令调优(CIT)和四种指令族的印尼语到库邦马来语翻译模型。最佳变体Lius-Large-MT在低资源翻译任务上优于基线模型。

0 人收藏 0 人点赞
#low-resource

结合KAN模块增强BiGRU的法律文档分类与摘要生成

arXiv cs.CL · 2026-06-02 缓存

本文提出一种KAN增强的BiGRU架构,用于对孟加拉国的多语言法律文档进行分类和摘要生成,取得了适中的准确率和ROUGE分数,并证明KAN模块相比基线BiGRU提升了分类准确率。

0 人收藏 0 人点赞
#low-resource

通过跨语言分词器手术和离线蒸馏将多语言嵌入模型适配到土耳其语

Hugging Face Daily Papers · 2026-05-28 缓存

本文提出了embeddingmagibu-200m,一个专注于土耳其语的句子嵌入模型,通过跨语言分词器手术和离线蒸馏构建,在土耳其语基准测试中取得了强劲性能,同时实现了成本与质量的平衡。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈