标签
本文分析了LLM-as-a-Judge在多语言和低资源场景下的应用,发现评估结果不一致且过度信任LLM判断,并提出了改进实践的建议。
SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。
本文通过翻译SemEval-2010 Task 8基准数据集,并在零样本、少样本和QLoRA微调条件下评估Gemma 4,与更小的编码器基线进行比较,研究针对罗马尼亚语的跨语言关系抽取。
本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。
本文介绍了 sinhala-ocr-lk-acts-1010,这是首个公开可用的真实场景页面级僧伽罗语OCR数据集,并使用QLoRA对三种视觉语言模型(DeepSeek-OCR V1、DeepSeek-OCR V2、LightOnOCR-2-1B)进行了微调。LightOnOCR-2-1B实现了1.05%的字符错误率(CER),优于开源和商业OCR模型,并在不同时期的退化文档中保持了稳定的性能。
本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。
本文提出DysLexLens,一种低资源LLM框架,利用在线论坛数据分析阅读障碍学习者使用AI工具的体验,具有词典驱动过滤、知识图谱推理和评估指标等功能。
本文研究了VoxCPM2 TTS模型的LoRA微调,以改善低资源语言(如高棉语)的质量,同时显示对于基础模型已处理良好的韩语没有提升。该适配器在极少的参数训练下,显著提高了高棉语的MOS评分。
本文提出了NEST-V1,一个用于从语音输入生成情感条件尼泊尔手语虚拟形象的概念验证多模态框架,在包含50名说话者600个音频样本的数据集上实现了81.1%的ASR准确率和79.21%的情感识别准确率。
本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。
介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。
本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。
本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。
本文介绍了用于分类真实B2B对话的Call Playbook数据集,并提出将示例提炼为紧凑、可解释的任务指令的方法,相比传统上下文学习实现了99%的Token压缩和高达7%的AUC提升。
AmchiBias 引入了首个用于衡量果阿身份群体中社会文化刻板偏见的基准,覆盖英语和孔卡尼语中跨八个社会人口维度的313对最小配对。对多语言编码模型的评估显示,在孔卡尼语上的表现接近随机,且对果阿文化的能力有限。
ArogyaBodha数据集和ArogyaSutra框架通过多样化数据集成和actor-critic多智能体推理,增强了低资源环境下的多语言医学推理能力。
本文提出SDBN,一种将对抗训练与参数高效微调相结合的框架,旨在提升基础模型在噪声和有限数据下的鲁棒性,并在低资源场景中展现出显著改进。
本文介绍了Lius,这是一个使用持续指令调优(CIT)和四种指令族的印尼语到库邦马来语翻译模型。最佳变体Lius-Large-MT在低资源翻译任务上优于基线模型。
本文提出一种KAN增强的BiGRU架构,用于对孟加拉国的多语言法律文档进行分类和摘要生成,取得了适中的准确率和ROUGE分数,并证明KAN模块相比基线BiGRU提升了分类准确率。
本文提出了embeddingmagibu-200m,一个专注于土耳其语的句子嵌入模型,通过跨语言分词器手术和离线蒸馏构建,在土耳其语基准测试中取得了强劲性能,同时实现了成本与质量的平衡。