标签
本研究探讨了从僧伽罗语到迪维希语的跨语言迁移学习在自动语音识别中的应用,与仅使用迪维希语的基线相比,词错误率显著降低。
本文提出 CoPiT,一种基于认知动机的枢轴翻译流水线,用于双文蒙古语。该流水线通过资源更丰富的西里尔蒙古文进行中转翻译,从而改善从低资源传统蒙古文到目标语言的翻译质量,取得了显著的 BLEU 和 COMET 提升,并发布了一个新的多文种平行数据集。
本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。
小型AI模型在不稳定网络地区正展现出重要价值,能够实现无需持续互联网连接的生命攸关应用,例如假药检测和作物疾病识别。
PAST-TIDE是StanceNakba共享任务的一个立场检测系统,采用完形填空式掩码语言建模的语句调优、原型对比学习和话题条件层归一化进行跨话题阿拉伯语立场检测,在子任务A和B上分别达到了0.75和0.74的宏F1分数。
一位18岁的突尼斯学生介绍了一个开源机器翻译管道和平行语料库,用于以阿拉伯字母转写书写的突尼斯达里加语,该管道从零开始构建,使用了小型1560万参数的Transformer,诚实基线BLEU为3.89,并呼吁贡献者以道德方式扩展语料库。
本文分析了LLM-as-a-Judge在多语言和低资源场景下的应用,发现评估结果不一致且过度信任LLM判断,并提出了改进实践的建议。
SPARCLE是一种说话者感知的字素表示模型,使用对比学习将字素嵌入与声学表示对齐,从而提升文本到语音的质量,尤其在低资源场景下。
本文通过翻译SemEval-2010 Task 8基准数据集,并在零样本、少样本和QLoRA微调条件下评估Gemma 4,与更小的编码器基线进行比较,研究针对罗马尼亚语的跨语言关系抽取。
本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。
本文介绍了 sinhala-ocr-lk-acts-1010,这是首个公开可用的真实场景页面级僧伽罗语OCR数据集,并使用QLoRA对三种视觉语言模型(DeepSeek-OCR V1、DeepSeek-OCR V2、LightOnOCR-2-1B)进行了微调。LightOnOCR-2-1B实现了1.05%的字符错误率(CER),优于开源和商业OCR模型,并在不同时期的退化文档中保持了稳定的性能。
本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。
本文提出DysLexLens,一种低资源LLM框架,利用在线论坛数据分析阅读障碍学习者使用AI工具的体验,具有词典驱动过滤、知识图谱推理和评估指标等功能。
本文研究了VoxCPM2 TTS模型的LoRA微调,以改善低资源语言(如高棉语)的质量,同时显示对于基础模型已处理良好的韩语没有提升。该适配器在极少的参数训练下,显著提高了高棉语的MOS评分。
本文提出了NEST-V1,一个用于从语音输入生成情感条件尼泊尔手语虚拟形象的概念验证多模态框架,在包含50名说话者600个音频样本的数据集上实现了81.1%的ASR准确率和79.21%的情感识别准确率。
本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。
介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。
本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。
本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。
本文介绍了用于分类真实B2B对话的Call Playbook数据集,并提出将示例提炼为紧凑、可解释的任务指令的方法,相比传统上下文学习实现了99%的Token压缩和高达7%的AUC提升。