low-resource-languages

标签

Cards List
#low-resource-languages

使用Whisper进行波斯语语音情感识别中的ASR适应与表示降维研究

arXiv cs.CL · 4天前 缓存

本文研究了使用Whisper进行波斯语语音情感识别,表明基于PCA的降维方法提升了性能和效率,而ASR微调仅带来有限的改进。

0 人收藏 0 人点赞
#low-resource-languages

@MSFTResearch:Paza:为低资源和多语言语言构建稳健语音技术的指南,从数据收集…

X AI KOLs Following · 4天前 缓存

微软研究院推出了Paza语音手册,这是一份交互式指南,用于为低资源和多语言语言构建稳健的语音技术,涵盖数据收集、模型训练、部署和评估。配套视频介绍了该手册,并演示了如何应用经过验证的实践。

0 人收藏 0 人点赞
#low-resource-languages

面向低资源语言的大语言模型:塔吉克语电子详解词典的概念框架

arXiv cs.CL · 5天前 缓存

本文提出了一个使用大语言模型构建塔吉克语电子详解词典的概念框架,该框架整合了词法分析、词形还原、语义聚类和词典条目生成,并采用PEFT策略。

0 人收藏 0 人点赞
#low-resource-languages

通过LLM提示实现古典拉丁语命名实体识别的迁移学习

arXiv cs.CL · 5天前 缓存

本文介绍了uOttawa团队在EvaLatin 2026古典拉丁语命名实体识别共享任务中使用的系统,通过商业LLM(Gemini 2.5 Pro和Claude Sonnet 4-5)的提示工程,在粗粒度和细粒度NER子任务中均获得第一名。

0 人收藏 0 人点赞
#low-resource-languages

形式对齐而非语义对齐:低资源孟加拉语贬损言语中LLM安全性的理解-遏制解耦

arXiv cs.CL · 6天前 缓存

这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。

0 人收藏 0 人点赞
#low-resource-languages

引导语言模型更具同理心:通过人类与LLM协作生成文化敏感的心理健康建议

arXiv cs.CL · 2026-07-28 缓存

本文提出了RP-RCAF提示策略,用于在低资源语言中生成文化敏感的心理健康建议,并介绍了G-REFS评估框架,实验表明在多个LLM上均优于传统提示方法。

0 人收藏 0 人点赞
#low-resource-languages

MEUSLI:一个面向基于LLM的ASR及其他任务的多语言投影器

arXiv cs.CL · 2026-07-27 缓存

MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。

0 人收藏 0 人点赞
#low-resource-languages

从多语言流式ASR骨干网络到肯尼亚语系系统:面向基库尤语、多洛语和卡伦津语的Nemotron 3.5数据驱动适配

arXiv cs.CL · 2026-07-22 缓存

本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。

0 人收藏 0 人点赞
#low-resource-languages

翻译作为计算高效的桥梁:英语BERT用于低资源语言的可行性

arXiv cs.CL · 2026-07-15 缓存

本文探讨了基于翻译的微调作为低资源语言本地语言BERT模型的资源高效替代方案的可行性,发现在六项NLP任务中,53.3%的情况下其性能相当或更优。

0 人收藏 0 人点赞
#low-resource-languages

评估低资源语言中的健康错误信息:将小型语言模型与具有文化敏感性的负责任自然语言处理框架相结合(以孟加拉语为例)

arXiv cs.CL · 2026-07-15 缓存

本文提出了一种具有文化敏感性的负责任自然语言处理框架,用于检测孟加拉语等低资源语言中的健康错误信息,并评估了诸如Phi-4等小型语言模型在声明提取中的表现。

0 人收藏 0 人点赞
#low-resource-languages

选择性左移:将测试时计算与基于难度的筛选转化为低资源代码生成的训练数据

arXiv cs.LG · 2026-07-10 缓存

本文提出了一种三阶段流水线,将语法习得与算法推理解耦,以改进面向低资源编程语言(如Julia和Ballerina)的小型语言模型,在减少数据和成本的情况下实现了pass@1的显著提升。

0 人收藏 0 人点赞
#low-resource-languages

PluraMath:将数学推理评估扩展到高资源语言之外

arXiv cs.CL · 2026-07-08 缓存

PluraMath 将 PolyMath 数据集扩展到 18 种未被充分代表的语言,提供了一个经过人工验证的基准,用于评估 LLM 中的多语言数学推理。该论文揭示了在 27 个模型中,高资源和低资源语言之间持续存在的性能差距。

0 人收藏 0 人点赞
#low-resource-languages

从文化遗产保护视角重新思考Indic AI

arXiv cs.AI · 2026-07-08 缓存

本文综述了印度语言自然语言处理(NLP)的挑战与演变,强调文化遗产,并提出一个名为“文化感知”的新研究方向,以解决代表性差距并确保AI输出具有文化意义。

0 人收藏 0 人点赞
#low-resource-languages

教LLM低资源语言:提升Pharo中的代码补全

Hugging Face Daily Papers · 2026-07-06 缓存

本文介绍了一个端到端的管道,用于将LLM适配到低资源编程语言,以Pharo为案例研究,通过适合实时IDE支持的小型模型实现了卓越的代码补全。

0 人收藏 0 人点赞
#low-resource-languages

从单语到多语:评估Mamba在南非语言中的ASR性能

arXiv cs.CL · 2026-07-03 缓存

本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。

0 人收藏 0 人点赞
#low-resource-languages

现实世界中的LLM:评估紧急情况下的“AI”

arXiv cs.AI · 2026-07-02 缓存

本文探讨了基于LLM的机器翻译系统在文本到911紧急服务中的部署情况,指出了常见的误解,并为利益相关者提供了建议,以确保人工智能在关键场景中的安全有效使用。

0 人收藏 0 人点赞
#low-resource-languages

LV-ROVER: 多流Tesseract投票用于马耳他语段落OCR

arXiv cs.CL · 2026-07-02 缓存

本文介绍了LV-ROVER,一个用于马耳他语OCR的多流Tesseract集成系统,通过合成数据训练和后处理,字符错误率降低了70%,解决了马耳他语低资源OCR的挑战。

0 人收藏 0 人点赞
#low-resource-languages

ALEE: 通过以英语为中心的极小对进行嵌入的任意语言评估

arXiv cs.CL · 2026-07-02 缓存

介绍ALEE,一个使用抽象意义表示生成具有受控语义偏移的英语极小对的框架,并将其翻译用于评估275+种语言的文本嵌入,揭示了跨语言语义表示中持续存在的差距。

0 人收藏 0 人点赞
#low-resource-languages

SEATauBench: 将工具-智能体-用户评估适配到低资源东南亚语言

arXiv cs.CL · 2026-06-30 缓存

介绍了SEATauBench,这是首个面向东南亚语言的智能体评估框架,将τ²-Bench适配到中文、越南语、泰语、印尼语和菲律宾语,并揭示了从英语迁移到本地化设置时存在显著的能力差距。

0 人收藏 0 人点赞
#low-resource-languages

NagaTranslate: 为低资源的那加兰克里奥尔语构建翻译与语音流水线 (Whisper, VITS, LLMs) [P]

Reddit r/MachineLearning · 2026-06-28

介绍了 NagaTranslate,一个使用 Whisper、VITS 和 LLMs 针对低资源的那加兰克里奥尔语的翻译和语音合成流水线。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈