low-resource

标签

Cards List
#low-resource

翻译作为数据增强:翻译数据对难度评估的影响

arXiv cs.CL · 9小时前 缓存

本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。

0 人收藏 0 人点赞
#low-resource

基于理据引导的知识蒸馏跨语言立场检测

arXiv cs.CL · 9小时前 缓存

本文提出了一种基于理据引导的知识蒸馏框架,用于跨语言立场检测,利用大型语言模型的思维链提示,通过双路径蒸馏和对比学习训练一个紧凑的学生模型。

0 人收藏 0 人点赞
#low-resource

LatentMT: 基于潜在推理的机器翻译

arXiv cs.CL · 9小时前 缓存

LatentMT将潜在推理循环语言模型应用于机器翻译,在计算量更低的情况下实现了与三到五倍规模模型相当的性能,并在中资源和低资源语言上达到了最先进结果。

0 人收藏 0 人点赞
#low-resource

FedCC:一种低资源联邦适应基础模型方法,用于胎儿超声图像中稳健的胼胝体定位

arXiv cs.LG · 9小时前 缓存

FedCC 提出了一种联邦学习框架,结合冻结的 DINOv2 骨干网络、轻量级 YOLO 检测头和 LoRA 模块,用于胎儿超声图像中稳健的胼胝体定位,在多中心设置下以大幅降低的通信成本实现了强劲性能。

0 人收藏 0 人点赞
#low-resource

当名字不是名字:低资源大语言模型中文化纠缠的孟加拉语同形词的基准数据集与蒸馏推理

arXiv cs.CL · 昨天 缓存

本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。

0 人收藏 0 人点赞
#low-resource

无法迁移的安全性:可部署医学语言模型中的跨语言临床正确性漂移

arXiv cs.CL · 昨天 缓存

本文研究了医学语言模型中的跨语言临床正确性漂移,发现本地可部署模型在用豪萨语查询时相比英语表现出显著的安全退化,而前沿模型保持能力,突显了低资源环境中安全评估的关键差距。

0 人收藏 0 人点赞
#low-resource

BLAD:孟加拉国法律法案的历史语境化多语种数据集(1799-2025)

arXiv cs.CL · 昨天 缓存

本文介绍了BLAD,一个精心整理的多语种数据集,包含1484部孟加拉国法律法案(时间跨度从1799年到2025年),并附有结构化元数据,支持时间跨度和跨语言的法学NLP研究。

0 人收藏 0 人点赞
#low-resource

面向低资源澳大利亚土著语言识别的混合持续学习方法

arXiv cs.CL · 2026-07-15 缓存

本文提出了两种混合持续学习方法——回放增强弹性权重巩固与约束引导知识蒸馏——用于调整预训练语音模型,以识别低资源澳大利亚土著语言,同时缓解灾难性遗忘。

0 人收藏 0 人点赞
#low-resource

极化检测:结合AfroXLMR-Social与DeBERTa的低资源与高资源环境混合方法

arXiv cs.CL · 2026-07-14 缓存

本文提出了一种混合方法,用于检测英语和豪萨语中的在线极化现象。在英语中使用DeBERTa,在豪萨语及细粒度子任务中使用AfroXLMR-Social,并结合LoRA和数据增强以应对计算和数据限制。

0 人收藏 0 人点赞
#low-resource

哪些语言最适合迁移到瓦尔皮里语?一项基于相似度的低资源语音识别研究

arXiv cs.CL · 2026-07-14 缓存

本文研究了低资源自动语音识别(ASR)中跨语言迁移的问题,针对瓦尔皮里语提出了一种结合声学与语言特征的相似度框架,以选择最优源语言。实验表明,像阿萨姆语和印地语这样声学相似的语言能显著降低词错误率和字符错误率。

0 人收藏 0 人点赞
#low-resource

迈向实时句子级手语翻译

arXiv cs.CL · 2026-07-13 缓存

本文提出一个句子级手语翻译系统,在How2Sign子集上用QLoRA微调,BLEU达到15.9。主要贡献是一个硬件感知的流式处理流水线,使用Raspberry Pi 4B客户端和CPU/GPU后端,平均延迟降低27.71%。

0 人收藏 0 人点赞
#low-resource

面向低资源土石堤坝检查的多条件扩散合成沙沸图像

arXiv cs.AI · 2026-07-13 缓存

本文提出了一种基于多条件扩散的合成流程,使用Stable Diffusion XL和ControlNet生成合成沙沸图像,用于低资源土石堤坝检查,解决标注缺陷样本稀缺的问题。

0 人收藏 0 人点赞
#low-resource

@GPTWare:呃呃呃这什么鬼???

X AI KOLs Timeline · 2026-07-11 缓存

Colibri在拥有25GB RAM的笔记本电脑上运行744B参数的GLM-5.2 MoE模型,每个token仅激活约40B参数,并从磁盘流式传输专家,全部在一个2400行的C文件中完成,无需GPU。

0 人收藏 0 人点赞
#low-resource

尼日利亚机械:一个带有领域推理层的低资源工业数据集

arXiv cs.AI · 2026-07-10 缓存

本文介绍了尼日利亚机械使用与故障数据集,包含2006至2025年间尼日利亚制造业和油气领域的28个指标、89条记录,同时提出了一种从稀疏数值构建领域约束的链式推理示例的方法。

0 人收藏 0 人点赞
#low-resource

从僧伽罗语到迪维希语:低资源语音识别的跨语言迁移学习

arXiv cs.CL · 2026-07-08 缓存

本研究探讨了从僧伽罗语到迪维希语的跨语言迁移学习在自动语音识别中的应用,与仅使用迪维希语的基线相比,词错误率显著降低。

0 人收藏 0 人点赞
#low-resource

CoPiT:面向传统蒙古文双文低资源语言的认知枢轴翻译

arXiv cs.CL · 2026-07-08 缓存

本文提出 CoPiT,一种基于认知动机的枢轴翻译流水线,用于双文蒙古语。该流水线通过资源更丰富的西里尔蒙古文进行中转翻译,从而改善从低资源传统蒙古文到目标语言的翻译质量,取得了显著的 BLEU 和 COMET 提升,并发布了一个新的多文种平行数据集。

0 人收藏 0 人点赞
#low-resource

利用多模态特征融合联合改进印度语言中的方言识别与语音识别

arXiv cs.CL · 2026-07-07 缓存

本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。

0 人收藏 0 人点赞
#low-resource

小型AI模型在不稳定网络地区获得关注

Hacker News Top · 2026-07-06 缓存

小型AI模型在不稳定网络地区正展现出重要价值,能够实现无需持续互联网连接的生命攸关应用,例如假药检测和作物疾病识别。

0 人收藏 0 人点赞
#low-resource

PAST-TIDE: 基于原型锚定的语句调优与话题不变归一化用于立场检测

Hugging Face Daily Papers · 2026-07-06 缓存

PAST-TIDE是StanceNakba共享任务的一个立场检测系统,采用完形填空式掩码语言建模的语句调优、原型对比学习和话题条件层归一化进行跨话题阿拉伯语立场检测,在子任务A和B上分别达到了0.75和0.74的宏F1分数。

0 人收藏 0 人点赞
#low-resource

我构建了一个从零开始的开源机器翻译管道和平行语料库,用于突尼斯达里加语(阿拉伯字母转写)的早期基线,并正在将其发展为一个精心策划的社区语料库 [P]

Reddit r/MachineLearning · 2026-07-05

一位18岁的突尼斯学生介绍了一个开源机器翻译管道和平行语料库,用于以阿拉伯字母转写书写的突尼斯达里加语,该管道从零开始构建,使用了小型1560万参数的Transformer,诚实基线BLEU为3.89,并呼吁贡献者以道德方式扩展语料库。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈