标签
本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。
本文提出了一种基于理据引导的知识蒸馏框架,用于跨语言立场检测,利用大型语言模型的思维链提示,通过双路径蒸馏和对比学习训练一个紧凑的学生模型。
LatentMT将潜在推理循环语言模型应用于机器翻译,在计算量更低的情况下实现了与三到五倍规模模型相当的性能,并在中资源和低资源语言上达到了最先进结果。
FedCC 提出了一种联邦学习框架,结合冻结的 DINOv2 骨干网络、轻量级 YOLO 检测头和 LoRA 模块,用于胎儿超声图像中稳健的胼胝体定位,在多中心设置下以大幅降低的通信成本实现了强劲性能。
本文介绍了一个包含1,516条经专家验证的孟加拉语句子的基准数据集,用于消解文化纠缠的同形词(既是名字又是普通名词的词语)。研究表明,大语言模型存在主导意义偏见,并提出了对比思维链提示和蒸馏方法来减少这种偏见。
本文研究了医学语言模型中的跨语言临床正确性漂移,发现本地可部署模型在用豪萨语查询时相比英语表现出显著的安全退化,而前沿模型保持能力,突显了低资源环境中安全评估的关键差距。
本文介绍了BLAD,一个精心整理的多语种数据集,包含1484部孟加拉国法律法案(时间跨度从1799年到2025年),并附有结构化元数据,支持时间跨度和跨语言的法学NLP研究。
本文提出了两种混合持续学习方法——回放增强弹性权重巩固与约束引导知识蒸馏——用于调整预训练语音模型,以识别低资源澳大利亚土著语言,同时缓解灾难性遗忘。
本文提出了一种混合方法,用于检测英语和豪萨语中的在线极化现象。在英语中使用DeBERTa,在豪萨语及细粒度子任务中使用AfroXLMR-Social,并结合LoRA和数据增强以应对计算和数据限制。
本文研究了低资源自动语音识别(ASR)中跨语言迁移的问题,针对瓦尔皮里语提出了一种结合声学与语言特征的相似度框架,以选择最优源语言。实验表明,像阿萨姆语和印地语这样声学相似的语言能显著降低词错误率和字符错误率。
本文提出一个句子级手语翻译系统,在How2Sign子集上用QLoRA微调,BLEU达到15.9。主要贡献是一个硬件感知的流式处理流水线,使用Raspberry Pi 4B客户端和CPU/GPU后端,平均延迟降低27.71%。
本文提出了一种基于多条件扩散的合成流程,使用Stable Diffusion XL和ControlNet生成合成沙沸图像,用于低资源土石堤坝检查,解决标注缺陷样本稀缺的问题。
Colibri在拥有25GB RAM的笔记本电脑上运行744B参数的GLM-5.2 MoE模型,每个token仅激活约40B参数,并从磁盘流式传输专家,全部在一个2400行的C文件中完成,无需GPU。
本文介绍了尼日利亚机械使用与故障数据集,包含2006至2025年间尼日利亚制造业和油气领域的28个指标、89条记录,同时提出了一种从稀疏数值构建领域约束的链式推理示例的方法。
本研究探讨了从僧伽罗语到迪维希语的跨语言迁移学习在自动语音识别中的应用,与仅使用迪维希语的基线相比,词错误率显著降低。
本文提出 CoPiT,一种基于认知动机的枢轴翻译流水线,用于双文蒙古语。该流水线通过资源更丰富的西里尔蒙古文进行中转翻译,从而改善从低资源传统蒙古文到目标语言的翻译质量,取得了显著的 BLEU 和 COMET 提升,并发布了一个新的多文种平行数据集。
本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。
小型AI模型在不稳定网络地区正展现出重要价值,能够实现无需持续互联网连接的生命攸关应用,例如假药检测和作物疾病识别。
PAST-TIDE是StanceNakba共享任务的一个立场检测系统,采用完形填空式掩码语言建模的语句调优、原型对比学习和话题条件层归一化进行跨话题阿拉伯语立场检测,在子任务A和B上分别达到了0.75和0.74的宏F1分数。
一位18岁的突尼斯学生介绍了一个开源机器翻译管道和平行语料库,用于以阿拉伯字母转写书写的突尼斯达里加语,该管道从零开始构建,使用了小型1560万参数的Transformer,诚实基线BLEU为3.89,并呼吁贡献者以道德方式扩展语料库。