language-identification

标签

Cards List
#language-identification

Loanword or Switch? The Annotation Boundary, Not the Model, Drives Kazakh-Russian Code-Switching Identification

arXiv cs.CL · 2026-08-04 缓存

This paper argues that the loanword-vs-switch annotation boundary, rather than the choice of model, drives Kazakh-Russian code-switching identification. The authors present a document-level gold LID dataset with an explicit annotation rule and show that naive heuristics and off-the-shelf LID tools fail to distinguish integrated borrowings from genuine code-switches.

0 人收藏 0 人点赞
#language-identification

基于简洁机器无关轨迹的语言识别

arXiv cs.CL · 2026-07-15 缓存

本文探讨了Gold-Angluin极限语言识别模型中的开放问题,展示了仅使用小字母表且直接从语言定义的计算轨迹即可实现极限识别,无需底层机器模型。

0 人收藏 0 人点赞
#language-identification

面向低资源澳大利亚土著语言识别的混合持续学习方法

arXiv cs.CL · 2026-07-15 缓存

本文提出了两种混合持续学习方法——回放增强弹性权重巩固与约束引导知识蒸馏——用于调整预训练语音模型,以识别低资源澳大利亚土著语言,同时缓解灾难性遗忘。

0 人收藏 0 人点赞
#language-identification

利用双语微调与语言识别改进低资源ASR:一项跨语言评估

arXiv cs.CL · 2026-06-17 缓存

本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。

0 人收藏 0 人点赞
#language-identification

加速研究人员和开发者使用新开放数据集构建多语言AI(7分钟阅读)

TLDR AI · 2026-06-16 缓存

GitHub宣布推出GitHub多语言仓库数据集,这是一个开放的元数据集,涵盖4000万个仓库中的超过8000万条分类记录,旨在帮助研究人员和开发者构建多语言AI工具。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈