从多语言流式ASR骨干网络到肯尼亚语系系统:面向基库尤语、多洛语和卡伦津语的Nemotron 3.5数据驱动适配

arXiv cs.CL 论文

摘要

本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。

arXiv:2607.18912v1 公告类型:新 摘要:非洲语言的自动语音识别(ASR)受到正字法不一致、标注伪影、音频缺失、说话人和领域不平衡以及评估流程与部署脱节等因素的限制。我们提出了一项端到端的工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语。从肯尼亚斯瓦希里语适配的检查点开始,在全参数微调过程中保留了其缓存感知的FastConformer RNN-T、提示条件化机制和流式解码器。研究涵盖语料库审计、Unicode规范化、分割检查、时长过滤、低速率继续训练、基于验证的检查点选择、真实流式评估、伪影保留以及独立服务。 在内部自适应咨询的评估集上(上下文[56,13]中排除梯度更新),选定的基库尤语和多洛语模型分别达到了42.97%和33.98%的WER。多洛语在其冻结的历史标签策略下记录到9.59%的字符错误率(CER)和8.13%的无空格CER;基库尤语记录到7.79%的无空格CER。卡伦津语仍在进行中:在排除长停顿标注、包含数字的参考和少于三个标记的目标的2,411行clean-v3诊断子集上,v1-v达到68.74%的WER。其检查点选择使用了包含测试源行的混合源验证清单,因此该分数不是独立的泛化估计。我们还报告了涉及非语音标签、短语句过度生成、边界敏感的WER以及云端作业生命周期失败的负面发现。我们不声称达到最先进水平,因为内部数据集、反复咨询和规范化与公共基准不同。这项工作提供了一个可审计的记录,展示了如何在不断流式约束的情况下将多语言流式模型适配为特定语言系统。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:24

# 从多语言流式语音识别骨干到肯尼亚语言系统:基于数据自适应的Nemotron 3.5在基库尤语、多洛语和卡伦金语上的适配 来源:https://arxiv.org/html/2607.18912 (2026年7月) ###### 摘要 非洲语言的自动语音识别(ASR)受到正交一致性不足、标注伪影、音频缺失、说话人与领域不平衡以及评估流程与部署场景不一致等问题的困扰。本文呈现了一项端到端的工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B模型适配到基库尤语、多洛语和卡伦金语。我们从一个已适配肯尼亚斯瓦希里语的检查点开始,在进行全参数微调的同时,保留了其缓存感知的FastConformer RNN-T、提示条件化和流式解码器。研究涵盖了语料库审计、Unicode规范化、分割检查、时长过滤、低速率延续训练、基于验证的检查点选择、真实流式评估、伪影保留以及隔离服务。在内部、自适应的咨询评估集上(排除在上下文[56,13]内的梯度更新),选定的基库尤语和多洛语模型分别达到了42.97%和33.98%的词错误率(WER)。多洛语在其冻结的历史标签策略下记录了9.59%的字错误率(CER)和8.13%的无空格字错误率;基库尤语记录了7.79%的无空格字错误率。卡伦金语仍在进行中:v1-v版本在一个2,411行的clean-v3诊断子集上达到68.74%的WER,该子集排除了标注标记、含数字的参考文本以及长度少于三个词元的目标文本。其检查点选择使用了包含测试源行的混合源验证清单,因此该分数并非独立的泛化估计。我们还报告了关于非语音标签、短话语过度生成、边界敏感WER以及云作业生命周期故障的负面发现。由于内部数据集、反复咨询和规范化处理与公共基准不同,我们不宣称达到最先进水平。这项工作提供了一个可审计的记载,说明如何在不放弃流式约束的情况下,将多语言流式模型适配为特定语言的系统。 关键词:自动语音识别;低资源语言;非洲语言;基库尤语;多洛语;卡伦金语;流式ASR;RNN-Transducer;FastConformer;PyTorch;NeMo;数据整理 状态与解读。基库尤语和多洛语是已完成工程案例研究,保留了优选的检查点并进行了实时流式部署。卡伦金语作为一个进行中的案例研究被包含在内,因为其失败和连续的语料库修订具有科学信息价值。本报告中的所有数值结果均为内部项目评估,除非明确提到了公共基准。独立测试集从未用于梯度更新,但重复的里程碑检查影响了研究决策;因此,它们不得被呈现为一次性的、纯净的外部基准。 ###### 目录 1. 1引言 (https://arxiv.org/html/2607.18912#S1)  
   1. 1.1研究问题 (https://arxiv.org/html/2607.18912#S1.SS1)  
   2. 1.2贡献 (https://arxiv.org/html/2607.18912#S1.SS2)  
   3. 1.3本文不主张的内容 (https://arxiv.org/html/2607.18912#S1.SS3)  
2. 2相关工作 (https://arxiv.org/html/2607.18912#S2)  
   1. 2.1端到端与流式ASR (https://arxiv.org/html/2607.18912#S2.SS1)  
   2. 2.2多语言与非洲ASR (https://arxiv.org/html/2607.18912#S2.SS2)  
   3. 2.3子词建模、数据增强与提示条件化 (https://arxiv.org/html/2607.18912#S2.SS3)  
3. 3系统架构 (https://arxiv.org/html/2607.18912#S3)  
   1. 3.1基础模型 (https://arxiv.org/html/2607.18912#S3.SS1)  
   2. 3.2缓存感知注意力上下文 (https://arxiv.org/html/2607.18912#S3.SS2)  
   3. 3.3RNN-T目标函数 (https://arxiv.org/html/2607.18912#S3.SS3)  
4. 4为什么选择肯尼亚斯瓦希里语作为桥梁? (https://arxiv.org/html/2607.18912#S4)  
5. 5数据来源、治理与分割语义 (https://arxiv.org/html/2607.18912#S5)  
   1. 5.1源语料库 (https://arxiv.org/html/2607.18912#S5.SS1)  
   2. 5.2使用权限与社区治理 (https://arxiv.org/html/2607.18912#S5.SS2)  
   3. 5.3分割完整性 (https://arxiv.org/html/2607.18912#S5.SS3)  
6. 6数据准备与特定语言整理 (https://arxiv.org/html/2607.18912#S6)  
   1. 6.1通用准备流程 (https://arxiv.org/html/2607.18912#S6.SS1)  
   2. 6.2多洛语准备说明 (https://arxiv.org/html/2607.18912#S6.SS2)  
   3. 6.3基库尤语正字法及Unicode决策 (https://arxiv.org/html/2607.18912#S6.SS3)  
   4. 6.4卡伦金语:从clean-v1到clean-v3 (https://arxiv.org/html/2607.18912#S6.SS4)  
   5. 6.5为什么有时删除优于修复 (https://arxiv.org/html/2607.18912#S6.SS5)  
7. 7实现与实验基础设施 (https://arxiv.org/html/2607.18912#S7)  
   1. 7.1软件栈 (https://arxiv.org/html/2607.18912#S7.SS1)  
   2. 7.2持久数据布局 (https://arxiv.org/html/2607.18912#S7.SS2)  
   3. 7.3为什么使用打包音频 (https://arxiv.org/html/2607.18912#S7.SS3)  
   4. 7.4计算选择 (https://arxiv.org/html/2607.18912#S7.SS4)  
   5. 7.5运行调度与生命周期 (https://arxiv.org/html/2607.18912#S7.SS5)  
8. 8微调协议 (https://arxiv.org/html/2607.18912#S8)  
   1. 8.1全参数适配 (https://arxiv.org/html/2607.18912#S8.SS1)  
   2. 8.2核心与阶段特定超参数 (https://arxiv.org/html/2607.18912#S8.SS2)  
   3. 8.3分阶段延续训练 (https://arxiv.org/html/2607.18912#S8.SS3)  
   4. 8.4检查点选择与导出 (https://arxiv.org/html/2607.18912#S8.SS4)  
9. 9评估协议 (https://arxiv.org/html/2607.18912#S9)  
   1. 9.1指标 (https://arxiv.org/html/2607.18912#S9.SS1)  
   2. 9.2真实流式评估 (https://arxiv.org/html/2607.18912#S9.SS2)  
   3. 9.3延迟与运行时解读 (https://arxiv.org/html/2607.18912#S9.SS3)  
   4. 9.4独立测试集状态与重复使用 (https://arxiv.org/html/2607.18912#S9.SS4)  
   5. 9.5与外部榜单的可比性 (https://arxiv.org/html/2607.18912#S9.SS5)  
10. 10实验结果 (https://arxiv.org/html/2607.18912#S10)  
    1. 10.1基库尤语学习轨迹 (https://arxiv.org/html/2607.18912#S10.SS1)  
       1. 10.1.1流式上下文消融 (https://arxiv.org/html/2607.18912#S10.SS1.SSS1)  
    2. 10.2多洛语学习轨迹 (https://arxiv.org/html/2607.18912#S10.SS2)  
    3. 10.3卡伦金语工作进展 (https://arxiv.org/html/2607.18912#S10.SS3)  
    4. 10.4跨语言快照 (https://arxiv.org/html/2607.18912#S10.SS4)  
11. 11错误分析 (https://arxiv.org/html/2607.18912#S11)  
    1. 11.1为什么聚合WER不足 (https://arxiv.org/html/2607.18912#S11.SS1)  
    2. 11.2基库尤语与多洛语的边界敏感性 (https://arxiv.org/html/2607.18912#S11.SS2)  
    3. 11.3卡伦金语分层发现 (https://arxiv.org/html/2607.18912#S11.SS3)  
    4. 11.4短话语过度生成 (https://arxiv.org/html/2607.18912#S11.SS4)  
    5. 11.5语码转换与借用词 (https://arxiv.org/html/2607.18912#S11.SS5)  
    6. 11.6代表性定性模式 (https://arxiv.org/html/2607.18912#S11.SS6)  
    7. 11.7错误分析优先级 (https://arxiv.org/html/2607.18912#S11.SS7)  
12. 12原型流式部署与模型工件升级 (https://arxiv.org/html/2607.18912#S12)  
    1. 12.1真实流式后端 (https://arxiv.org/html/2607.18912#S12.SS1)  
    2. 12.2语言隔离 (https://arxiv.org/html/2607.18912#S12.SS2)  
    3. 12.3认证与API保护 (https://arxiv.org/html/2607.18912#S12.SS3)  
    4. 12.4检查点机密性 (https://arxiv.org/html/2607.18912#S12.SS4)  
    5. 12.5模型工件升级 (https://arxiv.org/html/2607.18912#S12.SS5)  
13. 13可复现性与模型工件溯源 (https://arxiv.org/html/2607.18912#S13)  
    1. 13.1保存内容 (https://arxiv.org/html/2607.18912#S13.SS1)  
    2. 13.2可复现性级别 (https://arxiv.org/html/2607.18912#S13.SS2)  
    3. 13.3实验记录 (https://arxiv.org/html/2607.18912#S13.SS3)  
14. 14负责任开发 (https://arxiv.org/html/2607.18912#S14)  
    1. 14.1社区与语言专业知识 (https://arxiv.org/html/2607.18912#S14.SS1)  
    2. 14.2隐私与同意 (https://arxiv.org/html/2607.18912#S14.SS2)  
    3. 14.3不平等错误成本 (https://arxiv.org/html/2607.18912#S14.SS3)  
    4. 14.4语言变体与代表性 (https://arxiv.org/html/2607.18912#S14.SS4)  
15. 15局限性 (https://arxiv.org/html/2607.18912#S15)  
16. 16讨论 (https://arxiv.org/html/2607.18912#S16)  
    1. 16.1改进的驱动因素 (https://arxiv.org/html/2607.18912#S16.SS1)  
    2. 16.2为什么流式基础模型很重要 (https://arxiv.org/html/2607.18912#S16.SS2)  
    3. 16.3数据质量与数据数量 (https://arxiv.org/html/2607.18912#S16.SS3)  
    4. 16.4对其他低资源语言的启示 (https://arxiv.org/html/2607.18912#S16.SS4)  
17. 17未来工作 (https://arxiv.org/html/2607.18912#S17)  
18. 18结论 (https://arxiv.org/html/2607.18912#S18)  
19. A语料库构建与规范化规范 (https://arxiv.org/html/2607.18912#A1)  
    1. A.1清单契约 (https://arxiv.org/html/2607.18912#A1.SS1)  
    2. A.2通用音频流程 (https://arxiv.org/html/2607.18912#A1.SS2)  
    3. A.3通用文本操作 (https://arxiv.org/html/2607.18912#A1.SS3)  
    4. A.4基库尤语正字法策略 (https://arxiv.org/html/2607.18912#A1.SS4)  
    5. A.5多洛语文本策略 (https://arxiv.org/html/2607.18912#A1.SS5)  
    6. A.6卡伦金语清洗代际 (https://arxiv.org/html/2607.18912#A1.SS6)  
    7. A.7为什么不广泛移除有效的困难样本 (https://arxiv.org/html/2607.18912#A1.SS7)  
20. B详细语料库记录 (https://arxiv.org/html/2607.18912#A2)  
    1. B.1多洛语全语料库准备 (https://arxiv.org/html/2607.18912#A2.SS1)  
    2. B.2卡伦金语clean-v1记录 (https://arxiv.org/html/2607.18912#A2.SS2)  
    3. B.3卡伦金语clean-v3衍生记录 (https://arxiv.org/html/2607.18912#A2.SS3)  
    4. B.4基库尤语整理语料库摘要 (https://arxiv.org/html/2607.18912#A2.SS4)  
21. C模型配置记录 (https://arxiv.org/html/2607.18912#A3)  
    1. C.1恢复的基础配置 (https://arxiv.org/html/2607.18912#A3.SS1)  
    2. C.2记录的微调配置 (https://arxiv.org/html/2607.18912#A3.SS2)  
    3. C.3训练目标 (https://arxiv.org/html/2607.18912#A3.SS3)  
22. D完整实验注册表 (https://arxiv.org/html/2607.18912#A4)  
    1. D.1基库尤语延续系列 (https://arxiv.org/html/2607.18912#A4.SS1)  
    2. D.2多洛语全数据系列 (https://arxiv.org/html/2607.18912#A4.SS2)  
    3. D.3卡伦金语研究系列 (https://arxiv.org/html/2607.18912#A4.SS3)  
    4. D.4解读延续阶段 (https://arxiv.org/html/2607.18912#A4.SS4)  
23. E检查点选择、升级与保存 (https://arxiv.org/html/2607.18912#A5)  
    1. E.1选择规则 (https://arxiv.org/html/2607.18912#A5.SS1)  
    2. E.2为什么.a.nemoArchive是部署单元 (https://arxiv.org/html/2607.18912#A5.SS2)  
    3. E.3目标优选检查点证据契约 (https://arxiv.org/html/2607.18912#A5.SS3)  
    4. E.4完整性验证 (https://arxiv.org/html/2607.18912#A5.SS4)  
24. F可复现性配方 (https://arxiv.org/html/2607.18912#A6)  
    1. F.1环境与秘密边界 (https://arxiv.org/html/2607.18912#A6.SS1)  
    2. F.2推荐的预检查不变式 (https://arxiv.org/html/2607.18912#A6.SS2)  
    3. F.3分离的延续训练 (https://arxiv.org/html/2607.18912#A6.SS3)  
    4. F.4前台等待的真实流式评估 (https://arxiv.org/html/2607.18912#A6.SS4)  
25. G真实流式评估协议 (https://arxiv.org/html/2607.18912#A7)  
    1. G.1为什么离线转录不能替代 (https://arxiv.org/html/2607.18912#A7.SS1)  
    2. G.2评估器程序 (https://arxiv.org/html/2607.18912#A7.SS2)  
    3. G.3指标定义 (https://arxiv.org/html/2607.18912#A7.SS3)  
    4. G.4延迟与吞吐量 (https://arxiv.org/html/2607.18912#A7.SS4)  
    5. G.5提议的统一评估报告契约 (https://arxiv.org/html/2607.18912#A7.SS5)  
26. H错误分析协议 (https://arxiv.org/html/2607.18912#A8)  
    1. H.1分类 (https://arxiv.org/html/2607.18912#A8.SS1)  
    2. H.2编辑分解与分层 (https://arxiv.org/html/2607.18912#A8.SS2)  
    3. H.3定向母语者咨询与提议的审查协议 (https://arxiv.org/html/2607.18912#A8.SS3)  
    4. H.4短话语过度生成研究 (https://arxiv.org/html/2607.18912#A8.SS4)  
27. I运维故障与恢复记录 (https://arxiv.org/html/2607.18912#A9)  
28. J部署架构与安全边界 (https://arxiv.org/html/2607.18912#A10)  
    1. J.1隔离的语言服务 (https://arxiv.org/html/2607.18912#A10.SS1)  
    2. J.2认证的保护范围与不足 (https://arxiv.org/html/2607.18912#A10.SS2)  
    3. J.3模型窃取风险 (https://arxiv.org/html/2607.18912#A10.SS3)  
29. K模型工件溯源与保存 (https://arxiv.org/html/2607.18912#A11)  
    1. K.1模型工件清单 (https://arxiv.org/html/2607.18912#A11.SS1)  
    2. K.2保存层级 (https://arxiv.org/html/2607.18912#A11.SS2)  
30. L负责任开发、数据治理与发布 (https://arxiv.org/html/2607.18912#A12)  
31. M扩展局限性与有效性威胁 (https://arxiv.org/html/2607.18912#A13)  
    1. M.1内部有效性 (https://arxiv.org/html/2607.18912#A13.SS1)  
    2. M.2建构有效性 (https://arxiv.org/html/2607.18912#A13.SS2)  
    3. M.3外部有效性 (https://arxiv.org/html/2607.18912#A13.SS3)  
    4. M.4比较有效性 (https://arxiv.org/html/2607.18912#A13.SS4)  
32. N提议的确认性评估协议 (https://arxiv.org/html/2607.18912#A14)  
33. 参考文献 (https://arxiv.org/html/2607.18912#bib) ## 1引言 语音界面越来越多地用于搜索信息、听写文本、操作设备、访问公共服务以及调解人机交互。然而,这些界面对于其语言在商业和学术训练语料库中代表性不足的社区来说,仍然最不可靠。"低资源"一词通常被理解为单一短缺——音频太少——但实际操作揭示了更广泛的问题。一种语言可能有数百小时的录音,但仍然难以建模,因为转录文本编码了不一致的拼写、非语音事件作为词汇标记出现、音频对象缺失、时长尾部导致批处理不稳定、领域标签不完整,或者公共分割并不像其名称所暗示的那样独立。本文通过开发C-elo ASR(一个面向肯尼亚语言的流式ASR系统家族)来研究这个更广泛的问题。已完成的系统针对基库尤语(Gikuyu)和多洛语(Luo);第三个针对卡伦金语的系统正在积极开发中。所有三个系统均从Nemotron 3.5 ASR Streaming 0.6B出发,使用基于PyTorch的NVIDIA NeMo工具进行适配。我们并未用离线编码器-解码器替换流式识别器,而是从训练到部署都保留了缓存感知推理。因此,研究问题不仅仅是一个大型多语言模型能否转录另一种语言,而是该模型能否在真实数据和基础设施约束下,作为真正的流式系统进行适配、评估、保存和服务。 这项工作的动机来自四个观察。首先,一个在地理和操作上相关的中继检查点可能在全局基础模型和肯尼亚目标语言之间提供实用的初始化,即使桥梁语言和目标语言不属于同一个语言亚群。本研究并未分离其相对于直接从原始NVIDIA基础模型进行适配的优势。其次,数据质量决策就是模型决策:替换、保留或删除一个不确定的字符序列会改变后续每个训练阶段所看到的监督信号。第三,仅靠离线WER不足以用于流式产品,因为离线评估器可以隐藏状态重置错误、未来上下文泄漏、不稳定的部分假设以及延迟成本。第四,长时间的微调运行产生的收益递减;如果没有一个严格的实验记录,就难以判断改进的来源。

相似文章

nvidia/nemotron-3.5-asr-streaming-0.6b

Hugging Face Models Trending

NVIDIA 发布 Nemotron 3.5 ASR,这是一个6亿参数的多语言流式语音识别模型,支持40种语言区域,采用缓存感知的FastConformer-RNNT架构实现低延迟转录。该模型支持可配置的块大小,并已在OpenMDW-1.1许可证下准备商业化使用。

@kwindla: https://x.com/kwindla/status/2062544580105359686

X AI KOLs Timeline

NVIDIA 发布了 Nemotron 3.5 ASR,这是一款开源的多语言语音转文字模型,在测试中延迟最低,提供多语言和纯英文两个版本,非常适合语音助手和自托管部署场景。