标签
Audio8 ASR Infinite 是一款原生流式语音识别模型,具有可选音频时钟和可配置转录延迟,支持无限长度音频转录且无漂移。
NetEase Youdao AI 正在开源 Confucius4-R2T2,一个1.7B的前沿实时流式ASR模型,专为语音代理设计,具有低延迟、高准确度和可配置解码块的特点。
This paper introduces X2-Turn, a frame-synchronous dual-head model that jointly performs streaming ASR and turn state prediction on shared representations, improving turn-taking accuracy and latency in spoken dialogue systems.
本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。
本文研究了数据规模与延迟对流式ASR跨语言迁移的影响,发现多语言初始化的优势受限于数据量而非延迟,且随着目标语言数据的增加而减弱。
提出一种用于流式ASR标点恢复的非自回归评分方法,该方法保留输入转录,并在有限前瞻预算下优于基于提示和微调的基线。
一种基于路由的实时多语言ASR方法,使用较小的单语模型并配备回滚机制来处理语言切换,在跨语句代码切换上实现了约13%的词错误率,并将系统开源。