streaming-asr

标签

Cards List
#streaming-asr

Edge0/Audio8-ASR-Infinite

Hugging Face Models Trending ↗ · 2026-09-21 缓存

Audio8 ASR Infinite 是一款原生流式语音识别模型,具有可选音频时钟和可配置转录延迟,支持无限长度音频转录且无漂移。

0 人收藏 0 人点赞
#streaming-asr

@NetEaseYouDaoAI: 大多数流式ASR能快速给你文本。R2T2 给你可操作的文本。我们正在开源 Confucius4-R2T2,一个1.7B…

X AI KOLs Following ↗ · 2026-09-17 缓存

NetEase Youdao AI 正在开源 Confucius4-R2T2,一个1.7B的前沿实时流式ASR模型,专为语音代理设计,具有低延迟、高准确度和可配置解码块的特点。

0 人收藏 0 人点赞
#streaming-asr

X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction

arXiv cs.CL ↗ · 2026-08-12 缓存

This paper introduces X2-Turn, a frame-synchronous dual-head model that jointly performs streaming ASR and turn state prediction on shared representations, improving turn-taking accuracy and latency in spoken dialogue systems.

0 人收藏 0 人点赞
#streaming-asr

从多语言流式ASR骨干网络到肯尼亚语系系统:面向基库尤语、多洛语和卡伦津语的Nemotron 3.5数据驱动适配

arXiv cs.CL ↗ · 2026-07-22 缓存

本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。

0 人收藏 0 人点赞
#streaming-asr

在流式ASR中,数据规模而非延迟影响跨语言编码器迁移

arXiv cs.AI ↗ · 2026-06-24 缓存

本文研究了数据规模与延迟对流式ASR跨语言迁移的影响,发现多语言初始化的优势受限于数据量而非延迟,且随着目标语言数据的增加而减弱。

0 人收藏 0 人点赞
#streaming-asr

基于加权前瞻评分方法的流式ASR系统高效标点恢复

arXiv cs.CL ↗ · 2026-06-05 缓存

提出一种用于流式ASR标点恢复的非自回归评分方法,该方法保留输入转录,并在有限前瞻预算下优于基于提示和微调的基线。

0 人收藏 0 人点赞
#streaming-asr

使用滚动缓冲区和单语模型的实时多语言ASR [P]

Reddit r/MachineLearning ↗ · 2026-06-01

一种基于路由的实时多语言ASR方法,使用较小的单语模型并配备回滚机制来处理语言切换,在跨语句代码切换上实现了约13%的词错误率,并将系统开源。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈