标签
parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。
本文比较了上下文偏置方法和语音大语言模型在自动语音识别中识别罕见词和新词的表现,报告了在朗读语音和非朗读语音中词错误率的权衡。
一位开发者询问人们在生产环境的语音智能体中使用哪些 STT API,比较了 Deepgram、AssemblyAI 和 Smallest AI Pulse,并指出了常见的故障点,如端点检测、延迟和打断。
OpenAI 和微软在 Microsoft Foundry 中发布了 GPT-transcribe 和 GPT-live-transcribe,分别针对录播音频和实时语音提供高精度异步转录和低延迟流式转录,具备背景噪音处理、口音鲁棒性和字母数字感知等功能。
Audio8的开源ARK-ASR-3B以4.76的平均WER在Hugging Face Open ASR排行榜上夺得第一,同时其0.6B模型也进入前五,展示了一个有竞争力的开源语音技术栈。
Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。
本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练,在英语和意大利语任务上进行了评估,在降低通信成本的同时取得了具有竞争力的词错误率。
Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。
MoLGE在混合专家框架中为相似语言簇分配专用专家模块,用于大规模多语言ASR,在参数增加极小的情况下提升495种语言的性能。
Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。
MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。
WeNet 是一个开源端到端语音识别工具包,它将训练代码、预训练模型和部署运行时统一在一个项目中,支持多种模型架构和运行时后端。
本文比较了最先进的ASR系统与人类听者在识别多样化荷兰语语音方面的表现,发现ASR系统在某些情况下与人类表现相当甚至更优,其中Google Telephony表现最佳。文章强调了说话者年龄、地方口音及测试集选择对基准测试结论的影响。
本文针对ASR模型中转录风格这一未被控制的潜在变量,提出了一种方法,利用覆盖感知的解码器任务令牌实现可调控的逐字转录,并具备准确的词级时间信息,通过零样本跨语言迁移达到了较高的不流畅检测F1值。
微软研究院宣布扩大了其 ASR 模型的覆盖范围,新增了 22 种语言,覆盖 38 个非洲国家,并提供了新的数据集和测试样本。
微软研究院宣布PazaBench的第二个版本发布,这是一个用于评估跨非洲语言自动语音识别模型的基准测试。
详细介绍了一种在微控制器上直接运行拥有13M参数的ASR Conformer模型的方法,突出了边缘AI部署的进步。
MOSS-TD是一个说话人感知的ASR系统,在SGLang-Omni服务栈中进行了优化,能够在单张H100上以约49秒转录38分钟的多说话人音频,并支持16个会议的并发处理。
MOSS-Transcribe-Diarize 是一款具备多说话人分离和热词偏置功能的开源ASR模型,发布后在Hugging Face上走红。
NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,支持从单一检查点进行多种语言转录,并内置标点和大小写功能。