标签
本文对来自呼叫中心的真实世界ASR转录本上的主题匹配方法进行基准测试,发现使用自然语言描述的轻量级LLM匹配器优于正则表达式和嵌入方法。
VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。
Meta推出Muse Voice Transcribe,这是一款实时音频感知模型,在流式ASR和说话人分离方面表现出色,支持多语言,并在公开基准测试中领先。
本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。
这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。
介绍本地声音克隆工具VoiceStudio,只需8秒录音即可高度还原声音,完全本地运行保护隐私,支持多种语言和平台。
audio.cpp 版本 0.7 引入了一个新的 Arena UI,用于本地比较音频模型,扩展至 62 个模型家族,拥有超过 85 个变体,并支持在边缘硬件如 NVIDIA Jetson Orin 上部署。
FireRedAudio 和 FireRedTTS3 是统一音频理解与生成的AI模型,提供ASR、TTS、语音克隆、编辑和多语言支持,并具有竞争力的基准测试结果。
superwhisper/s1-mini 是一个从Qwen3-0.6B微调而来的0.6B参数文本规范化模型,用于清理语音转文本记录,通过去除填充词、纠正错误并应用标点和格式,在英语数据上达到94.8%的准确率。
本文介绍了Easper,一个开源、无代码的ASR流水线,让田野语言学家可以直接从ELAN标注中对Whisper等模型进行微调,并评估了在瓦努阿图低资源语言上引导ASR的数据选择策略。
本文认为,低资源自动语音识别中的单次运行评估不可靠,并通过一个新的多种子Garhwali语音识别基准证明,许多已报告的提升在种子级测试下消失,而使用w2v-BERT 2.0的标准CTC仍然是最稳健的方法。
提出了一种用于儿童语音音素识别的年龄感知多任务学习方法,使轻量级94M参数模型能够超越更大的模型,并在手机等边缘设备上运行。
parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。
本文比较了上下文偏置方法和语音大语言模型在自动语音识别中识别罕见词和新词的表现,报告了在朗读语音和非朗读语音中词错误率的权衡。
一位开发者询问人们在生产环境的语音智能体中使用哪些 STT API,比较了 Deepgram、AssemblyAI 和 Smallest AI Pulse,并指出了常见的故障点,如端点检测、延迟和打断。
OpenAI 和微软在 Microsoft Foundry 中发布了 GPT-transcribe 和 GPT-live-transcribe,分别针对录播音频和实时语音提供高精度异步转录和低延迟流式转录,具备背景噪音处理、口音鲁棒性和字母数字感知等功能。
Audio8的开源ARK-ASR-3B以4.76的平均WER在Hugging Face Open ASR排行榜上夺得第一,同时其0.6B模型也进入前五,展示了一个有竞争力的开源语音技术栈。
Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。
本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练,在英语和意大利语任务上进行了评估,在降低通信成本的同时取得了具有竞争力的词错误率。