标签
本文提出了一种半监督联邦ASR的实用方案,采用在线伪标签和服务器更新稳定化,在域内和跨域设置中均展示了相对于先前方法的显著改进。
Bairong系统提出了一种用于多语言对话语音问答的动态问题感知证据路由方法,在MLC-SLM 2026挑战赛中通过有效整合转录和音频证据实现了性能提升。
文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。
R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。
文章探讨了语音智能体中ASR对稳定性的需求胜过速度,讨论了集成等待/确认机制以增强可靠性的'Confucius r2t2'模型。
该论文提出了T-SANDHI,一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,它通过显式解耦声调变化来在Whisper骨干网络基础上提高准确性。
网易有道开源了Confucius4-R2T2,这是一款用于语音代理的流式ASR模型,它逐步处理语音并仅输出已提交的文本,以防止状态损坏。
Nari Labs 推出 Qwen3-TTS 和 Qwen3-ASR 模型,在免费公开测试中提供高准确率、低延迟和成本效益,同时提供优化的 API 和服务用于生产部署。
本文介绍了ASCIL,一个后ASR框架,它根据用户反馈和上下文信号进行调整,以纠正AI助手中的误唤醒激活,在低延迟下实现了显著的错误减少。
该论文报告了对Quran诵读抄本的人工标注,以区分错误、重复和修复,并由评估器对标签和位置进行评分,初步评估编码代理显示高性能。
英文干净朗读已商品化,但2026年ASR面临叠音识别、流式落字、方言术语处理等挑战,以及如何优化语音塔以避免拖垮Speech LLM。
Orukeet 是基于 NVIDIA Parakeet 构建的 25 种语言语音识别器,采用拟合的 Gabor 核替代编码器滤波器,在大多数基准测试中性能超越基础模型。
本文介绍了首个针对希腊歌曲自动歌词转录的基准,表明通过多任务学习和两阶段训练适配Whisper,达到了27.2%的词错误率,显著优于零样本基线。
Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。
本文介绍了DasanCallDial,一个针对对话级ASR错误校正的大规模韩语基准数据集,并提出了DCSC框架,在纯文本后编辑中达到了最先进的性能。
本文提出Dual-Form ASR框架,通过配对监督和序列级目标,整合了口语形式自动语音识别与语义感知的书面形式逆文本规范化,从而提升中文语音识别任务的性能。
微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。
本文对来自呼叫中心的真实世界ASR转录本上的主题匹配方法进行基准测试,发现使用自然语言描述的轻量级LLM匹配器优于正则表达式和嵌入方法。
VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。
Meta推出Muse Voice Transcribe,这是一款实时音频感知模型,在流式ASR和说话人分离方面表现出色,支持多语言,并在公开基准测试中领先。