标签
Speechka是一款实时语音翻译工具,能够模仿用户的声音,支持44种语言,适用于macOS、Windows和浏览器。
文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。
论文通过使用Hirschberg算法和约束随机游走对Viterbi算法进行优化,将内存使用从140 GB减少到5 MB并提高速度,使得强制对齐能够在终端设备上运行,从而提升语音处理的可扩展性。
本文提出一个用于带口音对话式ASR的三阶段流水线,以提高实体和不流畅性的召回率,实现80-85%的实体召回率,并且用更少的参数优于基线系统。
R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。
文章探讨了语音智能体中ASR对稳定性的需求胜过速度,讨论了集成等待/确认机制以增强可靠性的'Confucius r2t2'模型。
TypeDash是一款桌面应用程序,允许用户通过语音命令控制计算机并听写文本,功能包括应用启动、网络搜索,以及可选的由ChatGPT驱动的语音识别清理功能。
该论文提出了T-SANDHI,一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,它通过显式解耦声调变化来在Whisper骨干网络基础上提高准确性。
NetEase Youdao AI 正在开源 Confucius4-R2T2,一个1.7B的前沿实时流式ASR模型,专为语音代理设计,具有低延迟、高准确度和可配置解码块的特点。
本文提出DiaWhisper-DPO,一个用于临床访谈转录和角色归因的端到端模型,采用失败挖掘的偏好优化,相比级联基线实现高准确度并减少错误。
这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。
Google通过新的Gemini模型推进AI语言支持,实现实时翻译和转录,旨在通过Universal Speech Model等举措覆盖1000种语言。
Jexxa 是一款适用于 macOS 的高速听写工具,完全在设备上运行,确保隐私和快速性能,无需上传数据。
本文系统地评估了在Whisper模型系列上用于多语言语音识别的令牌合并技术,展示了在低资源语言和微调模型中,计算效率得到提升而准确性损失最小。
Orukeet 是基于 NVIDIA Parakeet 构建的 25 种语言语音识别器,采用拟合的 Gabor 核替代编码器滤波器,在大多数基准测试中性能超越基础模型。
本文提出α-split,一种用于联邦学习中差分隐私的双池分配方法。该方法解决了语音大语言模型中的跨组件预算崩溃问题,提升了模型效用并增强了对各类攻击的安全性。
本文详细介绍了Eloquence团队在Interspeech 2026 MLC-SLM挑战赛任务2中的方法,该任务涉及使用语音LLMs进行多语言多选问答,结合微调、上下文学习和检索系统。
本文评估了公开可用的低资源语言语音资源的重用性,重点以中部库尔德语为案例进行研究。
本文详细介绍了Sophea的开发,这是一个生产级的双语希腊语-英语自动语音识别系统,通过迭代训练、数据过滤和模型集成来满足质量门槛并取得具有竞争力的基准测试结果。