标签
本综述论文回顾了脑语言解码的发展,将神经活动转化为语言输出,用于交流恢复和科学研究,涵盖任务、方法、评估及未来方向。
Ruby-ASR 提出了一种新的监督方法,用于日语自动语音识别,该方法将字形跨度与其词汇阅读绑定,在保持转录准确性的同时改进阅读识别。
开源 Audio8 ASR Infinite,一种具有超低延迟、无限制音频支持、24/7转录和内置语义轮次检测的语音识别工具,据称是流式ASR的新技术标杆。
本文提出了一种半监督联邦ASR的实用方案,采用在线伪标签和服务器更新稳定化,在域内和跨域设置中均展示了相对于先前方法的显著改进。
NetEase Youdao的开源AI模型R2T2和T3PO在Hugging Face的语音识别和翻译排行榜上名列前茅,凭借令人印象深刻的实时性能和稳定性超越了主要竞争对手。
Speechka是一款实时语音翻译工具,能够模仿用户的声音,支持44种语言,适用于macOS、Windows和浏览器。
文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。
论文通过使用Hirschberg算法和约束随机游走对Viterbi算法进行优化,将内存使用从140 GB减少到5 MB并提高速度,使得强制对齐能够在终端设备上运行,从而提升语音处理的可扩展性。
本文提出一个用于带口音对话式ASR的三阶段流水线,以提高实体和不流畅性的召回率,实现80-85%的实体召回率,并且用更少的参数优于基线系统。
R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。
文章探讨了语音智能体中ASR对稳定性的需求胜过速度,讨论了集成等待/确认机制以增强可靠性的'Confucius r2t2'模型。
TypeDash是一款桌面应用程序,允许用户通过语音命令控制计算机并听写文本,功能包括应用启动、网络搜索,以及可选的由ChatGPT驱动的语音识别清理功能。
该论文提出了T-SANDHI,一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,它通过显式解耦声调变化来在Whisper骨干网络基础上提高准确性。
NetEase Youdao AI 正在开源 Confucius4-R2T2,一个1.7B的前沿实时流式ASR模型,专为语音代理设计,具有低延迟、高准确度和可配置解码块的特点。
本文提出DiaWhisper-DPO,一个用于临床访谈转录和角色归因的端到端模型,采用失败挖掘的偏好优化,相比级联基线实现高准确度并减少错误。
这篇文章介绍了开源的Audio8模型,这些模型支持在手机和PC上进行设备端的语音识别和合成,包括一个适用于iPhone的离线转录版本。
Google通过新的Gemini模型推进AI语言支持,实现实时翻译和转录,旨在通过Universal Speech Model等举措覆盖1000种语言。
Jexxa 是一款适用于 macOS 的高速听写工具,完全在设备上运行,确保隐私和快速性能,无需上传数据。
本文系统地评估了在Whisper模型系列上用于多语言语音识别的令牌合并技术,展示了在低资源语言和微调模型中,计算效率得到提升而准确性损失最小。