标签
WeNet 是一个开源端到端语音识别工具包,它将训练代码、预训练模型和部署运行时统一在一个项目中,支持多种模型架构和运行时后端。
本文比较了最先进的ASR系统与人类听者在识别多样化荷兰语语音方面的表现,发现ASR系统在某些情况下与人类表现相当甚至更优,其中Google Telephony表现最佳。文章强调了说话者年龄、地方口音及测试集选择对基准测试结论的影响。
本文针对ASR模型中转录风格这一未被控制的潜在变量,提出了一种方法,利用覆盖感知的解码器任务令牌实现可调控的逐字转录,并具备准确的词级时间信息,通过零样本跨语言迁移达到了较高的不流畅检测F1值。
微软研究院宣布扩大了其 ASR 模型的覆盖范围,新增了 22 种语言,覆盖 38 个非洲国家,并提供了新的数据集和测试样本。
微软研究院宣布PazaBench的第二个版本发布,这是一个用于评估跨非洲语言自动语音识别模型的基准测试。
NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。
Pipecat是一个开源的Python框架,用于构建实时语音AI Agent,处理语音识别、文本转语音、对话逻辑,并支持多个AI服务提供商。
MOSS-Transcribe-Diarize 是一款具备多说话人分离和热词偏置功能的开源ASR模型,发布后在Hugging Face上走红。
NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,支持从单一检查点进行多种语言转录,并内置标点和大小写功能。
Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。
本文研究了低资源自动语音识别(ASR)中跨语言迁移的问题,针对瓦尔皮里语提出了一种结合声学与语言特征的相似度框架,以选择最优源语言。实验表明,像阿萨姆语和印地语这样声学相似的语言能显著降低词错误率和字符错误率。
Apple 的新 SpeechAnalyzer API 在英语设备端转录的准确性和速度上,显著优于其前代 SFSpeechRecognizer 和 OpenAI 的 Whisper 模型,该基准测试在 M2 Pro 机器上进行。新 API 在清晰语音上的词错误率为 2.12%,而 Whisper Small 为 3.74%,且运行速度快三倍。
本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。
一位用户寻求关于AI语音识别模型的建议,这些模型能够准确理解严重受损的言语,例如其患有唐氏综合症和自闭症、几乎没有语言能力的兄弟的言语,并指出当前像Whisper这样的系统无法识别。
Whispera 是一个基于 VoxCPM 的 Windows 本地实时语音助手,集成了 SenseVoice ASR、llama-server 本地 LLM 推理、VoxCPM 流式 TTS 和 Mem0 长期记忆,完全离线运行。
本文介绍了为MLC-SLM 2026挑战赛设计的系统,该系统结合了说话人日志与微调后的Qwen-ASR,采用监督式全参数微调、合成语音上的LoRA以及GRPO强化学习,在最终评测集上实现了17.97的tcpMER。
本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。
本文介绍了一种基于梯度的语音到文本对齐方法,适用于任何可微分的ASR模型,包括CTC、transducer、基于注意力的编码器-解码器以及语音大语言模型,无需训练或模型修改。
MOSS-Transcribe-Diarize-0.9B 是一个开源端到端音频理解模型,用于长篇幅多说话人转录、说话人识别和时间戳生成,由 Mosi AI 在 Apache 2.0 许可下发布。
本文详细介绍了如何部署 Hermes AI Agent 框架,包括云服务器配置、安装、Telegram Bot 集成、图像识别和语音能力补充,以及接入逆向安全分析工作流。