标签
该论文表明,在语音大模型适配中,训练随机种子的变异性对人口统计学公平性差距的影响可能超过音频压缩方案的选择,因此仅基于单次运行的公平性报告是不可靠的。方差分解结果显示,Fair-Speech 数据集上的种族差距差异中有 85.3% 可归因于种子效应,且即使扩大适配数据规模,这些效应依然存在。
TutlAit v1 提供了一个众包的摩洛哥 Tamazight 语音数据集,包含 13,384 个音频文件(约 20.9 小时),并配有现代标准阿拉伯语转写和区域口音标签。该数据集通过一个专门构建的 Web 应用程序收集,面向低资源语音技术研究。
该论文提出了一种自动估计运动神经元病患者言语流畅性指数的系统,该系统结合WhisperX语音识别对齐、Silero VAD与停顿建模,其性能优于传统声学特征和自监督嵌入方法,采用具有临床可解释性的指标,R²最高可达0.9。
开发者发布了 LokalBot 0.9.2,一款免费、开源的 Mac 会议记录应用,完全在本地设备上运行,整个技术栈由五个本地模型组成(Qwen3-ASR 用于转写、Nemotron 3 用于说话人分离、Qwen3.5 4B 用于生成笔记、Harrier 用于嵌入向量、LFM2.5 用于自动补全),同时在 M4 Max 上取得了基准测试改进。
Oído 是 Lokutor 推出的开源语音识别系统,可在 5 美元的 ESP32-S3 微控制器上运行 NVIDIA 的 Conformer-CTC Small(1300 万参数、int8),在 LibriSpeech 和嘈杂环境基准测试中均超越 Whisper tiny.en,且无需 GPU 或 NPU。
本文提出了 SI-cpWER——一种面向跨会议持续说话人归属的语料级评测指标,并在 NOTSOFAR 和 CHiME-6 上对 5 个商用说话人分离+语音识别 API、2 个开源基线(以及作者自己的 ThyVoice 系统)进行了评估,结果表明,单场会议内的排名并不能反映跨会议的身份一致性。短版本已被 IEEE SLT 2026 Demo Track 接收。
getcta.store 是一款适用于 macOS 的 AI 提词器,可定位在 MacBook 刘海下方,提供脚本生成、语音跟随高亮以及视频通话中隐藏操作等功能。
Zumbo 是一款适用于 Mac 的开源本地 AI 语音转文本工具,提供私密语音转文本转换,具有高精度、多种词汇包和离线功能。
本文介绍了I-Parakeet,一个专为移动NPU优化的纯整数Conformer ASR模型,实现了高效的设备端语音识别。
本文探讨了音频大语言模型检测不可靠转录的能力,并提出一种基于音频编码器表示的轻量级预测器,用于触发澄清请求。
本文介绍了目标说话人遗忘ASR(TSU-ASR),并提出了一种新颖的注册条件门控模块,用于在基于LLM的ASR中推理时动态退出说话人,以增强在线会议的隐私性。
本文介绍了Pruned CTC,这是一种通过限制对齐计算来降低大词汇量自动语音识别中连接时序分类训练内存使用的方法,证明了其与全词汇量CTC的等价性,并展示了在离线和流式设置下与LLM适配的强大性能。
BRIDGE ASR 2.0 是一个基准,评估语音识别模型在21种语言的真实双人对话中的表现,重点关注语码转换和多语言性能,以增强AI和机器人中的语音交互。
Agentic-GER 提出一个基于大语言模型的智能体,用于在长语音转录中利用全局上下文和选择性重转录修正领域特定术语,实现了中英文语音识别准确率的显著提升。
本文研究Whisper ASR模型后训练权重压缩如何加剧转录错误的人口统计学差异,导致边缘化说话者更正时间增加。
本综述论文回顾了脑语言解码的发展,将神经活动转化为语言输出,用于交流恢复和科学研究,涵盖任务、方法、评估及未来方向。
Ruby-ASR 提出了一种新的监督方法,用于日语自动语音识别,该方法将字形跨度与其词汇阅读绑定,在保持转录准确性的同时改进阅读识别。
开源 Audio8 ASR Infinite,一种具有超低延迟、无限制音频支持、24/7转录和内置语义轮次检测的语音识别工具,据称是流式ASR的新技术标杆。
本文提出了一种半监督联邦ASR的实用方案,采用在线伪标签和服务器更新稳定化,在域内和跨域设置中均展示了相对于先前方法的显著改进。
NetEase Youdao的开源AI模型R2T2和T3PO在Hugging Face的语音识别和翻译排行榜上名列前茅,凭借令人印象深刻的实时性能和稳定性超越了主要竞争对手。