标签
Orukeet 是基于 NVIDIA Parakeet 构建的 25 种语言语音识别器,采用拟合的 Gabor 核替代编码器滤波器,在大多数基准测试中性能超越基础模型。
本文提出α-split,一种用于联邦学习中差分隐私的双池分配方法。该方法解决了语音大语言模型中的跨组件预算崩溃问题,提升了模型效用并增强了对各类攻击的安全性。
本文详细介绍了Eloquence团队在Interspeech 2026 MLC-SLM挑战赛任务2中的方法,该任务涉及使用语音LLMs进行多语言多选问答,结合微调、上下文学习和检索系统。
本文评估了公开可用的低资源语言语音资源的重用性,重点以中部库尔德语为案例进行研究。
本文详细介绍了Sophea的开发,这是一个生产级的双语希腊语-英语自动语音识别系统,通过迭代训练、数据过滤和模型集成来满足质量门槛并取得具有竞争力的基准测试结果。
Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。
BuzzASR 是一系列语言特化的 Whisper 模型,用于102种语言的自动语音识别,在77种语言上优于 Whisper-large-v3,并在错误率和压缩效率方面有显著提升。
Desert Ant Labs 提供适用于语音、文本和视觉的小型专业AI模型,这些模型可在设备上离线运行,并配备SDK以便轻松集成,且无使用费用。
本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。
这条推文讨论了AI硬件如何通过利用情境理解来减少对屏幕的依赖,并强调HojoAI的开源多语言ASR模型是一个重要发布。
本文介绍了SpeakPay和一个尼泊尔语金融语音数据集,表明对Whisper进行LoRA微调可以将词错误率降低67.2%,并提高低资源语言的交易成功率。
微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。
AirCaps Audio Research Lab 推出专为复杂现实环境设计的流式语音和音频模型,声称在边缘硬件上的性能优于领先的云模型。
本文对来自呼叫中心的真实世界ASR转录本上的主题匹配方法进行基准测试,发现使用自然语言描述的轻量级LLM匹配器优于正则表达式和嵌入方法。
VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。
Vellium v1.1.0 引入实时语音聊天功能,支持使用 Whisper 和 TeraTTSv2 进行本地 STT/TTS,并简化了 llama.cpp 设置,以便更轻松地与本地 AI 模型集成。
本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。
VoiceCodeBench 是一个用于评估自动语音识别中精确结构化令牌恢复的新基准,表明传统 WER 指标不足以满足生产语音工作流程的需求。
这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。