标签
本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。
VoiceCodeBench 是一个用于评估自动语音识别中精确结构化令牌恢复的新基准,表明传统 WER 指标不足以满足生产语音工作流程的需求。
这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。
本文介绍了PromptKWS,一种新颖的提示引导开放词汇关键词识别框架,利用提示嵌入和交叉注意力来提高准确性,在唤醒率和准确率方面分别比基线系统提高了超过10%和15%。
Sunbird AI宣布将Sunflower扩展至67种非洲语言,支持实时语音和离线访问,并将于2026年9月24日举办直播网络研讨会。
Open ASR 排行榜是 Hugging Face 推出的基准测试工具,用于评估自动语音识别模型,并附有技术博客文章,链接到 Voice Arena 排行榜。
FrankenWhisper 是一款开源的 iOS 应用,具备说话人识别和降噪功能,现已通过苹果审核并免费提供。
Timnit Gebru 批评了构建巨型'机器之神'的主流AI范式,并倡导更小、更专业、社区拥有的AI工具,这些工具应高效、合乎伦理且适应特定上下文。
Google DeepMind 宣布对其 AI 模型进行改进,增强了在嘈杂环境中理解复杂电话号码、邮政编码和订单 ID 的能力,同时加入了去除填充词和识别自定义词汇等功能
Google发布Gemini 3.5 Transcribe,这是一种AI模型,通过自动移除填充词、支持超过85种语言以及提供自定义词汇和说话人归属来改善音频转录。
IBM发布两款新的紧凑型AI模型Granite Speech 5.0 Turbo CTC,用于极快且准确的英语语音转录,在NVIDIA H200 GPU上实现超过12,600 RTFx。
small-int8和paraformer-zh都是轻量级AI模型,体积仅两百兆左右,适用于日常与Agent的交互,速度快速,响应及时。
Loqua 是一款产品,它使用户能够通过自然语音将想法转化为文字、理解屏幕内容,并通过语音命令自动化工作流程,从而减少打字和上下文切换,提升生产力。
本文探讨了关于测量语音识别中基准优化的研究,指出某些语音识别模型可能针对测试基准进行优化而非真实场景性能,并介绍了用于量化该现象的测试方法。
本文通过行为探测方法,量化了高性能ASR模型如何通过非真实反映转录能力的方式优化基准测试以提升分数,揭示了基准条件下的模型行为。
Wispr,一家AI听写初创公司,以20亿美元估值获得2.8亿美元B轮融资,并推出名为Canto的新模型,以提高语音理解准确性。
本文介绍了第二届MLC-SLM挑战赛的技术,包括随机前置静音裁剪和合成数据生成,以提升多语言对话语音任务,实现了准确率提升和错误率降低。
Talkify 是一款免费、开源的 macOS 听写应用,基于 Apple 的 SpeechAnalyzer 构建,支持即时、设备内语音转录,具有低延迟和多语言功能,位于刘海屏中。
本文提出了一个受控基准,比较了六种多语言预训练ASR模型在尼泊尔语音上的表现,发现Whisper-Large-v3-Turbo和IndicWav2Vec表现最佳,而CTC解码器的推理速度最高可提升29倍。该研究为尼泊尔ASR提供了首个标准化的、考虑效率的参考数值。