标签
本文详细介绍了Sophea的开发,这是一个生产级的双语希腊语-英语自动语音识别系统,通过迭代训练、数据过滤和模型集成来满足质量门槛并取得具有竞争力的基准测试结果。
Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。
BuzzASR 是一系列语言特化的 Whisper 模型,用于102种语言的自动语音识别,在77种语言上优于 Whisper-large-v3,并在错误率和压缩效率方面有显著提升。
Desert Ant Labs 提供适用于语音、文本和视觉的小型专业AI模型,这些模型可在设备上离线运行,并配备SDK以便轻松集成,且无使用费用。
本文介绍了Hybrid Search,一种通过利用ASR-LLM和基础LLM之间的隐藏状态交互来增强大型音频语言模型中自动语音识别的方法,用于针对性token纠正,其性能超越了全局LLM纠正策略。
这条推文讨论了AI硬件如何通过利用情境理解来减少对屏幕的依赖,并强调HojoAI的开源多语言ASR模型是一个重要发布。
本文介绍了SpeakPay和一个尼泊尔语金融语音数据集,表明对Whisper进行LoRA微调可以将词错误率降低67.2%,并提高低资源语言的交易成功率。
微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。
AirCaps Audio Research Lab 推出专为复杂现实环境设计的流式语音和音频模型,声称在边缘硬件上的性能优于领先的云模型。
本文对来自呼叫中心的真实世界ASR转录本上的主题匹配方法进行基准测试,发现使用自然语言描述的轻量级LLM匹配器优于正则表达式和嵌入方法。
VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。
Vellium v1.1.0 引入实时语音聊天功能,支持使用 Whisper 和 TeraTTSv2 进行本地 STT/TTS,并简化了 llama.cpp 设置,以便更轻松地与本地 AI 模型集成。
本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。
VoiceCodeBench 是一个用于评估自动语音识别中精确结构化令牌恢复的新基准,表明传统 WER 指标不足以满足生产语音工作流程的需求。
这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。
本文介绍了PromptKWS,一种新颖的提示引导开放词汇关键词识别框架,利用提示嵌入和交叉注意力来提高准确性,在唤醒率和准确率方面分别比基线系统提高了超过10%和15%。
Sunbird AI宣布将Sunflower扩展至67种非洲语言,支持实时语音和离线访问,并将于2026年9月24日举办直播网络研讨会。
Open ASR 排行榜是 Hugging Face 推出的基准测试工具,用于评估自动语音识别模型,并附有技术博客文章,链接到 Voice Arena 排行榜。
FrankenWhisper 是一款开源的 iOS 应用,具备说话人识别和降噪功能,现已通过苹果审核并免费提供。
Timnit Gebru 批评了构建巨型'机器之神'的主流AI范式,并倡导更小、更专业、社区拥有的AI工具,这些工具应高效、合乎伦理且适应特定上下文。