标签
一位开发者演示了在Android上使用小型本地模型(Silero VAD、Parakeet-EOU STT、FunctionGemma 270M、Pocket TTS)实现的完整离线语音到操作代理,运行内存约1.2 GB,不依赖云端。
本文介绍了Easper,一个开源、无代码的ASR流水线,让田野语言学家可以直接从ELAN标注中对Whisper等模型进行微调,并评估了在瓦努阿图低资源语言上引导ASR的数据选择策略。
本文介绍了DonorRank,一种用于低资源跨语言语音识别中选择有效捐赠语言的学习排序框架,并在印度语族和非洲语言语料库上进行了评估。与基于遗传相似性和高资源语言的启发式方法相比,它展示了更好的捐赠语言选择效果,并为多语言ASR的迁移模式提供了见解。
本文认为,低资源自动语音识别中的单次运行评估不可靠,并通过一个新的多种子Garhwali语音识别基准证明,许多已报告的提升在种子级测试下消失,而使用w2v-BERT 2.0的标准CTC仍然是最稳健的方法。
本文分析了针对CHiME-9 MCoRec鸡尾酒会场景的多模态系统,比较了音视频目标语音分离、改进的识别、基于大语言模型的对话分组等设计策略,发现仅语音重叠并不能解释性能差异。
Vocal Slice 是一款桌面音频编辑应用,利用设备端的 Whisper 转录功能,用户可以通过在转录文本中高亮来选择和导出片段,专为播客制作人和语音专业人士设计。
parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。
NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。
本文介绍了MERaLiON-GR,一个面向英语和东南亚语言的语音性别识别模型,基于MERaLiON-SpeechEncoder-2,使用LoRA和ECAPA-TDNN头部进行微调,在多语言基准上取得了最先进的性能。
LiveTranscriber 是一款开源 iOS 应用,可在 iPhone 上完全离线运行 Whisper、Qwen3-ASR、Nemotron、MOSS 和 Qwen3,提供语音转写、多说话人支持、摘要和实时翻译。开发者分享了工程挑战,并邀请 ASR 和端侧 AI 社区提供反馈。
微软研究院重点介绍了关于使用SocialRL进行小型语言模型谈判、PazaBench V2用于非洲语言语音评估、EvoLib帮助智能体从经验中学习、改进的A/B测试方法以及AI驱动的精准肿瘤学的新研究。
Audio8的开源ARK-ASR-3B以4.76的平均WER在Hugging Face Open ASR排行榜上夺得第一,同时其0.6B模型也进入前五,展示了一个有竞争力的开源语音技术栈。
Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。
本文使用Montreal Forced Aligner评估印地语-英语代码混合语音的强制对齐,证明引导策略和代码混合训练数据相比单语替代方案,对齐精度提高了十倍。
MoLGE在混合专家框架中为相似语言簇分配专用专家模块,用于大规模多语言ASR,在参数增加极小的情况下提升495种语言的性能。
Yap 是一款开源的 macOS 应用,利用 Apple 的 Speech 框架实现极速本地语音听写,无需下载模型、API 密钥或互联网连接。
MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。
WhisperLive 是一个开源实时转录工具,使用OpenAI的Whisper,支持多种后端(如faster-whisper和TensorRT)用于实时语音转文字。