asr

标签

Cards List
#asr

真实世界ASR转录本中的主题匹配:基准测试与经验教训

arXiv cs.CL ↗ · 2026-09-02 缓存

本文对来自呼叫中心的真实世界ASR转录本上的主题匹配方法进行基准测试,发现使用自然语言描述的轻量级LLM匹配器优于正则表达式和嵌入方法。

0 人收藏 0 人点赞
#asr

VibeVoice-ASR-Streaming 技术报告

Hugging Face Daily Papers ↗ · 2026-09-02 缓存

VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。

0 人收藏 0 人点赞
#asr

Meta的Muse Voice Transcribe(阅读时长4分钟)

TLDR AI ↗ · 2026-09-02 缓存

Meta推出Muse Voice Transcribe,这是一款实时音频感知模型,在流式ASR和说话人分离方面表现出色,支持多语言,并在公开基准测试中领先。

0 人收藏 0 人点赞
#asr

用语义锚定语音:面向低资源语言自动语音识别的多模态适配器机制

arXiv cs.CL ↗ · 2026-09-01 缓存

本文提出SAMA-ASR——一种多模态适配器,通过利用翻译提供的语义锚点和语音的声学锚点,改进低资源语言的自动语音识别。在台湾闽南语和客家话上的实验证明其性能优于基线方法。

0 人收藏 0 人点赞
#asr

来自提示层级上下文的侧级词错误率无显著变化:一项针对生产口语历史语料库的预注册消融研究

arXiv cs.CL ↗ · 2026-09-01 缓存

这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。

0 人收藏 0 人点赞
#asr

@Huahuazo: 这声音克隆工具我试完直接愣住了。 随手截了8秒自己说话的录音扔进去,出来的声音——语气、停顿、那种欠欠的调调,简直跟我本人在抬杠一模一样。 最绝的是完全本地跑,音频不用上传,隐私安全直接拉满。说实话第一反应不是厉害,是头皮发麻:以后光凭一…

X AI KOLs Timeline ↗ · 2026-08-30 缓存

介绍本地声音克隆工具VoiceStudio,只需8秒录音即可高度还原声音,完全本地运行保护隐私,支持多种语言和平台。

0 人收藏 0 人点赞
#asr

[audio.cpp] 版本 0.7:62 个音频模型家族(85+ 变体)、模型比较的 Arena UI、MiniMax Music 3、FireRed TTS3/Audio、ControlFoley、Personaplex 等更多内容

Reddit r/LocalLLaMA ↗ · 2026-08-27

audio.cpp 版本 0.7 引入了一个新的 Arena UI,用于本地比较音频模型,扩展至 62 个模型家族,拥有超过 85 个变体,并支持在边缘硬件如 NVIDIA Jetson Orin 上部署。

0 人收藏 0 人点赞
#asr

FireRedAudio 和 FireRedTTS3 由 FireRedTeam 开发 - Huggingface

Reddit r/LocalLLaMA ↗ · 2026-08-21

FireRedAudio 和 FireRedTTS3 是统一音频理解与生成的AI模型,提供ASR、TTS、语音克隆、编辑和多语言支持,并具有竞争力的基准测试结果。

0 人收藏 0 人点赞
#asr

量化ASR模型中的基准优化

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

本文通过行为探测方法,量化了高性能ASR模型如何通过非真实反映转录能力的方式优化基准测试以提升分数,揭示了基准条件下的模型行为。

0 人收藏 0 人点赞
#asr

superwhisper/s1-mini (阅读约8分钟)

TLDR AI ↗ · 2026-08-20 缓存

superwhisper/s1-mini 是一个从Qwen3-0.6B微调而来的0.6B参数文本规范化模型,用于清理语音转文本记录,通过去除填充词、纠正错误并应用标点和格式,在英语数据上达到94.8%的准确率。

0 人收藏 0 人点赞
#asr

Easper:一个用于语言记录的可访问ASR流水线

arXiv cs.CL ↗ · 2026-08-13 缓存

本文介绍了Easper,一个开源、无代码的ASR流水线,让田野语言学家可以直接从ELAN标注中对Whisper等模型进行微调,并评估了在瓦努阿图低资源语言上引导ASR的数据选择策略。

0 人收藏 0 人点赞
#asr

先有种子,后有目标:重新思考低资源Garhwali语音识别的评估

arXiv cs.CL ↗ · 2026-08-12 缓存

本文认为,低资源自动语音识别中的单次运行评估不可靠,并通过一个新的多种子Garhwali语音识别基准证明,许多已报告的提升在种子级测试下消失,而使用w2v-BERT 2.0的标准CTC仍然是最稳健的方法。

0 人收藏 0 人点赞
#asr

通过年龄感知训练实现儿童语音的边缘音素识别

arXiv cs.AI ↗ · 2026-08-12 缓存

提出了一种用于儿童语音音素识别的年龄感知多任务学习方法,使轻量级94M参数模型能够超越更大的模型,并在手机等边缘设备上运行。

0 人收藏 0 人点赞
#asr

parakeet.wgsl – 通过原生 WebGPU 与 SIMD WASM 在浏览器中实现快速准确的语音识别

Reddit r/LocalLLaMA ↗ · 2026-08-07

parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。

0 人收藏 0 人点赞
#asr

如何识别新词:上下文偏置方法与语音大语言模型的比较

arXiv cs.CL ↗ · 2026-08-07 缓存

本文比较了上下文偏置方法和语音大语言模型在自动语音识别中识别罕见词和新词的表现,报告了在朗读语音和非朗读语音中词错误率的权衡。

0 人收藏 0 人点赞
#asr

你在生产环境的语音智能体中使用什么 STT API?最先出问题的是什么?

Reddit r/AI_Agents ↗ · 2026-08-05

一位开发者询问人们在生产环境的语音智能体中使用哪些 STT API,比较了 Deepgram、AssemblyAI 和 Smallest AI Pulse,并指出了常见的故障点,如端点检测、延迟和打断。

0 人收藏 0 人点赞
#asr

@Azure:微软 Foundry 现已推出 GPT-transcribe 和 GPT-live-transcribe。使用高精度转录功能构建录播音频…

X AI KOLs Timeline ↗ · 2026-07-30 缓存

OpenAI 和微软在 Microsoft Foundry 中发布了 GPT-transcribe 和 GPT-live-transcribe,分别针对录播音频和实时语音提供高精度异步转录和低延迟流式转录,具备背景噪音处理、口音鲁棒性和字母数字感知等功能。

0 人收藏 0 人点赞
#asr

@SamuelZengML:开源ASR刚刚登顶。Audio8 ARK-ASR-3B现以4.76的平均WER在@huggingface Open ASR排行榜上排名第一,……

X AI KOLs Timeline ↗ · 2026-07-30 缓存

Audio8的开源ARK-ASR-3B以4.76的平均WER在Hugging Face Open ASR排行榜上夺得第一,同时其0.6B模型也进入前五,展示了一个有竞争力的开源语音技术栈。

0 人收藏 0 人点赞
#asr

面向代理式语音识别的Voice Memory

arXiv cs.CL ↗ · 2026-07-30 缓存

Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。

0 人收藏 0 人点赞
#asr

SpeechLLM与联邦学习结合实现端到端ASR:英语和意大利语案例研究

arXiv cs.CL ↗ · 2026-07-29 缓存

本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练,在英语和意大利语任务上进行了评估,在降低通信成本的同时取得了具有竞争力的词错误率。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈