asr

标签

Cards List
#asr

parakeet.wgsl – 通过原生 WebGPU 与 SIMD WASM 在浏览器中实现快速准确的语音识别

Reddit r/LocalLLaMA · 昨天

parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。

0 人收藏 0 人点赞
#asr

如何识别新词:上下文偏置方法与语音大语言模型的比较

arXiv cs.CL · 2天前 缓存

本文比较了上下文偏置方法和语音大语言模型在自动语音识别中识别罕见词和新词的表现,报告了在朗读语音和非朗读语音中词错误率的权衡。

0 人收藏 0 人点赞
#asr

你在生产环境的语音智能体中使用什么 STT API?最先出问题的是什么?

Reddit r/AI_Agents · 3天前

一位开发者询问人们在生产环境的语音智能体中使用哪些 STT API,比较了 Deepgram、AssemblyAI 和 Smallest AI Pulse,并指出了常见的故障点,如端点检测、延迟和打断。

0 人收藏 0 人点赞
#asr

@Azure:微软 Foundry 现已推出 GPT-transcribe 和 GPT-live-transcribe。使用高精度转录功能构建录播音频…

X AI KOLs Timeline · 2026-07-30 缓存

OpenAI 和微软在 Microsoft Foundry 中发布了 GPT-transcribe 和 GPT-live-transcribe,分别针对录播音频和实时语音提供高精度异步转录和低延迟流式转录,具备背景噪音处理、口音鲁棒性和字母数字感知等功能。

0 人收藏 0 人点赞
#asr

@SamuelZengML:开源ASR刚刚登顶。Audio8 ARK-ASR-3B现以4.76的平均WER在@huggingface Open ASR排行榜上排名第一,……

X AI KOLs Timeline · 2026-07-30 缓存

Audio8的开源ARK-ASR-3B以4.76的平均WER在Hugging Face Open ASR排行榜上夺得第一,同时其0.6B模型也进入前五,展示了一个有竞争力的开源语音技术栈。

0 人收藏 0 人点赞
#asr

面向代理式语音识别的Voice Memory

arXiv cs.CL · 2026-07-30 缓存

Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。

0 人收藏 0 人点赞
#asr

SpeechLLM与联邦学习结合实现端到端ASR:英语和意大利语案例研究

arXiv cs.CL · 2026-07-29 缓存

本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练,在英语和意大利语任务上进行了评估,在降低通信成本的同时取得了具有竞争力的词错误率。

0 人收藏 0 人点赞
#asr

microsoft/VibeVoice-ASR-BitNet

Reddit r/LocalLLaMA · 2026-07-28 缓存

Microsoft发布了VibeVoice-ASR-BitNet,这是一个压缩的多语言ASR模型,用于实时CPU推理。与Whisper.cpp相比,它的推理速度提高了1.6-2.3倍,并且仅需3个CPU线程即可实现实时能力。

0 人收藏 0 人点赞
#asr

MoLGE:混合语言组专家实现大规模多语言语音识别的高效扩展

arXiv cs.CL · 2026-07-28 缓存

MoLGE在混合专家框架中为相似语言簇分配专用专家模块,用于大规模多语言ASR,在参数增加极小的情况下提升495种语言的性能。

0 人收藏 0 人点赞
#asr

Indic DiarBench:面向印度语言的多语言联合说话人日志与自动语音识别基准

arXiv cs.CL · 2026-07-28 缓存

Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。

0 人收藏 0 人点赞
#asr

MEUSLI:一个面向基于LLM的ASR及其他任务的多语言投影器

arXiv cs.CL · 2026-07-27 缓存

MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。

0 人收藏 0 人点赞
#asr

@DanKornas: 当训练代码、预训练模型和部署运行时分别放在不同地方时,语音识别工作会变得混乱…

X AI KOLs Timeline · 2026-07-24 缓存

WeNet 是一个开源端到端语音识别工具包,它将训练代码、预训练模型和部署运行时统一在一个项目中,支持多种模型架构和运行时后端。

0 人收藏 0 人点赞
#asr

多样化语音的人类与自动语音识别基准测试:初步结果

arXiv cs.CL · 2026-07-22 缓存

本文比较了最先进的ASR系统与人类听者在识别多样化荷兰语语音方面的表现,发现ASR系统在某些情况下与人类表现相当甚至更优,其中Google Telephony表现最佳。文章强调了说话者年龄、地方口音及测试集选择对基准测试结论的影响。

0 人收藏 0 人点赞
#asr

将转录策略作为潜在变量:通过词级时间控制实现可调控的逐字ASR

arXiv cs.CL · 2026-07-22 缓存

本文针对ASR模型中转录风格这一未被控制的潜在变量,提出了一种方法,利用覆盖感知的解码器任务令牌实现可调控的逐字转录,并具备准确的词级时间信息,通过零样本跨语言迁移达到了较高的不流畅检测F1值。

0 人收藏 0 人点赞
#asr

@MSFTResearch:我们显著扩展了覆盖范围,支持:● 22 种新增语言,现已覆盖 38 个非洲国家…

X AI KOLs Following · 2026-07-21 缓存

微软研究院宣布扩大了其 ASR 模型的覆盖范围,新增了 22 种语言,覆盖 38 个非洲国家,并提供了新的数据集和测试样本。

0 人收藏 0 人点赞
#asr

@MSFTResearch: 今天,我们宣布PazaBench的第二个版本发布,这是我们用于评估跨非洲语言自动语音识别(ASR)模型的基准测试。

X AI KOLs Timeline · 2026-07-21 缓存

微软研究院宣布PazaBench的第二个版本发布,这是一个用于评估跨非洲语言自动语音识别模型的基准测试。

0 人收藏 0 人点赞
#asr

在微控制器上运行13M参数的ASR Conformer模型

Reddit r/LocalLLaMA · 2026-07-20

详细介绍了一种在微控制器上直接运行拥有13M参数的ASR Conformer模型的方法,突出了边缘AI部署的进步。

0 人收藏 0 人点赞
#asr

@YichiZ03: https://x.com/YichiZ03/status/2078588932191895976

X AI KOLs Timeline · 2026-07-18 缓存

MOSS-TD是一个说话人感知的ASR系统,在SGLang-Omni服务栈中进行了优化,能够在单张H100上以约49秒转录38分钟的多说话人音频,并支持16个会议的并发处理。

0 人收藏 0 人点赞
#asr

@Open_MOSS: MOSS-Transcribe-Diarize 在 @huggingface 上跻身热门模型之列。发布数周后,该模型已…

X AI KOLs Timeline · 2026-07-16 缓存

MOSS-Transcribe-Diarize 是一款具备多说话人分离和热词偏置功能的开源ASR模型,发布后在Hugging Face上走红。

0 人收藏 0 人点赞
#asr

@thesupermanmx: NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,而且成本为零。这真是太快了……

X AI KOLs Timeline · 2026-07-16 缓存

NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,支持从单一检查点进行多种语言转录,并内置标点和大小写功能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈