speech-recognition

标签

Cards List
#speech-recognition

parakeet.wgsl – 通过原生 WebGPU 与 SIMD WASM 在浏览器中实现快速准确的语音识别

Reddit r/LocalLLaMA · 昨天

parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。

0 人收藏 0 人点赞
#speech-recognition

🟩 NVIDIA 的完整语音技术栈现已本地化。ASR + TTS + 编解码器,量化为 GGUF,通过 NeMo-Speech.cpp 在设备端运行

Reddit r/LocalLLaMA · 2天前

NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。

0 人收藏 0 人点赞
#speech-recognition

MERaLiON-GR:面向英语和东南亚语言的语音性别识别模型

arXiv cs.CL · 3天前 缓存

本文介绍了MERaLiON-GR,一个面向英语和东南亚语言的语音性别识别模型,基于MERaLiON-SpeechEncoder-2,使用LoRA和ECAPA-TDNN头部进行微调,在多语言基准上取得了最先进的性能。

0 人收藏 0 人点赞
#speech-recognition

在 iPhone 上完全离线运行 Whisper、Qwen3-ASR、Nemotron 和 MOSS [P]

Reddit r/MachineLearning · 3天前

LiveTranscriber 是一款开源 iOS 应用,可在 iPhone 上完全离线运行 Whisper、Qwen3-ASR、Nemotron、MOSS 和 Qwen3,提供语音转写、多说话人支持、摘要和实时翻译。开发者分享了工程挑战,并邀请 ASR 和端侧 AI 社区提供反馈。

0 人收藏 0 人点赞
#speech-recognition

@MSFTResearch: 小型语言模型借助SocialRL学会谈判,PazaBench V2将语音AI评估扩展到非洲语言…

X AI KOLs Following · 5天前 缓存

微软研究院重点介绍了关于使用SocialRL进行小型语言模型谈判、PazaBench V2用于非洲语言语音评估、EvoLib帮助智能体从经验中学习、改进的A/B测试方法以及AI驱动的精准肿瘤学的新研究。

0 人收藏 0 人点赞
#speech-recognition

Zen Whisper

Product Hunt · 2026-07-31

Zen Whisper 是一款 Mac 应用,提供设备端听写功能,可输入到任何应用中。

0 人收藏 0 人点赞
#speech-recognition

@SamuelZengML:开源ASR刚刚登顶。Audio8 ARK-ASR-3B现以4.76的平均WER在@huggingface Open ASR排行榜上排名第一,……

X AI KOLs Timeline · 2026-07-30 缓存

Audio8的开源ARK-ASR-3B以4.76的平均WER在Hugging Face Open ASR排行榜上夺得第一,同时其0.6B模型也进入前五,展示了一个有竞争力的开源语音技术栈。

0 人收藏 0 人点赞
#speech-recognition

面向代理式语音识别的Voice Memory

arXiv cs.CL · 2026-07-30 缓存

Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。

0 人收藏 0 人点赞
#speech-recognition

代码混合语音强制对齐的评估:以印地语-英语为例

arXiv cs.CL · 2026-07-29 缓存

本文使用Montreal Forced Aligner评估印地语-英语代码混合语音的强制对齐,证明引导策略和代码混合训练数据相比单语替代方案,对齐精度提高了十倍。

0 人收藏 0 人点赞
#speech-recognition

MoLGE:混合语言组专家实现大规模多语言语音识别的高效扩展

arXiv cs.CL · 2026-07-28 缓存

MoLGE在混合专家框架中为相似语言簇分配专用专家模块,用于大规模多语言ASR,在参数增加极小的情况下提升495种语言的性能。

0 人收藏 0 人点赞
#speech-recognition

Show HN:Yap – 一款适用于 macOS 的开源本地语音听写工具,无需下载模型

Hacker News Top · 2026-07-27 缓存

Yap 是一款开源的 macOS 应用,利用 Apple 的 Speech 框架实现极速本地语音听写,无需下载模型、API 密钥或互联网连接。

0 人收藏 0 人点赞
#speech-recognition

MEUSLI:一个面向基于LLM的ASR及其他任务的多语言投影器

arXiv cs.CL · 2026-07-27 缓存

MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。

0 人收藏 0 人点赞
#speech-recognition

Whisper Live - 一个近乎实时的Open AI Whisper实现,免费且开源

Reddit r/artificial · 2026-07-25 缓存

WhisperLive 是一个开源实时转录工具,使用OpenAI的Whisper,支持多种后端(如faster-whisper和TensorRT)用于实时语音转文字。

0 人收藏 0 人点赞
#speech-recognition

@DanKornas: 当训练代码、预训练模型和部署运行时分别放在不同地方时,语音识别工作会变得混乱…

X AI KOLs Timeline · 2026-07-24 缓存

WeNet 是一个开源端到端语音识别工具包,它将训练代码、预训练模型和部署运行时统一在一个项目中,支持多种模型架构和运行时后端。

0 人收藏 0 人点赞
#speech-recognition

多样化语音的人类与自动语音识别基准测试:初步结果

arXiv cs.CL · 2026-07-22 缓存

本文比较了最先进的ASR系统与人类听者在识别多样化荷兰语语音方面的表现,发现ASR系统在某些情况下与人类表现相当甚至更优,其中Google Telephony表现最佳。文章强调了说话者年龄、地方口音及测试集选择对基准测试结论的影响。

0 人收藏 0 人点赞
#speech-recognition

将转录策略作为潜在变量:通过词级时间控制实现可调控的逐字ASR

arXiv cs.CL · 2026-07-22 缓存

本文针对ASR模型中转录风格这一未被控制的潜在变量,提出了一种方法,利用覆盖感知的解码器任务令牌实现可调控的逐字转录,并具备准确的词级时间信息,通过零样本跨语言迁移达到了较高的不流畅检测F1值。

0 人收藏 0 人点赞
#speech-recognition

@MSFTResearch:我们显著扩展了覆盖范围,支持:● 22 种新增语言,现已覆盖 38 个非洲国家…

X AI KOLs Following · 2026-07-21 缓存

微软研究院宣布扩大了其 ASR 模型的覆盖范围,新增了 22 种语言,覆盖 38 个非洲国家,并提供了新的数据集和测试样本。

0 人收藏 0 人点赞
#speech-recognition

@MSFTResearch: 今天,我们宣布PazaBench的第二个版本发布,这是我们用于评估跨非洲语言自动语音识别(ASR)模型的基准测试。

X AI KOLs Timeline · 2026-07-21 缓存

微软研究院宣布PazaBench的第二个版本发布,这是一个用于评估跨非洲语言自动语音识别模型的基准测试。

0 人收藏 0 人点赞
#speech-recognition

@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……

X AI KOLs Following · 2026-07-20 缓存

NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。

0 人收藏 0 人点赞
#speech-recognition

@Sumanth_077:用于构建实时语音AI Agent的开源框架!Pipecat是一个Python框架,用于编排音频、视频……

X AI KOLs Timeline · 2026-07-16 缓存

Pipecat是一个开源的Python框架,用于构建实时语音AI Agent,处理语音识别、文本转语音、对话逻辑,并支持多个AI服务提供商。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈