speech-recognition

标签

Cards List
#speech-recognition

我在Android上将完整的离线语音代理压缩到1.2 GB

Reddit r/ArtificialInteligence ↗ · 2026-08-13

一位开发者演示了在Android上使用小型本地模型(Silero VAD、Parakeet-EOU STT、FunctionGemma 270M、Pocket TTS)实现的完整离线语音到操作代理,运行内存约1.2 GB,不依赖云端。

0 人收藏 0 人点赞
#speech-recognition

Easper:一个用于语言记录的可访问ASR流水线

arXiv cs.CL ↗ · 2026-08-13 缓存

本文介绍了Easper,一个开源、无代码的ASR流水线,让田野语言学家可以直接从ELAN标注中对Whisper等模型进行微调,并评估了在瓦努阿图低资源语言上引导ASR的数据选择策略。

0 人收藏 0 人点赞
#speech-recognition

DonorRank:低资源跨语言语音识别中的捐赠语言选择

arXiv cs.CL ↗ · 2026-08-13 缓存

本文介绍了DonorRank,一种用于低资源跨语言语音识别中选择有效捐赠语言的学习排序框架,并在印度语族和非洲语言语料库上进行了评估。与基于遗传相似性和高资源语言的启发式方法相比,它展示了更好的捐赠语言选择效果,并为多语言ASR的迁移模式提供了见解。

0 人收藏 0 人点赞
#speech-recognition

先有种子,后有目标:重新思考低资源Garhwali语音识别的评估

arXiv cs.CL ↗ · 2026-08-12 缓存

本文认为,低资源自动语音识别中的单次运行评估不可靠,并通过一个新的多种子Garhwali语音识别基准证明,许多已报告的提升在种子级测试下消失,而使用w2v-BERT 2.0的标准CTC仍然是最稳健的方法。

0 人收藏 0 人点赞
#speech-recognition

从语音到交互:鸡尾酒会场景中的多模态系统分析

arXiv cs.CL ↗ · 2026-08-11 缓存

本文分析了针对CHiME-9 MCoRec鸡尾酒会场景的多模态系统,比较了音视频目标语音分离、改进的识别、基于大语言模型的对话分组等设计策略,发现仅语音重叠并不能解释性能差异。

0 人收藏 0 人点赞
#speech-recognition

在HN上展示:Vocal Slice – 通过选中文本剪切音频,完全在设备端运行

Hacker News Top ↗ · 2026-08-10 缓存

Vocal Slice 是一款桌面音频编辑应用,利用设备端的 Whisper 转录功能,用户可以通过在转录文本中高亮来选择和导出片段,专为播客制作人和语音专业人士设计。

0 人收藏 0 人点赞
#speech-recognition

VoiceGecko

Product Hunt ↗ · 2026-08-09

VoiceGecko 是一款正在 Product Hunt 上展示的开源本地语音转文字工具。

0 人收藏 0 人点赞
#speech-recognition

parakeet.wgsl – 通过原生 WebGPU 与 SIMD WASM 在浏览器中实现快速准确的语音识别

Reddit r/LocalLLaMA ↗ · 2026-08-07

parakeet.wgsl 使用原生 WebGPU 计算着色器和 SIMD WASM,在浏览器中实现 NVIDIA Parakeet TDT 0.6B V2 语音转录的快速与准确,并提供实时演示与开源库。

0 人收藏 0 人点赞
#speech-recognition

🟩 NVIDIA 的完整语音技术栈现已本地化。ASR + TTS + 编解码器,量化为 GGUF,通过 NeMo-Speech.cpp 在设备端运行

Reddit r/LocalLLaMA ↗ · 2026-08-06

NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。

0 人收藏 0 人点赞
#speech-recognition

MERaLiON-GR:面向英语和东南亚语言的语音性别识别模型

arXiv cs.CL ↗ · 2026-08-06 缓存

本文介绍了MERaLiON-GR,一个面向英语和东南亚语言的语音性别识别模型,基于MERaLiON-SpeechEncoder-2,使用LoRA和ECAPA-TDNN头部进行微调,在多语言基准上取得了最先进的性能。

0 人收藏 0 人点赞
#speech-recognition

在 iPhone 上完全离线运行 Whisper、Qwen3-ASR、Nemotron 和 MOSS [P]

Reddit r/MachineLearning ↗ · 2026-08-05

LiveTranscriber 是一款开源 iOS 应用,可在 iPhone 上完全离线运行 Whisper、Qwen3-ASR、Nemotron、MOSS 和 Qwen3,提供语音转写、多说话人支持、摘要和实时翻译。开发者分享了工程挑战,并邀请 ASR 和端侧 AI 社区提供反馈。

0 人收藏 0 人点赞
#speech-recognition

@MSFTResearch: 小型语言模型借助SocialRL学会谈判,PazaBench V2将语音AI评估扩展到非洲语言…

X AI KOLs Following ↗ · 2026-08-03 缓存

微软研究院重点介绍了关于使用SocialRL进行小型语言模型谈判、PazaBench V2用于非洲语言语音评估、EvoLib帮助智能体从经验中学习、改进的A/B测试方法以及AI驱动的精准肿瘤学的新研究。

0 人收藏 0 人点赞
#speech-recognition

Zen Whisper

Product Hunt ↗ · 2026-07-31

Zen Whisper 是一款 Mac 应用,提供设备端听写功能,可输入到任何应用中。

0 人收藏 0 人点赞
#speech-recognition

@SamuelZengML:开源ASR刚刚登顶。Audio8 ARK-ASR-3B现以4.76的平均WER在@huggingface Open ASR排行榜上排名第一,……

X AI KOLs Timeline ↗ · 2026-07-30 缓存

Audio8的开源ARK-ASR-3B以4.76的平均WER在Hugging Face Open ASR排行榜上夺得第一,同时其0.6B模型也进入前五,展示了一个有竞争力的开源语音技术栈。

0 人收藏 0 人点赞
#speech-recognition

面向代理式语音识别的Voice Memory

arXiv cs.CL ↗ · 2026-07-30 缓存

Voice Memory提出了一种仅推理的方案,用于代理式语音识别:一个冻结的纠正器读取每个领域的记忆文件,为每个话语决定是采取行动还是放弃,从而在不更新权重的情况下降低多个领域的词错误率。

0 人收藏 0 人点赞
#speech-recognition

代码混合语音强制对齐的评估:以印地语-英语为例

arXiv cs.CL ↗ · 2026-07-29 缓存

本文使用Montreal Forced Aligner评估印地语-英语代码混合语音的强制对齐,证明引导策略和代码混合训练数据相比单语替代方案,对齐精度提高了十倍。

0 人收藏 0 人点赞
#speech-recognition

MoLGE:混合语言组专家实现大规模多语言语音识别的高效扩展

arXiv cs.CL ↗ · 2026-07-28 缓存

MoLGE在混合专家框架中为相似语言簇分配专用专家模块,用于大规模多语言ASR,在参数增加极小的情况下提升495种语言的性能。

0 人收藏 0 人点赞
#speech-recognition

Show HN:Yap – 一款适用于 macOS 的开源本地语音听写工具,无需下载模型

Hacker News Top ↗ · 2026-07-27 缓存

Yap 是一款开源的 macOS 应用,利用 Apple 的 Speech 框架实现极速本地语音听写,无需下载模型、API 密钥或互联网连接。

0 人收藏 0 人点赞
#speech-recognition

MEUSLI:一个面向基于LLM的ASR及其他任务的多语言投影器

arXiv cs.CL ↗ · 2026-07-27 缓存

MEUSLI是一个开源的多语言投影器家族,它将Whisper编码器与多语言LLM连接起来,支持28种欧洲语言的端到端ASR,并扩展到语音翻译和主题识别。

0 人收藏 0 人点赞
#speech-recognition

Whisper Live - 一个近乎实时的Open AI Whisper实现,免费且开源

Reddit r/artificial ↗ · 2026-07-25 缓存

WhisperLive 是一个开源实时转录工具,使用OpenAI的Whisper,支持多种后端(如faster-whisper和TensorRT)用于实时语音转文字。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈