speech-recognition

标签

Cards List
#speech-recognition

@DanKornas: 当训练代码、预训练模型和部署运行时分别放在不同地方时,语音识别工作会变得混乱…

X AI KOLs Timeline ↗ · 2026-07-24 缓存

WeNet 是一个开源端到端语音识别工具包,它将训练代码、预训练模型和部署运行时统一在一个项目中,支持多种模型架构和运行时后端。

0 人收藏 0 人点赞
#speech-recognition

多样化语音的人类与自动语音识别基准测试:初步结果

arXiv cs.CL ↗ · 2026-07-22 缓存

本文比较了最先进的ASR系统与人类听者在识别多样化荷兰语语音方面的表现,发现ASR系统在某些情况下与人类表现相当甚至更优,其中Google Telephony表现最佳。文章强调了说话者年龄、地方口音及测试集选择对基准测试结论的影响。

0 人收藏 0 人点赞
#speech-recognition

将转录策略作为潜在变量:通过词级时间控制实现可调控的逐字ASR

arXiv cs.CL ↗ · 2026-07-22 缓存

本文针对ASR模型中转录风格这一未被控制的潜在变量,提出了一种方法,利用覆盖感知的解码器任务令牌实现可调控的逐字转录,并具备准确的词级时间信息,通过零样本跨语言迁移达到了较高的不流畅检测F1值。

0 人收藏 0 人点赞
#speech-recognition

@MSFTResearch:我们显著扩展了覆盖范围,支持:● 22 种新增语言,现已覆盖 38 个非洲国家…

X AI KOLs Following ↗ · 2026-07-21 缓存

微软研究院宣布扩大了其 ASR 模型的覆盖范围,新增了 22 种语言,覆盖 38 个非洲国家,并提供了新的数据集和测试样本。

0 人收藏 0 人点赞
#speech-recognition

@MSFTResearch: 今天,我们宣布PazaBench的第二个版本发布,这是我们用于评估跨非洲语言自动语音识别(ASR)模型的基准测试。

X AI KOLs Timeline ↗ · 2026-07-21 缓存

微软研究院宣布PazaBench的第二个版本发布,这是一个用于评估跨非洲语言自动语音识别模型的基准测试。

0 人收藏 0 人点赞
#speech-recognition

@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……

X AI KOLs Following ↗ · 2026-07-20 缓存

NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。

0 人收藏 0 人点赞
#speech-recognition

@Sumanth_077:用于构建实时语音AI Agent的开源框架!Pipecat是一个Python框架,用于编排音频、视频……

X AI KOLs Timeline ↗ · 2026-07-16 缓存

Pipecat是一个开源的Python框架,用于构建实时语音AI Agent,处理语音识别、文本转语音、对话逻辑,并支持多个AI服务提供商。

0 人收藏 0 人点赞
#speech-recognition

@Open_MOSS: MOSS-Transcribe-Diarize 在 @huggingface 上跻身热门模型之列。发布数周后,该模型已…

X AI KOLs Timeline ↗ · 2026-07-16 缓存

MOSS-Transcribe-Diarize 是一款具备多说话人分离和热词偏置功能的开源ASR模型,发布后在Hugging Face上走红。

0 人收藏 0 人点赞
#speech-recognition

@thesupermanmx: NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,而且成本为零。这真是太快了……

X AI KOLs Timeline ↗ · 2026-07-16 缓存

NVIDIA 开源了一个 600M 参数的模型,能够实时转录 40 种语言,延迟仅 80ms,支持从单一检查点进行多种语言转录,并内置标点和大小写功能。

0 人收藏 0 人点赞
#speech-recognition

推出 Real World VoiceEQ:衡量语音AI的拟人化质量

Hugging Face Blog ↗ · 2026-07-15 缓存

Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。

0 人收藏 0 人点赞
#speech-recognition

哪些语言最适合迁移到瓦尔皮里语?一项基于相似度的低资源语音识别研究

arXiv cs.CL ↗ · 2026-07-14 缓存

本文研究了低资源自动语音识别(ASR)中跨语言迁移的问题,针对瓦尔皮里语提出了一种结合声学与语言特征的相似度框架,以选择最优源语言。实验表明,像阿萨姆语和印地语这样声学相似的语言能显著降低词错误率和字符错误率。

0 人收藏 0 人点赞
#speech-recognition

Apple 新 SpeechAnalyzer API 与 Whisper 及前代产品的基准测试对比

Hacker News Top ↗ · 2026-07-13 缓存

Apple 的新 SpeechAnalyzer API 在英语设备端转录的准确性和速度上,显著优于其前代 SFSpeechRecognizer 和 OpenAI 的 Whisper 模型,该基准测试在 M2 Pro 机器上进行。新 API 在清晰语音上的词错误率为 2.12%,而 Whisper Small 为 3.74%,且运行速度快三倍。

0 人收藏 0 人点赞
#speech-recognition

分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃

arXiv cs.CL ↗ · 2026-07-13 缓存

本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。

0 人收藏 0 人点赞
#speech-recognition

是否有对言语障碍具有极高敏感度的AI?

Reddit r/ArtificialInteligence ↗ · 2026-07-12

一位用户寻求关于AI语音识别模型的建议,这些模型能够准确理解严重受损的言语,例如其患有唐氏综合症和自闭症、几乎没有语言能力的兄弟的言语,并指出当前像Whisper这样的系统无法识别。

0 人收藏 0 人点赞
#speech-recognition

@OpenBMB: 使用 VoxCPM 构建:Whispera — 您的本地 AI 语音助手 如果您的 AI 助手能够聆听、思考、记忆并……

X AI KOLs Timeline ↗ · 2026-07-11 缓存

Whispera 是一个基于 VoxCPM 的 Windows 本地实时语音助手,集成了 SenseVoice ASR、llama-server 本地 LLM 推理、VoxCPM 流式 TTS 和 Mem0 长期记忆,完全离线运行。

0 人收藏 0 人点赞
#speech-recognition

基于说话人日志引导的Qwen-ASR多语言双人对话语音自适应

arXiv cs.CL ↗ · 2026-07-10 缓存

本文介绍了为MLC-SLM 2026挑战赛设计的系统,该系统结合了说话人日志与微调后的Qwen-ASR,采用监督式全参数微调、合成语音上的LoRA以及GRPO强化学习,在最终评测集上实现了17.97的tcpMER。

0 人收藏 0 人点赞
#speech-recognition

基于音系激活映射的音素分割与识别

Hugging Face Daily Papers ↗ · 2026-07-10 缓存

本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。

0 人收藏 0 人点赞
#speech-recognition

基于梯度的语音到文本对齐方法,适用于任何ASR模型:从CTC到语音大语言模型

arXiv cs.CL ↗ · 2026-07-09 缓存

本文介绍了一种基于梯度的语音到文本对齐方法,适用于任何可微分的ASR模型,包括CTC、transducer、基于注意力的编码器-解码器以及语音大语言模型,无需训练或模型修改。

0 人收藏 0 人点赞
#speech-recognition

@MosiAI_Official: MOSS-Transcribe-Diarize-0.9B 现已在 @huggingface 上开源。采用端到端音频到结构化转录…

X AI KOLs Following ↗ · 2026-07-09 缓存

MOSS-Transcribe-Diarize-0.9B 是一个开源端到端音频理解模型,用于长篇幅多说话人转录、说话人识别和时间戳生成,由 Mosi AI 在 Apache 2.0 许可下发布。

0 人收藏 0 人点赞
#speech-recognition

@apivixtls: https://x.com/apivixtls/status/2074852993086976211

X AI KOLs Timeline ↗ · 2026-07-08 缓存

本文详细介绍了如何部署 Hermes AI Agent 框架,包括云服务器配置、安装、Telegram Bot 集成、图像识别和语音能力补充,以及接入逆向安全分析工作流。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈