asr

标签

Cards List
#asr

半监督联邦ASR的实用方案:在线伪标签与服务器更新稳定化

arXiv cs.LG · 9小时前 缓存

本文提出了一种半监督联邦ASR的实用方案,采用在线伪标签和服务器更新稳定化,在域内和跨域设置中均展示了相对于先前方法的显著改进。

0 人收藏 0 人点赞
#asr

Bairong系统在MLC-SLM 2026中:用于多语言对话语音理解的动态问题感知证据路由

arXiv cs.CL · 昨天 缓存

Bairong系统提出了一种用于多语言对话语音问答的动态问题感知证据路由方法,在MLC-SLM 2026挑战赛中通过有效整合转录和音频证据实现了性能提升。

0 人收藏 0 人点赞
#asr

总词错误率(WER)在语音代理生产环境中毫无用处

Reddit r/AI_Agents · 2天前

文章强调了聚合词错误率(WER)指标如何未能捕捉语音代理生产环境中的关键错误,如银行代码误识别和多语言语音,因此需要为银行和催收等实际应用进行逐字段跟踪。

0 人收藏 0 人点赞
#asr

@svpino: 这个新模型做了一件很酷的事:它能在你说话时将语音转换为文本。这与其他所有a…

X AI KOLs Timeline · 2天前 缓存

R2T2 是一个低延迟、高精度的实时语音识别模型,它以小块处理音频并直接提交文本,无需修改,适用于实时字幕和翻译等应用。

0 人收藏 0 人点赞
#asr

稳定性与速度:为语音智能体时代重新思考ASR

Reddit r/artificial · 5天前

文章探讨了语音智能体中ASR对稳定性的需求胜过速度,讨论了集成等待/确认机制以增强可靠性的'Confucius r2t2'模型。

0 人收藏 0 人点赞
#asr

T-SANDHI:一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,采用解耦混合注入

arXiv cs.CL · 6天前 缓存

该论文提出了T-SANDHI,一种面向低资源Taiwanese Hokkien语音识别的声调变调感知自适应网络,它通过显式解耦声调变化来在Whisper骨干网络基础上提高准确性。

0 人收藏 0 人点赞
#asr

@rohanpaul_ai:语音代理应逐步处理语音,但仅对已提交的文本采取行动,因为快速转录如果修改文本……

X AI KOLs Following · 6天前 缓存

网易有道开源了Confucius4-R2T2,这是一款用于语音代理的流式ASR模型,它逐步处理语音并仅输出已提交的文本,以防止状态损坏。

0 人收藏 0 人点赞
#asr

HN上展示:Nari Qwen3-TTS 和 Qwen3-ASR – 高准确率、低延迟和低成本

Hacker News Top · 2026-09-14 缓存

Nari Labs 推出 Qwen3-TTS 和 Qwen3-ASR 模型,在免费公开测试中提供高准确率、低延迟和成本效益,同时提供优化的 API 和服务用于生产部署。

0 人收藏 0 人点赞
#asr

并非所有语音都是意图:用于ASR后误唤醒的自适应自校正推理层

arXiv cs.CL · 2026-09-14 缓存

本文介绍了ASCIL,一个后ASR框架,它根据用户反馈和上下文信号进行调整,以纠正AI助手中的误唤醒激活,在低延迟下实现了显著的错误减少。

0 人收藏 0 人点赞
#asr

什么算是错误?在Quran记忆抄本中标注诵读事件

arXiv cs.CL · 2026-09-14 缓存

该论文报告了对Quran诵读抄本的人工标注,以区分错误、重复和修复,并由评估器对标签和位置进行评分,初步评估编码代理显示高性能。

0 人收藏 0 人点赞
#asr

@seclink: 英文干净朗读已经商品化;2026 年 ASR 的难处是叠音里认对人、流式里敢不敢落字、方言和术语别装看不见,以及语音塔怎么剪还不把 Speech LLM 拖垮。

X AI KOLs Timeline · 2026-09-12

英文干净朗读已商品化,但2026年ASR面临叠音识别、流式落字、方言术语处理等挑战,以及如何优化语音塔以避免拖垮Speech LLM。

0 人收藏 0 人点赞
#asr

Orukeet,基于Parakeet的新语音识别模型

Reddit r/LocalLLaMA · 2026-09-11 缓存

Orukeet 是基于 NVIDIA Parakeet 构建的 25 种语言语音识别器,采用拟合的 Gabor 核替代编码器滤波器,在大多数基准测试中性能超越基础模型。

0 人收藏 0 人点赞
#asr

希腊歌曲自动歌词转录:Whisper适配中的规模和任务组合效应

arXiv cs.CL · 2026-09-11 缓存

本文介绍了首个针对希腊歌曲自动歌词转录的基准,表明通过多任务学习和两阶段训练适配Whisper,达到了27.2%的词错误率,显著优于零样本基线。

0 人收藏 0 人点赞
#asr

netease-youdao/Confucius4-R2T2

Hugging Face Models Trending · 2026-09-10 缓存

Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。

0 人收藏 0 人点赞
#asr

利用细粒度错误校正优化咨询服务中的韩语语音识别

arXiv cs.CL · 2026-09-10 缓存

本文介绍了DasanCallDial,一个针对对话级ASR错误校正的大规模韩语基准数据集,并提出了DCSC框架,在纯文本后编辑中达到了最先进的性能。

0 人收藏 0 人点赞
#asr

Dual-Form ASR:面向中文语音识别的语义感知逆文本规范化

arXiv cs.CL · 2026-09-04 缓存

本文提出Dual-Form ASR框架,通过配对监督和序列级目标,整合了口语形式自动语音识别与语义感知的书面形式逆文本规范化,从而提升中文语音识别任务的性能。

0 人收藏 0 人点赞
#asr

微软发布VibeVoice-ASR-Streaming流式语音识别模型

Reddit r/LocalLLaMA · 2026-09-03 缓存

微软发布VibeVoice-ASR-Streaming,这是一款统一的流式自动语音识别模型,能够转录说话人身份,并支持自定义热词和10种语言。

0 人收藏 0 人点赞
#asr

真实世界ASR转录本中的主题匹配:基准测试与经验教训

arXiv cs.CL · 2026-09-02 缓存

本文对来自呼叫中心的真实世界ASR转录本上的主题匹配方法进行基准测试,发现使用自然语言描述的轻量级LLM匹配器优于正则表达式和嵌入方法。

0 人收藏 0 人点赞
#asr

VibeVoice-ASR-Streaming 技术报告

Hugging Face Daily Papers · 2026-09-02 缓存

VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。

0 人收藏 0 人点赞
#asr

Meta的Muse Voice Transcribe(阅读时长4分钟)

TLDR AI · 2026-09-02 缓存

Meta推出Muse Voice Transcribe,这是一款实时音频感知模型,在流式ASR和说话人分离方面表现出色,支持多语言,并在公开基准测试中领先。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈