@seclink: 英文干净朗读已经商品化;2026 年 ASR 的难处是叠音里认对人、流式里敢不敢落字、方言和术语别装看不见,以及语音塔怎么剪还不把 Speech LLM 拖垮。

X AI KOLs Timeline 新闻

摘要

英文干净朗读已商品化,但2026年ASR面临叠音识别、流式落字、方言术语处理等挑战,以及如何优化语音塔以避免拖垮Speech LLM。

英文干净朗读已经商品化;2026 年 ASR 的难处是叠音里认对人、流式里敢不敢落字、方言和术语别装看不见,以及语音塔怎么剪还不把 Speech LLM 拖垮。
查看原文

相似文章

@aigclink: 阿里通义实验室最新发布了款ASR:Fun-ASR 1.5,核心能力:方言工业级可用 单模型即可无缝覆盖30种语言、汉语七大方言体系及20+ 地方口音,古诗词吟诵也能精准转写 典型方言场景CER相对上代下降56.2%,有5种方言准确率破 9…

X AI KOLs Timeline

阿里通义实验室发布Fun-ASR 1.5,单模型覆盖30种语言、汉语七大方言及20余种地方口音,典型方言场景字错率较上代下降56.2%,5种方言准确率突破90%。

@MaxForAI: 如果你在做语音Agent,你应该试一下这个项目 来自南洋理工、新国立和上海 AI Lab的团队发布了:Mega-ASR 这个完全开源的ASR基于 Qwen3-ASR构建,目的是打破长期困扰ASR的在嘈杂、混响或其他受损现实环境中表现的瓶颈…

X AI KOLs Timeline

南洋理工、新国立和上海 AI Lab 联合发布 Mega-ASR,一个基于 Qwen3-ASR 构建的完全开源 ASR 模型,通过 Voices-in-the-Wild-2M 数据集和渐进式声学到语义优化,在真实世界嘈杂环境中实现最高 30% 的相对词错误率下降,且仅 1.7B 参数可在消费级硬件高效推理。