@aigclink: 阿里通义实验室最新发布了款ASR:Fun-ASR 1.5,核心能力:方言工业级可用 单模型即可无缝覆盖30种语言、汉语七大方言体系及20+ 地方口音,古诗词吟诵也能精准转写 典型方言场景CER相对上代下降56.2%,有5种方言准确率破 9…
摘要
阿里通义实验室发布Fun-ASR 1.5,单模型覆盖30种语言、汉语七大方言及20余种地方口音,典型方言场景字错率较上代下降56.2%,5种方言准确率突破90%。
查看缓存全文
缓存时间: 2026/04/21 08:26
阿里通义实验室最新发布了款ASR:Fun-ASR 1.5,核心能力:方言工业级可用 单模型即可无缝覆盖30种语言、汉语七大方言体系及20+ 地方口音,古诗词吟诵也能精准转写 典型方言场景CER相对上代下降56.2%,有5种方言准确率破 90%,15种超过 80%
相似文章
@MaxForAI: 如果你在做语音Agent,你应该试一下这个项目 来自南洋理工、新国立和上海 AI Lab的团队发布了:Mega-ASR 这个完全开源的ASR基于 Qwen3-ASR构建,目的是打破长期困扰ASR的在嘈杂、混响或其他受损现实环境中表现的瓶颈…
南洋理工、新国立和上海 AI Lab 联合发布 Mega-ASR,一个基于 Qwen3-ASR 构建的完全开源 ASR 模型,通过 Voices-in-the-Wild-2M 数据集和渐进式声学到语义优化,在真实世界嘈杂环境中实现最高 30% 的相对词错误率下降,且仅 1.7B 参数可在消费级硬件高效推理。
@lxfater: 网易有道开源了子曰4大模型,27B参数内,数理 SOTA 但真正让我觉得有趣的是它那个语音功能!! 克隆个声音不稀奇,ElevenLabs 早能做 但它们都有个通病,跨语种会串口音 拿你的中文声音去说日语,它带着一口中国腔,一听就是外国人…
网易有道开源了子曰4大模型,27B参数,数理性能达到SOTA;其语音功能支持3秒跨语言声音克隆,14种语言且无口音问题,同时开源了全场景智能体龙虾。
@seclink: 小米的发展势头很猛啊! 2026-06-02 mimo-v2.5-asr 发布 模型简介: 中英双语 + 方言: 持中英双语识别及吴语、粤语、闽南语、四川话等多种中国方言,以及中英混合代码切换 歌词转写: 高精度中英文歌词转写,支持人声与…
小米发布 MiMo 系列模型更新,包括 mimo-v2.5-asr(支持多种方言和歌词转写)、mimo-v2.5-pro(万亿参数、1M上下文)、mimo-v2.5(全模态感知)、以及 TTS 系列模型,显著提升了 Agent 性能和复杂声学场景下的识别能力。
@FeitengLi: 其实这些问题都能很好的解决了 1. 扔掉 whisper,换 ASR 模型,Qwen3-ASR 就很不错幻觉很少、也有一些别的ASR选择,whisper 幻觉多也要求 30s片段,Qwen3-ASR 塞更长的音频识别越准确,最大支持 20…
推荐使用Qwen3-ASR替代Whisper以减少幻觉,使用LattifAI工具进行精确的音文本对齐和字幕生成,并介绍自己的OmniVAD-Kit项目用于语音活动检测。
@FinanceYF5: OpenAI 新语音模型 Bidi 1 首测曝光 双向语音设计,你说的同时它在听,中途打断可立刻切换任务,不再因你停顿就抢话。 还能实时翻译,上下文记忆也比现在的 Advanced Voice 强很多。 目前已小范围推送,ChatGPT …
OpenAI 新语音模型 Bidi 1 首测曝光,支持双向语音设计、实时翻译和更强的上下文记忆,目前已小范围推送至 ChatGPT。