@SamuelZengML: 语音识别很容易——直到你要求它永远倾听。今日我们开源 Audio8 ASR Infinite:超低延迟…
摘要
开源 Audio8 ASR Infinite,一种具有超低延迟、无限制音频支持、24/7转录和内置语义轮次检测的语音识别工具,据称是流式ASR的新技术标杆。
语音识别很容易——直到你要求它永远倾听。
今日我们开源 Audio8 ASR Infinite:
超低延迟、无限制音频、24/7转录、无漂移。
内置语义轮次检测,使其像人耳一样倾听。
流式ASR的新技术标杆。https://t.co/gfxAwpxRb0
查看缓存全文
缓存时间: 2026/09/23 20:11
语音识别很简单——直到你要求它永不停歇地聆听。
今天,我们开源了 Audio8 ASR Infinite:
超低延迟,无限音频,全天候转录,无漂移。
内置的语义轮次检测让它如同人耳般持续聆听。
流式ASR的最新技术标杆。https://t.co/gfxAwpxRb0
相似文章
Edge0/Audio8-ASR-Infinite
Audio8 ASR Infinite 是一款原生流式语音识别模型,具有可选音频时钟和可配置转录延迟,支持无限长度音频转录且无漂移。
@SamuelZengML:开源ASR刚刚登顶。Audio8 ARK-ASR-3B现以4.76的平均WER在@huggingface Open ASR排行榜上排名第一,……
Audio8的开源ARK-ASR-3B以4.76的平均WER在Hugging Face Open ASR排行榜上夺得第一,同时其0.6B模型也进入前五,展示了一个有竞争力的开源语音技术栈。
@XieZhifei14110: 别再使用Whisper做语音识别了!开源Mega-ASR——首个全场景SOTA工业级ASR模型,专为……
开源Mega-ASR,一个全场景SOTA工业级ASR模型,专为远场、噪声等复杂音频环境设计,在真实世界基准测试中比现有开源和闭源模型性能高出10-30%。
@MaxForAI: 如果你在做语音Agent,你应该试一下这个项目 来自南洋理工、新国立和上海 AI Lab的团队发布了:Mega-ASR 这个完全开源的ASR基于 Qwen3-ASR构建,目的是打破长期困扰ASR的在嘈杂、混响或其他受损现实环境中表现的瓶颈…
南洋理工、新国立和上海 AI Lab 联合发布 Mega-ASR,一个基于 Qwen3-ASR 构建的完全开源 ASR 模型,通过 Voices-in-the-Wild-2M 数据集和渐进式声学到语义优化,在真实世界嘈杂环境中实现最高 30% 的相对词错误率下降,且仅 1.7B 参数可在消费级硬件高效推理。
@SamuelZengML:我们由衷地感到惊讶和感激,看到我们最新的开源模型 Audio8/Audio8-TTS-Preview-0.6b 在……上排名第一
Audio8 的开源 TTS 模型在 Hugging Face 的 TTS 趋势榜上排名第一,总榜排名第十,团队对此表示感谢,并计划继续改进。