Mega-ASR: 通过扩展真实世界声学模拟实现 In-the-wild^2 语音识别

Hugging Face Daily Papers 论文

摘要

Mega-ASR 提出通过扩展真实世界声学模拟来改进在极具挑战性的野外条件下的自动语音识别,旨在缩小实验室与真实环境之间的性能差距。

尽管自动语音识别(ASR)和大规模音频-语言模型取得了快速进展,但在真实世界环境中的鲁棒识别仍然受到“声学鲁棒性瓶颈”的限制:模型常常在严重的组合性失真下失去声学基础,并产生遗漏或幻觉。我们提出 Mega-ASR,这是一个统一的野外ASR框架,结合了可扩展的复合数据构建与渐进式声学到语义优化。我们引入了 Voices-in-the-Wild-2M,覆盖7种经典声学现象和54种物理上合理的组合场景,并采用声学到语义渐进式监督微调和双粒度词错误率门控策略优化来训练 Mega-ASR。大量实验表明,Mega-ASR 在恶劣条件下的ASR基准测试中相比先前最先进的系统具有显著优势(在 VOiCES R4-B-F 上为45.69% vs. 54.01%,在 NOIZEUS Sta-0 上为21.49% vs. 29.34%)。在复杂的组合声学场景中,Mega-ASR 进一步在强大的开源和闭源基线上实现了超过30%的相对词错误率降低,为野外鲁棒ASR建立了一种可扩展的范式。
查看原文
查看缓存全文

缓存时间: 2026/05/21 10:10

论文页面 - Mega-ASR:通过扩展真实世界声学模拟实现野外²语音识别

来源:https://huggingface.co/papers/2605.19833
在你的 agent 中获取此论文:

hf papers read 2605\.19833

还没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2605.19833 以将其链接到此页面。

引用此论文的数据集0

无数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.19833 以将其链接到此页面。

引用此论文的 Space0

无 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2605.19833 以将其链接到此页面。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

@MaxForAI: 如果你在做语音Agent,你应该试一下这个项目 来自南洋理工、新国立和上海 AI Lab的团队发布了:Mega-ASR 这个完全开源的ASR基于 Qwen3-ASR构建,目的是打破长期困扰ASR的在嘈杂、混响或其他受损现实环境中表现的瓶颈…

X AI KOLs Timeline

南洋理工、新国立和上海 AI Lab 联合发布 Mega-ASR,一个基于 Qwen3-ASR 构建的完全开源 ASR 模型,通过 Voices-in-the-Wild-2M 数据集和渐进式声学到语义优化,在真实世界嘈杂环境中实现最高 30% 的相对词错误率下降,且仅 1.7B 参数可在消费级硬件高效推理。

如何利用合成语音构建基于LLM的ASR系统?

arXiv cs.CL

本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。

FFASR排行榜发布:真实场景下的ASR评测

Hugging Face Blog

介绍FFASR排行榜,这是一个开放、社区驱动的基准测试,用于在真实远场声学条件下评估自动语音识别模型,突显了近场和远场场景之间的显著性能差距。