Easper:一个用于语言记录的可访问ASR流水线
摘要
本文介绍了Easper,一个开源、无代码的ASR流水线,让田野语言学家可以直接从ELAN标注中对Whisper等模型进行微调,并评估了在瓦努阿图低资源语言上引导ASR的数据选择策略。
arXiv:2608.11629v1 公告类型:新
摘要:音频转写是语言记录中的关键瓶颈。虽然像Whisper这样的多语言自动语音识别(ASR)模型提供了解决方案,但田野语言学家往往缺乏使用这些模型的专业知识。我们提出了Easper,一个开源、无代码的工作流程,使语言学家能够通过云资源直接从ELAN标注中迭代微调ASR模型。部署ASR还带来一个冷启动问题:决定首先转写哪些录音以引导出一个准确的模型。使用Easper,我们在三种瓦努阿图语言(比斯拉马语、纳夫桑语、恩古纳语)上评估了转写优先级策略。我们按录音会话微调模型,比较在优先考虑声学清晰度与语言丰富性时的字符错误率轨迹。我们证明,优先选择词汇丰富的叙述并增加声学-语音重复,即使在嘈杂环境中,也能更快地提高转写质量。
查看缓存全文
缓存时间: 2026/08/13 15:27
# Easper:面向语言记录的易用ASR流水线 Source: https://arxiv.org/html/2608.11629 Mahmudi Dang Vylomova Thieberger ###### 摘要 音频转录是语言记录中的关键瓶颈。虽然像Whisper这样的多语言自动语音识别(ASR)模型提供了解决方案,但田野语言学家往往缺乏利用它们的专业知识。我们提出了Easper,一个开源、无代码的工作流,使语言学家能够通过云资源直接从ELAN标注迭代微调ASR模型。部署ASR
相似文章
转录儿童语音:ASR性能与获取可靠的正字法转写
这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。
@SarvamAI:我们开源两套评估印度语 ASR 的框架,并发布覆盖 22 种语言的完整评测指南。WER(…
SarvamAI 发布开源评估框架与指南,专为 22 种印度语言设计,解决传统 WER/CER 指标在该场景下的局限。
@MaxForAI: 如果你在做语音Agent,你应该试一下这个项目 来自南洋理工、新国立和上海 AI Lab的团队发布了:Mega-ASR 这个完全开源的ASR基于 Qwen3-ASR构建,目的是打破长期困扰ASR的在嘈杂、混响或其他受损现实环境中表现的瓶颈…
南洋理工、新国立和上海 AI Lab 联合发布 Mega-ASR,一个基于 Qwen3-ASR 构建的完全开源 ASR 模型,通过 Voices-in-the-Wild-2M 数据集和渐进式声学到语义优化,在真实世界嘈杂环境中实现最高 30% 的相对词错误率下降,且仅 1.7B 参数可在消费级硬件高效推理。
面向数据高效的代码切换ASR的强化学习
介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。
使用滚动缓冲区和单语模型的实时多语言ASR [P]
一种基于路由的实时多语言ASR方法,使用较小的单语模型并配备回滚机制来处理语言切换,在跨语句代码切换上实现了约13%的词错误率,并将系统开源。