Easper:一个用于语言记录的可访问ASR流水线

arXiv cs.CL 论文

摘要

本文介绍了Easper,一个开源、无代码的ASR流水线,让田野语言学家可以直接从ELAN标注中对Whisper等模型进行微调,并评估了在瓦努阿图低资源语言上引导ASR的数据选择策略。

arXiv:2608.11629v1 公告类型:新 摘要:音频转写是语言记录中的关键瓶颈。虽然像Whisper这样的多语言自动语音识别(ASR)模型提供了解决方案,但田野语言学家往往缺乏使用这些模型的专业知识。我们提出了Easper,一个开源、无代码的工作流程,使语言学家能够通过云资源直接从ELAN标注中迭代微调ASR模型。部署ASR还带来一个冷启动问题:决定首先转写哪些录音以引导出一个准确的模型。使用Easper,我们在三种瓦努阿图语言(比斯拉马语、纳夫桑语、恩古纳语)上评估了转写优先级策略。我们按录音会话微调模型,比较在优先考虑声学清晰度与语言丰富性时的字符错误率轨迹。我们证明,优先选择词汇丰富的叙述并增加声学-语音重复,即使在嘈杂环境中,也能更快地提高转写质量。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:27

# Easper:面向语言记录的易用ASR流水线
Source: https://arxiv.org/html/2608.11629
Mahmudi Dang Vylomova Thieberger

###### 摘要

音频转录是语言记录中的关键瓶颈。虽然像Whisper这样的多语言自动语音识别(ASR)模型提供了解决方案,但田野语言学家往往缺乏利用它们的专业知识。我们提出了Easper,一个开源、无代码的工作流,使语言学家能够通过云资源直接从ELAN标注迭代微调ASR模型。部署ASR

相似文章

转录儿童语音:ASR性能与获取可靠的正字法转写

arXiv cs.CL

这篇论文评估了九种ASR模型(Whisper、Parakeet、Wav2Vec2)在荷兰语儿童语音数据集JASMIN和DART上的表现,发现微调后的Whisper-medium取得了最佳性能(在JASMIN上WER为5.54%,在DART上为70.37%)。它还提出了一种选择方法,能够以高精度自动识别发音正确的录音片段,从而减少人工验证的需求。

@MaxForAI: 如果你在做语音Agent,你应该试一下这个项目 来自南洋理工、新国立和上海 AI Lab的团队发布了:Mega-ASR 这个完全开源的ASR基于 Qwen3-ASR构建,目的是打破长期困扰ASR的在嘈杂、混响或其他受损现实环境中表现的瓶颈…

X AI KOLs Timeline

南洋理工、新国立和上海 AI Lab 联合发布 Mega-ASR,一个基于 Qwen3-ASR 构建的完全开源 ASR 模型,通过 Voices-in-the-Wild-2M 数据集和渐进式声学到语义优化,在真实世界嘈杂环境中实现最高 30% 的相对词错误率下降,且仅 1.7B 参数可在消费级硬件高效推理。