标签
本文研究了低资源自动语音识别(ASR)中跨语言迁移的问题,针对瓦尔皮里语提出了一种结合声学与语言特征的相似度框架,以选择最优源语言。实验表明,像阿萨姆语和印地语这样声学相似的语言能显著降低词错误率和字符错误率。
本文提出使用Group Relative Policy Optimization(GRPO)来适配基于LLM的ASR模型到监管领域,仅使用合成语音,相较于监督微调实现了40-45%的相对词错误率降低。
本文介绍了一种基于梯度的语音到文本对齐方法,适用于任何可微分的ASR模型,包括CTC、transducer、基于注意力的编码器-解码器以及语音大语言模型,无需训练或模型修改。
MOSS-Transcribe-Diarize-0.9B 是一个开源端到端音频理解模型,用于长篇幅多说话人转录、说话人识别和时间戳生成,由 Mosi AI 在 Apache 2.0 许可下发布。
audio.cpp更新引入了流式支持和四个ASR/STT模型(Nemotron 3.5、Higgs Audio STT、VibeVoice ASR、Hviske ASR),采用原生C++/GGML实现,速度比Python快高达2.41倍,词错误率(WER)和显存占用具有竞争力。
本研究探讨了从僧伽罗语到迪维希语的跨语言迁移学习在自动语音识别中的应用,与仅使用迪维希语的基线相比,词错误率显著降低。
本文重新审视了在现代端到端ASR系统中语言模型困惑度与ASR词错误率之间的经典关系,发现虽然外部语言模型仍然能提升WER,但对数-对数线性关系仍然成立,但受到编码器-解码器模型中内部语言建模的影响。
S-DiverSe 是一个3.2小时的西班牙语音语料库,来自22位患有神经系统疾病(肌萎缩侧索硬化症、帕金森病、中风)的说话者,旨在支持病理语音的ASR评估。基线实验表明,在该领域,启发式后处理优于微调。
介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。
本文描述了 NAVER LABS Europe 参与 IWSLT 2026 指令跟随短轨道的提交方案。该方案改进了他们之前获胜的系统,使用了仅基于 ASR 数据训练的新语音投影器(SpeechMapper),并通过合成 SQA 数据集(fakACL)增强了训练。最终系统在使用较弱 LLM 骨干的情况下,在受约束轨道中并列第一。
本文提出联合语音-文本交错预训练(JSTIP),这是一种预训练策略,通过构建词级和段级交错的语音-文本序列来提高ASR实体准确率并缩小语音与文本之间的模态差距,在领域自适应和零样本语音问答上展示了有竞争力的性能。
本文介绍了一个针对构音障碍说话者的个性化ASR系统,通过对Whisper基础模型进行微调,仅使用22.5小时的适应数据加上8.8小时的用户纠正,实现了9.7%的词错误率。结果表明,个性化微调可以显著提升基础ASR模型对构音障碍语音的效果,并且通过部署的移动应用实现了真实世界的数据收集。
本文提出了一种基于音调条件的课程学习框架,用于低资源班图语语音识别,结合了混合难度评分、门控适配器和分阶段课程训练。对六种南部班图语的评估显示,W2V-BERT在恩古尼语上优于Whisper,而Whisper在索托-茨瓦纳语上表现更好。
本文提出了一种面向非典型ASR的双参考基准测试方法,同时使用逐字转录和意图转录对11个ASR模型在口吃语音上进行评估,强调了根据用例选择合适参考转录的重要性。
本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。
Whisperian是一款Android应用,允许用户使用麦克风配合本地自动语音识别(ASR)模型,且该应用可在Play Store获取。
本文对印度语言的精神病学访谈中的多语言临床ASR系统进行了系统性审计,并提出了SamaVaani,一种统一的去偏技术,旨在提升跨人口群体的性能与公平性。
本文介绍了FBK在IWSLT 2026指令跟随共享任务中的提交,开发了用于短时和长时语音指令跟随的SpeechLLMs,探索了分割方法,并通过固定30秒分割实现了稳健的长时性能。
提出G-SPIN,一个轻量级框架,结合音素图建模与上下文语言理解来纠正ASR错误。使用GNN生成音素合理的候选词元,MLM进行局部评分,LLM进行最终重新排序,所有操作均在推理时进行。
介绍FFASR排行榜,这是一个开放、社区驱动的基准测试,用于在真实远场声学条件下评估自动语音识别模型,突显了近场和远场场景之间的显著性能差距。