标签
本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练,在英语和意大利语任务上进行了评估,在降低通信成本的同时取得了具有竞争力的词错误率。
Earnings25是一个500小时的基准,用于评估金融财报电话会议中的自动语音识别,提供对齐的转录文本和结构化元数据,支持考虑说话人和行业的评估。
本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。
COALA是一个鲁棒的上下文偏置框架,用于自动语音识别(ASR),它利用对比正则化器和偏置分数估计来提升从大规模偏置列表中识别领域特定实体的准确性。在LibriSpeech上的实验表明其持续表现出色。
本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。
介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。
本文提出联合语音-文本交错预训练(JSTIP),这是一种预训练策略,通过构建词级和段级交错的语音-文本序列来提高ASR实体准确率并缩小语音与文本之间的模态差距,在领域自适应和零样本语音问答上展示了有竞争力的性能。
本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。
介绍了一个用于评估班巴拉语儿童阅读的开源ASR系统,包括现场数据收集、基准构建、模型适配和课堂验证,实现了显著的词错误率降低。
本文提出了一种基于认证的自动语音识别机制,采用双门诊断流水线(Two-Sided Atomic Audit 和 Rank-Based Tournament)来提供认证鲁棒性,并在多种架构上实现了词错误率高达55%的相对降低。
本文对印度语言的精神病学访谈中的多语言临床ASR系统进行了系统性审计,并提出了SamaVaani,一种统一的去偏技术,旨在提升跨人口群体的性能与公平性。
本文系统性地实证研究了针对《古兰经》自动语音识别(ASR)的预训练Transformer模型(Wav2Vec2.0、HuBERT、XLS-R)微调,在EveryAyah子集上实现了0.08的词错误率(WER),并将训练时间从140小时减少到40小时,其中Wav2Vec2-XLSR-53提供了最佳表示。
介绍了MultiClin,一个用于评估多脚本临床环境中ASR性能的基准测试,结果表明脚本统一化比传统的单一参考指标更能提升性能。
本文解决了多模态大语言模型在ASR中的口语遵循问题,提出了一种软提示方法和新颖的度量标准来量化语言违规。它评估了三种缓解策略——零样本提示、监督微调和思维链推理——在多种语言上的效果,以提高转录保真度。
本文使用音素错误率和新的Soft PER指标,评估了基于音素的自动语音识别系统(特别是WhisperIPA和ZIPA)中的人口统计和口音偏见,揭示了跨语言和群体的持续差异。
ServiceNow AI 发布了一个基准测试和数据集,用于评估自动语音识别(ASR)在跨四种语言对(西班牙语-英语、法语-英语、加拿大法语-英语、德语-英语)的企业HR和IT场景中的代码切换语音上的表现,发现当前前沿ASR模型在代码切换方面仍存在困难,导致错误率较高。
本文介绍了Semantic Gambit攻击,它利用LLM预测为自动语音识别系统生成实时对抗扰动,相较先前方法实现了三倍的词错误率提升。
本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。
SCRIBE 是一个用于自动语音识别的诊断评估框架,为印度语言提供分类错误分解,并发布了 Hindi、Malayalam 和 Kannada 的基准和开源权重富转录模型。
FormalASR 提出了两个紧凑的端到端模型,可直接将中文口语转录为正式书面文本,显著降低错误率,并消除了对单独 LLM 后处理阶段的需求,实现了轻量级的设备端部署。