automatic-speech-recognition

标签

Cards List
#automatic-speech-recognition

SpeechLLM与联邦学习结合实现端到端ASR:英语和意大利语案例研究

arXiv cs.CL · 5天前 缓存

本文首次系统研究了基于SpeechLLM的端到端ASR系统的联邦训练,在英语和意大利语任务上进行了评估,在降低通信成本的同时取得了具有竞争力的词错误率。

0 人收藏 0 人点赞
#automatic-speech-recognition

Earnings25:面向金融领域、涵盖500小时的综合性语音基准

arXiv cs.CL · 6天前 缓存

Earnings25是一个500小时的基准,用于评估金融财报电话会议中的自动语音识别,提供对齐的转录文本和结构化元数据,支持考虑说话人和行业的评估。

0 人收藏 0 人点赞
#automatic-speech-recognition

从多语言流式ASR骨干网络到肯尼亚语系系统:面向基库尤语、多洛语和卡伦津语的Nemotron 3.5数据驱动适配

arXiv cs.CL · 2026-07-22 缓存

本文介绍了一项工程研究,将NVIDIA Nemotron 3.5 ASR Streaming 0.6B适配到基库尤语、多洛语和卡伦津语中。通过语料库审计、规范化、流式评估等数据驱动技术,在内部测试集上分别实现了基库尤语42.97%和多洛语33.98%的词错误率(WER)。

0 人收藏 0 人点赞
#automatic-speech-recognition

COALA:通过对比正则化器和偏置分数估计实现的鲁棒上下文语音增强语言建模用于ASR

arXiv cs.CL · 2026-07-10 缓存

COALA是一个鲁棒的上下文偏置框架,用于自动语音识别(ASR),它利用对比正则化器和偏置分数估计来提升从大规模偏置列表中识别领域特定实体的准确性。在LibriSpeech上的实验表明其持续表现出色。

0 人收藏 0 人点赞
#automatic-speech-recognition

利用多模态特征融合联合改进印度语言中的方言识别与语音识别

arXiv cs.CL · 2026-07-07 缓存

本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。

0 人收藏 0 人点赞
#automatic-speech-recognition

面向数据高效的代码切换ASR的强化学习

arXiv cs.CL · 2026-07-07 缓存

介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。

0 人收藏 0 人点赞
#automatic-speech-recognition

重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练

arXiv cs.CL · 2026-07-03 缓存

本文提出联合语音-文本交错预训练(JSTIP),这是一种预训练策略,通过构建词级和段级交错的语音-文本序列来提高ASR实体准确率并缩小语音与文本之间的模态差距,在领域自适应和零样本语音问答上展示了有竞争力的性能。

0 人收藏 0 人点赞
#automatic-speech-recognition

从单语到多语:评估Mamba在南非语言中的ASR性能

arXiv cs.CL · 2026-07-03 缓存

本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。

0 人收藏 0 人点赞
#automatic-speech-recognition

构建用于儿童阅读训练与评估的ASR解决方案

arXiv cs.CL · 2026-07-01 缓存

介绍了一个用于评估班巴拉语儿童阅读的开源ASR系统,包括现场数据收集、基准构建、模型适配和课堂验证,实现了显著的词错误率降低。

0 人收藏 0 人点赞
#automatic-speech-recognition

是什么来着?自动语音识别的认证鲁棒性

arXiv cs.LG · 2026-06-29 缓存

本文提出了一种基于认证的自动语音识别机制,采用双门诊断流水线(Two-Sided Atomic Audit 和 Rank-Based Tournament)来提供认证鲁棒性,并在多种架构上实现了词错误率高达55%的相对降低。

0 人收藏 0 人点赞
#automatic-speech-recognition

SamaVaani:印度语言多语言临床ASR的审计与去偏

arXiv cs.CL · 2026-06-26 缓存

本文对印度语言的精神病学访谈中的多语言临床ASR系统进行了系统性审计,并提出了SamaVaani,一种统一的去偏技术,旨在提升跨人口群体的性能与公平性。

0 人收藏 0 人点赞
#automatic-speech-recognition

针对《古兰经》语音识别的预训练Transformer模型比较研究:语音表示、标签格式与数据集构成

arXiv cs.AI · 2026-06-20 缓存

本文系统性地实证研究了针对《古兰经》自动语音识别(ASR)的预训练Transformer模型(Wav2Vec2.0、HuBERT、XLS-R)微调,在EveryAyah子集上实现了0.08的词错误率(WER),并将训练时间从140小时减少到40小时,其中Wav2Vec2-XLSR-53提供了最佳表示。

0 人收藏 0 人点赞
#automatic-speech-recognition

多脚本情境下的重要性:临床环境中的ASR评估

arXiv cs.CL · 2026-06-17 缓存

介绍了MultiClin,一个用于评估多脚本临床环境中ASR性能的基准测试,结果表明脚本统一化比传统的单一参考指标更能提升性能。

0 人收藏 0 人点赞
#automatic-speech-recognition

你在说我的语言吗?关于多模态大语言模型中的口语遵循问题

arXiv cs.CL · 2026-06-17 缓存

本文解决了多模态大语言模型在ASR中的口语遵循问题,提出了一种软提示方法和新颖的度量标准来量化语言违规。它评估了三种缓解策略——零样本提示、监督微调和思维链推理——在多种语言上的效果,以提高转录保真度。

0 人收藏 0 人点赞
#automatic-speech-recognition

基于音素的自动语音识别系统中的偏见评估:对IPA转录模型的分析

arXiv cs.CL · 2026-06-11 缓存

本文使用音素错误率和新的Soft PER指标,评估了基于音素的自动语音识别系统(特别是WhisperIPA和ZIPA)中的人口统计和口音偏见,揭示了跨语言和群体的持续差异。

0 人收藏 0 人点赞
#automatic-speech-recognition

语音助手能处理双语客户吗?前沿ASR在代码切换语音上的基准测试

Hugging Face Blog · 2026-06-09 缓存

ServiceNow AI 发布了一个基准测试和数据集,用于评估自动语音识别(ASR)在跨四种语言对(西班牙语-英语、法语-英语、加拿大法语-英语、德语-英语)的企业HR和IT场景中的代码切换语音上的表现,发现当前前沿ASR模型在代码切换方面仍存在困难,导致错误率较高。

0 人收藏 0 人点赞
#automatic-speech-recognition

聆听未言之语:针对声学对抗攻击的语言模型先验

arXiv cs.LG · 2026-06-08 缓存

本文介绍了Semantic Gambit攻击,它利用LLM预测为自动语音识别系统生成实时对抗扰动,相较先前方法实现了三倍的词错误率提升。

0 人收藏 0 人点赞
#automatic-speech-recognition

迈向类人交互式语音识别:基于智能体修正与语义评估

Hugging Face Daily Papers · 2026-05-28 缓存

本文介绍了 Agentic ASR,一种交互式语音识别框架,通过语义修正和基于推理的编辑,利用多轮优化来减少语义错误。同时,提出了一种新的句子级语义错误率指标以及一个用于基准测试的交互式模拟系统。

0 人收藏 0 人点赞
#automatic-speech-recognition

SCRIBE:面向Indic ASR的诊断评估与富转录模型

arXiv cs.CL · 2026-05-21 缓存

SCRIBE 是一个用于自动语音识别的诊断评估框架,为印度语言提供分类错误分解,并发布了 Hindi、Malayalam 和 Kannada 的基准和开源权重富转录模型。

0 人收藏 0 人点赞
#automatic-speech-recognition

FormalASR: 端到端中文口语到正式文本转换

arXiv cs.CL · 2026-05-20 缓存

FormalASR 提出了两个紧凑的端到端模型,可直接将中文口语转录为正式书面文本,显著降低错误率,并消除了对单独 LLM 后处理阶段的需求,实现了轻量级的设备端部署。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈