word-error-rate

标签

Cards List
#word-error-rate

@svpino:在将音频发送到语音转文本模型之前降低噪声会带来巨大改进。语音隔离是…

X AI KOLs Timeline ↗ · 2天前 缓存

Krisp发布了一个开放基准和数据集,显示语音隔离将语音转文本模型的单词错误率降低了73%,在工作场所和呼叫中心录音中都有显著改进。

0 人收藏 0 人点赞
#word-error-rate

Canto: 专为现实世界打造的语音模型

Hacker News Top ↗ · 2026-09-17 缓存

Wispr Flow推出Canto,这是一款专为实时听写设计的语音模型,即使在嘈杂和复杂的现实环境中也能表现出色,并在与竞争对手的评估中达到了最低的字错误率。

0 人收藏 0 人点赞
#word-error-rate

@rohanpaul_ai: 喜欢这个,Meta的又一重大发布。推出Muse Voice Transcribe用于实时语音转写,具有最低的…

X AI KOLs Timeline ↗ · 2026-09-01 缓存

Meta发布了Muse Voice Transcribe,这是一款实时语音转文本模型,具有3.1%的词错误率和自适应流功能,使其适用于语音代理。

0 人收藏 0 人点赞
#word-error-rate

来自提示层级上下文的侧级词错误率无显著变化:一项针对生产口语历史语料库的预注册消融研究

arXiv cs.CL ↗ · 2026-09-01 缓存

这项预注册消融研究测试了生产语音转录工具中的提示层级上下文,发现侧级词错误率无显著变化,与先前关于提示条件化带来收益的报告相矛盾。

0 人收藏 0 人点赞
#word-error-rate

多语言预训练模型在尼泊尔自动语音识别中的比较分析

arXiv cs.CL ↗ · 2026-08-14 缓存

本文提出了一个受控基准,比较了六种多语言预训练ASR模型在尼泊尔语音上的表现,发现Whisper-Large-v3-Turbo和IndicWav2Vec表现最佳,而CTC解码器的推理速度最高可提升29倍。该研究为尼泊尔ASR提供了首个标准化的、考虑效率的参考数值。

0 人收藏 0 人点赞
#word-error-rate

如何识别新词:上下文偏置方法与语音大语言模型的比较

arXiv cs.CL ↗ · 2026-08-07 缓存

本文比较了上下文偏置方法和语音大语言模型在自动语音识别中识别罕见词和新词的表现,报告了在朗读语音和非朗读语音中词错误率的权衡。

0 人收藏 0 人点赞
#word-error-rate

房间混响和低信噪比对STT准确性的影响远大于模型大小

Reddit r/ArtificialInteligence ↗ · 2026-07-30

房间混响和环境中的低频噪音对语音转文字准确性的影响远大于模型大小的选择;前端音频预处理(如自适应谱减法)可以恢复被掩蔽的音素,并比升级模型后端更有效地降低词错误率。

0 人收藏 0 人点赞
#word-error-rate

Apple 新 SpeechAnalyzer API 与 Whisper 及前代产品的基准测试对比

Hacker News Top ↗ · 2026-07-13 缓存

Apple 的新 SpeechAnalyzer API 在英语设备端转录的准确性和速度上,显著优于其前代 SFSpeechRecognizer 和 OpenAI 的 Whisper 模型,该基准测试在 M2 Pro 机器上进行。新 API 在清晰语音上的词错误率为 2.12%,而 Whisper Small 为 3.74%,且运行速度快三倍。

0 人收藏 0 人点赞
#word-error-rate

重新审视现代端到端语音识别中语言模型困惑度与ASR词错误率之间的关系

arXiv cs.CL ↗ · 2026-07-08 缓存

本文重新审视了在现代端到端ASR系统中语言模型困惑度与ASR词错误率之间的经典关系,发现虽然外部语言模型仍然能提升WER,但对数-对数线性关系仍然成立,但受到编码器-解码器模型中内部语言建模的影响。

0 人收藏 0 人点赞
#word-error-rate

是什么来着?自动语音识别的认证鲁棒性

arXiv cs.LG ↗ · 2026-06-29 缓存

本文提出了一种基于认证的自动语音识别机制,采用双门诊断流水线(Two-Sided Atomic Audit 和 Rank-Based Tournament)来提供认证鲁棒性,并在多种架构上实现了词错误率高达55%的相对降低。

0 人收藏 0 人点赞
#word-error-rate

嘈杂环境中的语音代理

Reddit r/AI_Agents ↗ · 2026-06-16

一家语音公司训练了一个模型,该模型能消除噪声并识别主要说话者,在嘈杂环境中,领先的ASR模型的词错误率降低了50%。

0 人收藏 0 人点赞
#word-error-rate

超越单一真实标准:作为认识论不公的参考一元论在自动语音识别评估中的体现

arXiv cs.CL ↗ · 2026-05-11 缓存

本文批判了自动语音识别(ASR)评估中使用单一参考真实标准的做法,指出这会导致对失语症患者说话人的认识论不公。文章提出了一种新指标——认识论不公距离(EID),并提倡使用WER-Range(词错率范围)来考虑多样化的转录惯例。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈