Moonshine:用于实时转录和语音命令的语音识别
摘要
Moonshine 提出了一系列用于语音识别的编码器-解码器 Transformer 模型,这些模型采用了旋转位置编码(RoPE),专为实时转录和语音命令优化。与 Whisper tiny.en 相比,计算量减少了 5 倍,而词错误率没有增加。
查看缓存全文
缓存时间: 2026/07/20 09:37
论文页面 - Moonshine:用于实时转录和语音指令的语音识别
Source: https://huggingface.co/papers/2410.15608 发布于 2024年10月21日
摘要
Moonshine 是一种用于语音识别的编码器-解码器Transformer架构,采用旋转位置嵌入(RoPE),在不降低准确率的情况下减少了计算需求。
本文介绍了Moonshine,一个针对实时转录和语音指令处理优化的语音识别模型系列。Moonshine基于编码器-解码器Transformer (https://huggingface.co/papers?q=encoder-decoder%20transformer) 架构,采用旋转位置嵌入(RoPE)而非传统的绝对位置嵌入。该模型使用不同长度的语音片段进行训练,且不使用零填充 (https://huggingface.co/papers?q=zero-padding),从而在推理时提升了编码器的效率。与OpenAI的Whisper tiny.en相比,Moonshine Tiny在转录10秒语音片段时的计算需求降低了5倍,且在标准评估数据集上的词错误率没有增加。这些结果凸显了Moonshine在实时和资源受限应用中的潜力。
查看arXiv页面 (https://arxiv.org/abs/2410.15608) 查看PDF (https://arxiv.org/pdf/2410.15608) GitHub 9.36k auto (https://github.com/usefulsensors/moonshine) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2410.15608)
在您的代理中获取此论文:
hf papers read 2410.15608
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 31
UsefulSensors/moonshine 自动语音识别 • 更新于 Nov 30, 2025 • 95 (https://huggingface.co/UsefulSensors/moonshine)
UsefulSensors/moonshine-base 自动语音识别 • 61.5M • 更新于 Jan 30, 2025 • 39.6k • 47 (https://huggingface.co/UsefulSensors/moonshine-base)
UsefulSensors/moonshine-tiny 自动语音识别 • 27.1M • 更新于 Jan 30, 2025 • 155k • 44 (https://huggingface.co/UsefulSensors/moonshine-tiny)
keras/moonshine_tiny_en (https://huggingface.co/keras/moonshine_tiny_en)
浏览引用此论文的31个模型 (https://huggingface.co/models?other=arxiv:2410.15608)
引用此论文的数据集 0
无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2410.15608 以将其从此页面链接。
引用此论文的Space 24
浏览引用此论文的24个Space (https://huggingface.co/spaces?arxivIds=2410.15608)
包含此论文的收藏 3
相似文章
moonshine-ai/moonshine
Moonshine Voice 是一个开源 AI 工具包,用于构建实时、设备端的语音应用,提供语音转文字、文字转语音和对话代理功能,具备最先进的准确性。
@tom_doerr: 以70倍实时速度转录音频 https://github.com/m-bain/whisperX
WhisperX是一个用于快速自动语音识别的工具,提供词级时间戳和说话人分离,使用Whisper large-v2实现70倍实时转录。
Whisper Live - 一个近乎实时的Open AI Whisper实现,免费且开源
WhisperLive 是一个开源实时转录工具,使用OpenAI的Whisper,支持多种后端(如faster-whisper和TensorRT)用于实时语音转文字。
月光之味:面向边缘设备的小型专用ASR模型
本文介绍了“月光之味”(Flavors of Moonshine),一套面向边缘设备的小型专用ASR模型。作者证明,在人类标注、伪标注和合成数据的平衡混合上训练的单一语言模型,优于Whisper等更大的多语言模型,在小型模型中实现了最先进的错误率,并实现了对低资源语言的设备端ASR。
Whisper 介绍
OpenAI 推出 Whisper,这是一个端到端的编码器-解码器 Transformer 模型,在大规模多样化音频数据上进行训练,可提供强大的多语言语音识别、语言识别和语音到英文翻译功能。Whisper 在多样化数据集上的错误率比专业模型低 50%,并且在语音翻译方面优于有监督基准,尽管未针对特定数据集进行微调。