Oído:在 5 美元微控制器上运行、性能超越 Whisper-tiny 的语音识别系统(开源)
摘要
Oído 是 Lokutor 推出的开源语音识别系统,可在 5 美元的 ESP32-S3 微控制器上运行 NVIDIA 的 Conformer-CTC Small(1300 万参数、int8),在 LibriSpeech 和嘈杂环境基准测试中均超越 Whisper tiny.en,且无需 GPU 或 NPU。
我是 Lokutor 团队的一员,这套系统由我们打造。所用模型为 NVIDIA Conformer-CTC Small(1300 万参数、int8),运行在配备 8 MB PSRAM 的 ESP32-S3 上,无需 GPU 或 NPU。在 LibriSpeech 上的 WER 为 3.7 / 8.2,而笔记本上运行的 Whisper tiny.en 为 6.3 / 15.9。在真实噪声环境(DEMAND:车内、厨房、食堂)叠加人声干扰和混响的条件下,平均 WER 为 8.4,对比 Whisper tiny.en 的 12.1。你可以在笔记本麦克风上使用 live_demo.py 实际体验这套芯片上的算术运算。https://github.com/lokutor-ai/oido
相似文章
Whisper Live - 一个近乎实时的Open AI Whisper实现,免费且开源
WhisperLive 是一个开源实时转录工具,使用OpenAI的Whisper,支持多种后端(如faster-whisper和TensorRT)用于实时语音转文字。
vaibhavs10/incredibly-fast-whisper
一个高度优化的OpenAI Whisper Large v3版本,使用Transformers、Optimum和Flash Attention 2,能够在Replicate上在2分钟内转录150分钟的音频。
@DataChaz:@NVIDIA 刚刚悄悄发布了一个极其令人印象深刻的语音识别模型,它彻底改变了本地语音处理的计算方式……
NVIDIA 悄然发布了 Nemotron-3.5-ASR,这是一个轻量级、参数规模为 0.6B 的开源语音识别模型,专为实时流式传输设计,支持 40 多种语言、低延迟和缓存感知架构。
@tom_doerr: 以70倍实时速度转录音频 https://github.com/m-bain/whisperX
WhisperX是一个用于快速自动语音识别的工具,提供词级时间戳和说话人分离,使用Whisper large-v2实现70倍实时转录。
Whisper 介绍
OpenAI 推出 Whisper,这是一个端到端的编码器-解码器 Transformer 模型,在大规模多样化音频数据上进行训练,可提供强大的多语言语音识别、语言识别和语音到英文翻译功能。Whisper 在多样化数据集上的错误率比专业模型低 50%,并且在语音翻译方面优于有监督基准,尽管未针对特定数据集进行微调。